Quando l’AI entra nel workflow clinico: perché l’interazione uomo–AI cambia il significato della validazione

Quando si valuta un sistema di intelligenza artificiale in ambito sanitario, l’attenzione si concentra spesso sulle prestazioni del modello. Accuratezza, sensibilità, specificità e calibrazione sono misure fondamentali per capire come il sistema si comporta rispetto a un determinato compito.

Ma tra la previsione prodotta dal modello e la decisione clinica esiste uno spazio che le metriche, da sole, non descrivono.

Il professionista riceve un output, lo interpreta insieme alle altre informazioni disponibili, decide quanto considerarlo affidabile e infine prende una decisione. L’AI non opera quindi in isolamento: entra in un workflow già esistente e diventa una componente di un processo decisionale più ampio. [1,2]

Per questo, una domanda importante non è soltanto quanto bene funziona il modello, ma come il suo output viene utilizzato nel contesto reale. [1]

Dal modello alla decisione

Un sistema di supporto decisionale può essere rappresentato, in forma semplificata, attraverso una sequenza: dati del paziente → sistema AI → output → professionista → decisione → azione

La validazione tecnica riguarda soprattutto la prima parte della catena: il rapporto tra dati, previsione ed esito osservato. Quando il sistema entra nella pratica, però, diventano rilevanti anche i passaggi successivi. [1]

  • Chi riceve l’output?
  • In quale momento?
  • Con quali altre informazioni disponibili?
  • L’output viene mostrato come probabilità, categoria di rischio, raccomandazione o alert?
  • Il professionista comprende correttamente ciò che il sistema sta comunicando?

Queste domande non sostituiscono la valutazione tecnica, ma descrivono un livello diverso dello stesso problema. Un modello può produrre una previsione corrette, ma quella previsione può arrivare troppo tardi per influenzare la decisione. Può essere visualizzata da un professionista diverso da quello previsto, o interpretata come una diagnosi quando era stata progettata come semplice supporto.

La performance del modello può quindi rimanere invariata mentre cambia il significato operativo del suo output.

Lo stesso modello può diventare un sistema diverso

Immaginiamo che due ospedali utilizzino lo stesso modello per stimare il rischio di deterioramento di un paziente.

  • Ospedale A: Il punteggio compare nella cartella clinica come informazione aggiuntiva. Il medico può consultarlo insieme agli esami, ai sintomi e alla propria valutazione.
  • Ospedale B: Lo stesso punteggio genera automaticamente un alert visibile e attiva un percorso di escalation.

Il modello può essere identico. Anche il valore prodotto per uno stesso paziente può essere identico. Ma l’uso non lo è. Nel primo caso l’AI fornisce un’informazione tra molte; nel secondo, l’output entra direttamente in un processo organizzativo e può modificare priorità, tempi e responsabilità.

Questo significa che l’unità di analisi non può essere sempre limitata al modello: bisogna considerare anche il sistema nel suo utilizzo concreto. [1,2]

La domanda diventa quindi più specifica: non soltanto “questo modello è stato validato?”, ma:

“Le evidenze disponibili sostengono il modo in cui il suo output viene utilizzato qui?”

L’interazione uomo–AI non è soltanto una questione di interfaccia

Parlare di interazione uomo–AI può far pensare immediatamente all’usabilità: colori, pulsanti, organizzazione dello schermo o facilità di utilizzo. Sono aspetti importanti, ma il problema è più ampio. L’interazione riguarda anche il peso che l’output assume nella decisione.

Un professionista può affidarsi eccessivamente a una raccomandazione perché viene presentata con un livello di autorità che il sistema non dovrebbe avere. In altri casi può accadere il contrario: alert frequenti o poco pertinenti possono essere progressivamente ignorati. [1,2]

Esiste poi il problema del disaccordo. Cosa accade quando il professionista ritiene che l’output dell’AI non sia appropriato per quel paziente? La possibilità tecnica di ignorare o modificare una raccomandazione non risponde, da sola, alla domanda. Bisogna capire quale ruolo il sistema assume nel processo decisionale e se l’autonomia professionale rimane effettivamente esercitabile. [2]

La supervisione umana, quindi, non coincide semplicemente con la presenza di una persona davanti allo schermo. Una persona può essere formalmente presente e avere, allo stesso tempo, pochissimo spazio reale per mettere in discussione l’output del sistema.

Un alert senza responsabilità non è un controllo

L’interazione tra AI e professionista porta anche a una questione organizzativa: chi deve agire?

Supponiamo che un sistema identifichi correttamente un paziente ad alto rischio e generi un alert. Dal punto di vista del modello, il risultato può essere corretto. Ma se non è chiaro chi debba ricevere l’alert, entro quanto tempo debba essere valutato o quale azione sia attesa, la correttezza della previsione non garantisce l’efficacia del processo.

Il problema non è più soltanto algoritmico. È un problema di workflow.

Lo stesso vale quando più professionisti interagiscono con il sistema:

  • Chi è responsabile della valutazione dell’output?
  • Chi può ignorarlo?
  • Chi verifica che un alert sia stato preso in carico?

La tecnologia può produrre informazioni, ma il workflow determina come quelle informazioni diventano, oppure non diventano, azioni. [1,2]

Anche il fallimento fa parte dell’ambiente di utilizzo

Un altro modo per comprendere il ruolo del contesto è chiedersi cosa succede quando il sistema non funziona come previsto. Il servizio può essere temporaneamente indisponibile, alcuni dati possono mancare, un’integrazione con il sistema informativo può fallire o l’output può arrivare quando la decisione è già stata presa.

Queste situazioni non dimostrano necessariamente un difetto del modello, ma mostrano che il modello dipende da un ambiente di esecuzione. Per questo è utile considerare anche le condizioni di fallback: come continua il processo quando l’AI non è disponibile?

La risposta non può essere universale, poiché dipende dal tipo di sistema, dalla decisione supportata e dal contesto clinico. Il punto importante è che se il funzionamento sicuro di un processo dipende dalla disponibilità di un sistema AI, allora anche la gestione della sua indisponibilità fa parte delle condizioni reali del suo utilizzo. [1,2]

Il workflow modifica il significato delle evidenze

Questo porta a una conseguenza importante per la validazione. Le evidenze prodotte su un modello non descrivono automaticamente ogni possibile modo di utilizzarlo.

Una sensitivity elevata dimostra qualcosa sul comportamento predittivo del modello nella popolazione e nelle condizioni analizzate. Non dimostra, da sola, che un determinato alert sia presentato nel momento corretto, che venga interpretato correttamente o che il workflow assegni chiaramente la responsabilità dell’azione.

Sono domande diverse e richiedono evidenze diverse. Questo non significa che ogni differenza organizzativa renda inutilizzabile una validazione precedente. Significa che bisogna evitare di estendere una conclusione oltre ciò che le evidenze permettono effettivamente di sostenere.

Lo stesso modello può essere inserito in workflow differenti, utilizzato da professionisti differenti e collegato a decisioni con conseguenze differenti. La validità dell’uso non può quindi essere dedotta esclusivamente dalla validità tecnica del modello. [1]

Dalla performance del modello al sistema in uso

L’AI clinica viene spesso descritta come se la sequenza fosse semplice: input → modello → output

Nella pratica, la sequenza è più lunga: input → modello → output → interpretazione → decisione → azione

Ed è proprio nella seconda parte che entrano in gioco il professionista, il workflow e l’organizzazione. Per questo l’analisi dell’interazione uomo–AI non dovrebbe essere considerata un controllo accessorio effettuato dopo la validazione tecnica, ma una parte necessaria per comprendere che cosa il sistema sta realmente facendo nel contesto in cui viene utilizzato. [1,2]

La domanda non è se l’essere umano sia “nel loop” in senso formale, ma quale ruolo abbia realmente nel processo:

  • Vede l’output prima o dopo aver formulato il proprio giudizio?
  • Comprende i limiti dell’informazione ricevuta?
  • Può discostarsene?
  • Il disaccordo è gestito?
  • L’azione successiva è chiaramente attribuita?
  • Esiste una modalità operativa quando il sistema non è disponibile?

Sono domande semplici da formulare, ma le risposte possono cambiare completamente il significato dello stesso output.

Conclusione

Un buon modello non coincide automaticamente con un buon processo decisionale.

Quando un sistema AI entra in un ambiente clinico, la sua performance continua a essere fondamentale, ma diventa una componente di un sistema più ampio formato da dati, tecnologia, professionisti, procedure e responsabilità. [1,2]

Per questo, la domanda “il modello funziona?” dovrebbe sempre essere accompagnata da una seconda domanda:

“Il suo output sostiene la decisione prevista, per il professionista previsto e nelle condizioni in cui viene realmente utilizzato?”

È in questo passaggio che l’interazione uomo–AI diventa una questione di validità e non soltanto di usabilità.

Valutare l’AI nel workflow significa quindi rendere visibile ciò che accade tra la previsione e l’azione: chi interpreta l’output, quale peso gli attribuisce, come viene gestito il disaccordo, chi assume la responsabilità e cosa accade quando le condizioni previste non sono presenti.

Perché, nel contesto reale, non è il modello da solo a prendere una decisione. È il sistema in uso a produrre conseguenze.

Riferimenti

  1. Vasey, B., Nagendran, M., Campbell, B., et al. (2022). “Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI.” Nature Medicine, 28, 924-933. DOI: 10.1038/s41591-022-01772-9.
  2. World Health Organization (2021). “Ethics and governance of artificial intelligence for health: WHO guidance.” Geneva: World Health Organization. ISBN 978-92-4-002920-0.

Pubblicato

in

da

Commenti

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Share with