Intelligenza artificiale in medicina legale: è affidabile?

Medico legale di spalle a una scrivania luminosa che verifica la documentazione clinica in una cartellina azzurra, con il portatile chiuso accanto

Guida all'articolo

    Quando il Medico Legale chiede a un chatbot generalista di un barème, di un nesso causale o di una sentenza, la risposta arriva in pochi secondi, ben scritta e senza esitazioni. Quella sicurezza è il punto da governare: in un elaborato peritale ogni affermazione deve poter essere ricondotta a una fonte e difesa nel contraddittorio.

    Sull'affidabilità dell'intelligenza artificiale in medicina esiste ormai una letteratura che permette di andare oltre gli slogan, in entrambe le direzioni. Questa rassegna di studi e norme risponde a tre domande: dove sbaglia un'AI generalista, come il professionista riconosce un output inaffidabile e che cosa serve per potersi fidare. Ogni dato porta modello, anno e limite dello studio.

    Si può usare ChatGPT per scrivere una perizia medico-legale?

    Come strumento di supporto, sì, purché resti tale: la legge italiana confina l'IA alle attività strumentali e lascia la valutazione al professionista. La L. 23 settembre 2025, n. 132, all'art. 13, comma 1, la limita nelle professioni intellettuali «al solo esercizio delle attività strumentali e di supporto all'attività professionale e con prevalenza del lavoro intellettuale oggetto della prestazione d'opera». Per prevenzione, diagnosi e cura, l'art. 7, comma 5 lascia la decisione «sempre rimessa agli esercenti la professione medica».

    I primi studi medico-legali sugli errori di ChatGPT e dei modelli simili in perizia spiegano perché il confine conta. In un lavoro francese pubblicato nel 2026 su International Journal of Legal Medicine (Bérar e colleghi), ChatGPT-4 Turbo, Gemini e Mistral, interrogati nel 2025 cinque volte su ciascuno di nove casi fittizi di responsabilità sanitaria, hanno concordato con un panel di tre esperti in 86 richieste su 135, e tutti e tre si sono contraddetti almeno una volta sullo stesso caso. Per gli autori, oggi questi limiti ne impediscono l'uso in perizia. Un lavoro di Tor Vergata su sei casi di responsabilità sanitaria, presentato al congresso SIMLA 2026, conclude che gli elaborati dell'IA «non appaiono autonomamente adeguati alla redazione di elaborati peritali senza supervisione medico-legale specialistica».

    La formula più chiara viene da un tribunale. In Mata v. Avianca (Southern District of New York, ordinanza sulle sanzioni del 22 giugno 2023) due avvocati che avevano depositato sei precedenti inesistenti generati da ChatGPT sono stati sanzionati con 5.000 dollari. Per il giudice usare un'IA affidabile come supporto è legittimo, e le regole assegnano comunque al professionista un ruolo di filtro sull'accuratezza di ciò che deposita (traduzione nostra).

    Cosa sono le allucinazioni dell'AI e perché pesano in una perizia?

    Un'allucinazione è un contenuto falso o errato presentato con sicurezza. Il profilo NIST AI 600-1 la chiama confabulazione, esito naturale di modelli che generano testo approssimando la distribuzione statistica dei dati di addestramento. Secondo un preprint di ricercatori di OpenAI, non ancora sottoposto a revisione, i modelli tirano a indovinare quando sono incerti perché l'addestramento premia il tentativo più dell'ammissione di incertezza.

    Il Tribunale di Firenze (Sez. specializzata Imprese, ordinanza 14 marzo 2025, R.G. 11053/2024), davanti a sentenze di Cassazione inesistenti trovate con ChatGPT e citate in una comparsa, ha descritto il fenomeno come il caso in cui «l'IA inventi risultati inesistenti ma che, anche a seguito di una seconda interrogazione, vengono confermati come veritieri». Ha respinto la domanda ex art. 96 c.p.c., lasciando fermo «il disvalore relativo all'omessa verifica».

    In ambito medico le citazioni inventate sono state misurate. In uno studio italiano di anatomia patologica (Guastafierro e colleghi, Virchows Archiv 2025), dei 214 riferimenti bibliografici forniti dalla versione gratuita di ChatGPT dell'epoca (serie GPT-3.5, risultati diffusi a inizio 2024) il 70,1% era corretto, il 12,1% inesatto e il 17,8% inesistente o riferito a un lavoro diverso. Istruire il modello con fonti di settore non basta: a Catania (Ministeri e colleghi, 2026) due GPT personalizzati con riferimenti medico-legali, uno orientato «pro paziente» e uno «pro struttura», hanno prodotto riferimenti inventati o non verificabili su dieci casi reali, il primo in misura maggiore (OR 3,74). In perizia una citazione inesistente si scopre in pochi minuti e getta un'ombra sull'intero elaborato.

    Quanto sbaglia un'AI generalista sulle domande mediche?

    Dipende da modello, compito e modo di interrogarla. Lo studio di anatomia patologica ha raccolto 894 valutazioni di sei patologi su 50 scenari: il 32,1% delle risposte di ChatGPT era privo di errori, eppure il 62,2% è stato giudicato utile alla diagnosi. Una risposta può orientare bene e contenere un errore che solo un lettore esperto riconosce.

    Uno studio milanese su 28 casi neurologici reali (Maiorana e colleghi, Journal of Medical Internet Research 2025) ha misurato un'accuratezza diagnostica del 75% per i neurologi, del 54% per ChatGPT-3.5 e del 46% per Gemini, nelle versioni gratuite di settembre 2024. Modelli di generazione precedente e campione piccolo: il divario va misurato di nuovo sui modelli attuali.

    Due studi su Nature Medicine del 2026 guardano ai casi gravi e all'uso reale. Nella valutazione indipendente di ChatGPT Health (Ramaswamy e colleghi, 60 scenari, 960 risposte) il 52% delle emergenze è stato indirizzato a un'urgenza inferiore, mentre ictus e anafilassi classici erano gestiti correttamente. In un trial su 1.298 persone (Bean e colleghi) GPT-4o, Llama 3 e Command R+ da soli identificavano la condizione nel 94,9% dei casi, chi li usava al massimo nel 34,5%, senza superare il gruppo di controllo. Sono test di triage per il pubblico; mostrano che l'errore può cadere sui casi più gravi e che il problema sta anche nell'interazione fra persona e modello.

    L'AI valuta il danno come il Medico Legale?

    Dipende dallo strumento e dal caso, e sull'affidabilità dell'intelligenza artificiale nella valutazione del danno gli studi non concordano: con i chatbot generalisti si va da una concordanza quasi nulla a una stretta, e la distanza cresce nei casi complessi e al confine tra categorie. I dati italiani vengono soprattutto da lavori presentati al 47° Congresso nazionale SIMLA (Roma, giugno 2026), raccontato nel resoconto del congresso SIMLA 2026: contributi congressuali, senza revisione completa, da leggere come segnali.

    Nel lavoro della Federico II «Homo vs Machina», 61 certificazioni di esiti di fratture sono state sottoposte a ChatGPT e Gemini (versioni non indicate) con il vincolo esplicito del D.M. 3 luglio 2003 e di un estratto delle Linee Guida SIMLA. La concordanza con lo specialista è risultata lieve (κ 0,05 per Gemini, 0,01 per ChatGPT), e lieve anche tra le due IA (0,15), con discordanza massima nei postumi complessi e al confine tra micro e macropermanenti, attorno alla soglia del 9% della tabella di legge (sul calcolo, la guida alle micropermanenti).

    Il lavoro su 100 CTU in responsabilità civile (Camerino, Macerata, Perugia) mette alla prova un sistema di supporto decisionale sviluppato dagli stessi autori, ancorato al D.M. 3 luglio 2003 e alle Linee Guida SIMLA 2016: nessun chatbot commerciale entra nel confronto. Errore assoluto medio 3,30 punti (mediana 1,70), 87 casi su 100 entro 5 punti; l'errore sale da 2,13 punti sulle micropermanenti a 19,17 sui sei casi oltre il 25%. Per gli autori pesa soprattutto l'eterogeneità del linguaggio clinico nella documentazione.

    Sul pregiudizio estetico, uno studio pilota su sette casi ha trovato ChatGPT, Gemini e Claude più omogenei tra loro e discordanti dai valutatori umani, che però concordavano pochissimo anche tra loro. E un dato peer-reviewed va nella direzione opposta: su 20 sinossi tratte da CTU (Blandino e colleghi, International Journal of Legal Medicine 2026) un LLM, modello non indicato nell'abstract, ha mostrato una concordanza stretta con il CTU sul danno biologico (bias +0,05; r 0,95), attribuendo però alla sofferenza morale valori sistematicamente più alti degli umani (sul metodo, la guida al danno morale in perizia).

    Studio Che cosa confronta Risultato principale Limite da tenere presente
    «Homo vs Machina»
    Federico II di Napoli, poster SIMLA 2026
    61 certificazioni di esiti di fratture valutate da ChatGPT e Gemini e dallo specialista, con vincolo al D.M. 3 luglio 2003 Concordanza lieve: κ 0,01 (ChatGPT) e 0,05 (Gemini) con lo specialista, 0,15 tra le due IA. Discordanza massima nei postumi complessi e al confine tra micro e macropermanenti Contributo congressuale; versioni dei modelli non indicate
    100 CTU in responsabilità civile
    Camerino, Macerata e Perugia, poster SIMLA 2026
    Sistema di supporto decisionale sviluppato dagli autori, ancorato a D.M. 3 luglio 2003 e Linee Guida SIMLA 2016, contro le percentuali dei CTU Errore medio 3,30 punti (mediana 1,70), 87 casi su 100 entro 5 punti; errore medio di 19,17 punti sui 6 casi oltre il 25% Contributo congressuale; strumento di ricerca, nessun chatbot commerciale; pochi casi gravi
    Pregiudizio estetico
    Federico II di Napoli, poster SIMLA 2026
    7 casi valutati da ChatGPT, Gemini e Claude e da 30 valutatori umani di diversa esperienza Stime delle IA più omogenee tra loro e discordanti da quelle umane; anche i gruppi umani concordano pochissimo tra loro Contributo congressuale; campione ridotto
    Sei casi di responsabilità sanitaria
    Tor Vergata, poster SIMLA 2026
    Due elaborati prodotti con l'IA confrontati con l'elaborato di un ATP ex art. 696-bis c.p.c. Buona ricostruzione della vicenda clinica; uno dei due elaborati tende a sovrastimare responsabilità, nesso causale e danno Contributo congressuale; analisi qualitativa
    Blandino e colleghi
    International Journal of Legal Medicine, 2026
    20 sinossi da CTU in responsabilità civile, valutate da 15 medici di diversa esperienza e da un LLM Concordanza stretta con il CTU sul danno biologico (bias +0,05; r 0,95); sofferenza morale stimata sistematicamente più alta Studio pilota; modello non indicato nell'abstract
    Bérar e colleghi
    International Journal of Legal Medicine, 2026
    ChatGPT-4 Turbo, Gemini e Mistral su 9 casi fittizi di responsabilità sanitaria, contro un panel di 3 esperti 86 richieste concordi su 135; tutti e tre i modelli si contraddicono almeno una volta sullo stesso caso Casi fittizi; interrogazioni del 2025
    Ministeri e colleghi
    International Journal of Legal Medicine, 2026
    Due GPT personalizzati con riferimenti medico-legali, «pro paziente» e «pro struttura», su 10 casi reali Tra i due GPT, concordanza sostanziale sulla sintesi clinica (κ 0,804) e lieve sulle stime di invalidità permanente (κ 0,167); più riferimenti inventati o non verificabili nel modello «pro paziente» (OR 3,74) Studio pilota su 10 casi

    I risultati non sono univoci, ma in più lavori l'IA se la cava meglio sulla ricostruzione dei fatti clinici (a Tor Vergata entrambi gli elaborati ricostruiscono bene la vicenda) e diverge di più dove serve il giudizio valutativo: casi complessi, soglie tra categorie, voci a forte componente soggettiva. A Catania i due GPT personalizzati, confrontati fra loro, hanno mostrato κ 0,804 sulla sintesi clinica e κ 0,167 sulle stime di invalidità permanente.

    Perché la stessa domanda riceve risposte diverse?

    Perché un modello generativo produce ogni volta una risposta nuova, e piccole differenze di formulazione o di contesto possono cambiarne la conclusione. Su 10.980 triage simulati (Franc e colleghi, CJEM 2024), la sola ripetizione dello stesso prompt spiegava il 21,0% della variazione delle risposte di ChatGPT. Nel test su ChatGPT Health bastava un familiare che minimizzava i sintomi per spostare la raccomandazione verso cure meno urgenti (OR 11,7 nei casi limite).

    Per una perizia è un difetto strutturale. Il Codice di Deontologia Medica, all'art. 62, chiede al medico consulente di parte di interpretare le evidenze «nel rispetto dell'oggettività del caso in esame e di un confronto scientifico rigoroso e fondato». Gli indirizzi applicativi dell'Associazione Medico-Legale Ambrosiana per le consulenze, al §5.1, promuovono un'analisi fondata su linee guida, buone pratiche accreditate e, in mancanza, revisioni sistematiche e metanalisi, con conclusioni che «non devono limitarsi ad essere assertive». Il documento non parla di IA; la lettura che ne diamo è che sia lo stesso metro con cui giudicare un output dell'IA: una conclusione che cambia a ogni interrogazione senza dichiarare le proprie basi non lo soddisfa.

    Qual è la differenza tra AI generalista e AI specializzata in medicina legale?

    Sta nel punto da cui il sistema prende le risposte. Un modello generalista le genera dalla conoscenza statistica appresa in addestramento; un sistema specializzato le ancora a fonti del dominio che può mostrare: per la medicina legale italiana barème, tabelle di legge, linee guida, giurisprudenza di legittimità. La lingua conta: una revisione sistematica sugli LLM con recupero di fonti in sanità (Amugongo e colleghi, PLOS Digital Health 2025) rileva che il 78,9% degli studi usa dataset in inglese. Le differenze di prodotto sono trattate nel confronto sulle differenze tra ChatGPT Salute e Docsy.

    Il RAG riduce le allucinazioni?

    Sì, le riduce senza eliminarle. Il RAG (retrieval-augmented generation) ancora le risposte del modello a fonti esterne recuperate al momento della domanda. Una meta-analisi di 20 studi in biomedicina (Liu, McCoy e Wright, JAMIA 2025) stima un miglioramento rispetto al modello di base con odds ratio 1,35 (IC 95% 1,19-1,53).

    Il limite è misurato. A Stanford, la prima valutazione preregistrata di strumenti giuridici commerciali basati su RAG (Magesh e colleghi, Journal of Empirical Legal Studies 2025) ha trovato che sistemi presentati come capaci di eliminare le allucinazioni allucinavano tra il 17% e il 33% delle volte, comunque meno di GPT-4 generalista. E una fonte citata può non sostenere l'affermazione: su domande mediche poste a sette LLM (Wu e colleghi, Nature Communications 2025) tra il 50% e il 90% delle risposte non era pienamente supportato dalle fonti citate, e anche GPT-4o con ricerca web lasciava circa il 30% delle affermazioni senza supporto. Per questo la fonte vale se è ispezionabile: solo aprendola il professionista controlla che dica ciò che la risposta le attribuisce.

    Come riconosce il Medico Legale un output inaffidabile?

    Con i controlli che userebbe sull'elaborato di un collaboratore, sapendo che il rischio più insidioso è l'automation bias, la tendenza a privilegiare i suggerimenti automatici. Su 27 radiologi (Dratsch e colleghi, Radiology 2023) le letture corrette passavano dal 79,7% con un suggerimento dell'IA corretto al 19,8% con uno volutamente errato tra i meno esperti, e dall'82,3% al 45,5% tra i più esperti. In quattro centri endoscopici polacchi (Budzyń e colleghi, 2025) il tasso di adenomi individuati nelle colonscopie senza IA è sceso dal 28,4% al 22,4% dopo l'introduzione dello strumento.

    Che l'abitudine al supporto automatico attenui il senso di responsabilità non ha ancora una misura diretta in medicina legale: è un rischio che queste evidenze rendono concreto. Una revisione sistematica di riferimento (Goddard e colleghi, JAMIA 2012) indica tra i correttivi la formazione, l'enfasi sulla responsabilità dell'utente e un livello di confidenza associato all'output. In pratica, i segnali da cercare sono sei:

    • Fonti assenti o non apribili. Un riferimento che non si ritrova va trattato come inesistente.
    • Fonte che non sostiene l'affermazione. Il riferimento esiste, ma dice altro o dice meno.
    • Conclusione assertiva. Percentuale o nesso arrivano senza il passaggio che li lega al barème o alla linea guida.
    • Risposta instabile. Riformulando o ripetendo la domanda, la conclusione cambia.
    • Casi di confine. Postumi complessi, soglia tra micro e macropermanenti, voci soggettive: lì la discordanza misurata è massima.
    • Tesi sbilanciata. Responsabilità attribuita per il solo mancato risultato, senza una condotta censurabile individuata.

    Cosa serve per fidarsi di un'AI in medicina legale?

    Tre requisiti, gli stessi che le evidenze indicano come correttivi: risposte ancorate a fonti del dominio italiano, fonti che il professionista può aprire, e un segnale esplicito quando la risposta non è coperta dalle fonti. Anche la L. 132/2025, all'art. 7, comma 6, chiede che i sistemi di IA usati in sanità siano «affidabili, periodicamente verificati e aggiornati».

    Su questo terreno è costruito Ragiona con Docsy, la chat con l'AI verticale medico-legale di Docsy, separata dalla produzione degli elaborati. Docsy cerca le risposte tra le fonti autorevoli della propria knowledge interna (normativa medico-legale italiana, giurisprudenza, barème, tabelle di riferimento, dottrina). I riferimenti numerati sono cliccabili e aprono titolo ed estratto della fonte; quando una risposta non poggia su fonti strutturate, l'interfaccia dichiara che si basa sulla conoscenza generica del modello. Se la copertura delle fonti è parziale compare l'avviso «Risposta da verificare», e se manca una conferma diretta l'interfaccia invita a verificare con una fonte autorevole prima di inserire la risposta in un referto o in un atto.

    L'avviso è un'autovalutazione del modello, non una certificazione: ancorare le risposte a fonti verificate riduce le allucinazioni, e nessun sistema le azzera. Sono scelte di progetto che rispondono ai problemi documentati qui, e nessuno degli studi citati ha valutato Docsy. Il metro resta quello del Codice deontologico e degli indirizzi AMLA: conclusioni motivate su basi scientifiche dichiarate. Docsy prepara il materiale e mostra da dove viene, il Medico Legale verifica e decide. Per vedere come Ragiona con Docsy mostra la fonte di ogni risposta e segnala quando va verificata, richieda una demo gratuita di Docsy.

    Domande frequenti

    L'AI Act obbliga il medico legale a formarsi sull'intelligenza artificiale?

    Non in questi termini. L'art. 4 del Regolamento (UE) 2024/1689 (AI Act), applicabile dal 2 febbraio 2025 e oggi nel testo sostituito dal Regolamento (UE) 2026/1744, chiede a fornitori e deployer di adottare misure volte a sostenere lo sviluppo dell'alfabetizzazione in materia di IA del proprio personale, senza imporre di garantirne un livello specifico. Il Medico Legale che usa un sistema di IA nella propria attività professionale è un deployer.

    La legge italiana chiede che l'AI usata in sanità sia affidabile?

    Sì, e si rivolge ai sistemi e ai dati (art. 7, comma 6 della L. 132/2025): è un requisito di qualità dello strumento, senza un obbligo testuale per il medico di sceglierne uno specifico.

    Il medico legale deve dire al cliente che usa l'AI?

    L'art. 13, comma 2 della L. 132/2025 prevede che le informazioni sui sistemi di IA utilizzati dal professionista siano comunicate al destinatario della prestazione «con linguaggio chiaro, semplice ed esaustivo», per assicurare il rapporto fiduciario.

    ChatGPT rispetta il GDPR con i dati sanitari?

    È una questione distinta dall'affidabilità delle risposte: riguarda i dati affidati al fornitore. Criteri contrattuali e scelte operative sono nella guida su privacy dei dati sanitari, AI e cloud per medici legali.

    Chi è responsabile se l'AI sbaglia una perizia?

    La decisione resta del professionista, come stabilisce la L. 132/2025, e con essa la firma dell'elaborato. Il D.Lgs. 9 settembre 2026, n. 160 ha introdotto l'art. 437-bis c.p. per l'utilizzatore professionale di IA ad alto rischio che omette la sorveglianza umana; il quadro completo è nell'articolo sulla responsabilità del medico legale che usa l'AI nelle perizie.

    Continua la lettura