Hallucinations de l'IA en médecine : comment vérifier une réponse
Références inventées, faux détails repris : ce que montrent les études sur les hallucinations de l'IA en médecine, et une méthode pour vérifier une réponse.
Une réponse d'IA peut être claire, bien structurée, assortie de références… et fausse. C'est ce que l'on appelle une « hallucination » : le modèle produit une information plausible qui ne correspond à aucune réalité. En médecine, où une erreur de dose, de contre-indication ou de diagnostic peut avoir des conséquences graves, savoir repérer et vérifier ces erreurs est devenu une compétence clinique à part entière.
Pourquoi les modèles « hallucinent »
Un modèle de langage ne consulte pas une base de connaissances vérifiée : il génère, mot après mot, la suite la plus probable compte tenu de la question et de ce qu'il a appris. Quand l'information manque, est rare ou ambiguë, il ne s'arrête pas forcément : il comble le vide avec un contenu vraisemblable. Le style reste assuré, ce qui rend l'erreur difficile à détecter.
Ce que montrent les études
Des références inventées
En 2023, une étude publiée dans Cureus a demandé à ChatGPT (version 3.5) de rédiger 30 courts articles médicaux référencés. Sur 115 références produites, 47 % étaient totalement inventées et 46 % existaient mais comportaient des erreurs ; seules 7 % étaient à la fois authentiques et exactes. Les modèles récents font mieux, notamment lorsqu'ils peuvent effectuer une recherche, mais le risque n'a pas disparu.
Des faux détails repris et développés
En 2025, des chercheurs du Mount Sinai ont publié dans Communications Medicine une évaluation de plusieurs grands modèles à partir de 300 vignettes cliniques, chacune contenant un élément inventé : un examen biologique inexistant, un signe radiologique fictif ou une maladie imaginaire. Les modèles ont fréquemment repris ce faux détail et l'ont même expliqué, dans jusqu'à 83 % des cas selon les conditions. Une consigne demandant explicitement la prudence réduisait environ de moitié le taux d'erreur ; pour le modèle le plus performant de l'étude (GPT-4o), il passait de 53 % à 23 %. Baisser la « température » du modèle n'apportait pas d'amélioration significative.
Leçon pratique : si la question contient une erreur, l'IA risque de la confirmer plutôt que de la corriger.
Les hallucinations de la transcription
Le phénomène ne concerne pas que les assistants conversationnels. Une étude présentée en 2024 à la conférence ACM FAccT a montré qu'environ 1 % des transcriptions audio produites par le modèle de reconnaissance vocale Whisper contenaient des phrases inventées, souvent lors de silences ; une part notable de ces ajouts était potentiellement préjudiciable. Toute transcription automatique doit donc être relue.
Les signaux d'alerte
Certaines caractéristiques doivent déclencher une vérification immédiate :
- une référence précise (auteurs, revue, année) que vous ne connaissez pas ;
- un chiffre exact (pourcentage, posologie, seuil) sans source vérifiable ;
- une réponse qui valide sans nuance une hypothèse formulée dans la question ;
- un nom de test, de score ou de syndrome inhabituel ;
- une réponse qui change quand on repose la même question autrement.
Une méthode de vérification en cinq étapes
- Reformuler la question sans orienter : éviter « confirmez que… » ; demander plutôt les diagnostics différentiels ou les arguments pour et contre.
- Demander les incertitudes : inviter le modèle à signaler ce qu'il ne sait pas ou ce qui est controversé.
- Remonter à la source primaire : vérifier chaque référence dans PubMed ou sur le site de l'éditeur ; chaque recommandation dans le texte officiel de la société savante ou de l'autorité sanitaire.
- Contrôler les données critiques : doses, interactions et contre-indications se vérifient dans le résumé des caractéristiques du produit ou un référentiel thérapeutique reconnu, jamais dans la réponse d'un assistant.
- Confronter au contexte clinique : la réponse est-elle cohérente avec le patient, l'épidémiologie locale, les moyens disponibles ?
Le piège du biais d'automatisation
Les lignes directrices de l'OMS sur les grands modèles d'IA en santé (2024) mettent en garde contre le biais d'automatisation : la tendance à accepter une proposition de la machine même quand on aurait détecté l'erreur seul. Ce biais augmente avec la fatigue et la pression du temps, exactement les conditions de la pratique quotidienne. Une règle simple aide : ne jamais intégrer une réponse d'IA dans un dossier sans pouvoir citer une source indépendante qui la confirme.
Quels usages limitent le risque ?
| Type de tâche | Risque d'hallucination | Pourquoi |
|---|---|---|
| Reformuler un texte fourni | Faible | Le contenu de départ est connu |
| Résumer un document fourni | Modéré | Omissions ou ajouts possibles, comparaison facile |
| Répondre à une question factuelle ouverte | Élevé | Le modèle peut inventer |
| Citer des références | Élevé | Risque documenté de références fictives |
| Dose, interaction, contre-indication | Critique | Vérification obligatoire dans un référentiel |
En pratique
- Traitez toute réponse d'IA comme un brouillon à vérifier, jamais comme une source.
- Vérifiez chaque référence et chaque chiffre dans la source primaire avant usage.
- Posez des questions neutres et demandez explicitement les incertitudes.
- Ne prenez jamais une dose ou une contre-indication dans une réponse d'IA sans contrôle dans un référentiel.
- Relisez toute transcription automatique : la reconnaissance vocale peut aussi inventer.
Questions fréquentes
Qu'est-ce qu'une hallucination d'IA en médecine ?
Une information plausible mais fausse produite par un modèle d'IA : référence inexistante, chiffre erroné, examen ou signe inventé.
Comment vérifier une référence donnée par ChatGPT ?
En la recherchant dans PubMed ou sur le site de la revue : titre, auteurs, année et contenu doivent correspondre exactement.
Les hallucinations disparaissent-elles avec les nouveaux modèles ?
Elles diminuent, mais les études de 2025 montrent qu'elles persistent, notamment quand la question contient elle-même une erreur.
Sources
- Cureus — High Rates of Fabricated and Inaccurate References in ChatGPT-Generated Medical Content (2023)
- Communications Medicine — Multi-model assurance analysis showing LLMs are highly vulnerable to adversarial hallucination attacks (PubMed, 2025)
- Healthcare IT News — Mount Sinai experts compare hallucinations across 6 LLMs
- arXiv — Koenecke et al., Careless Whisper: Speech-to-Text Hallucination Harms (2024)
- OMS — WHO releases AI ethics and governance guidance for large multi-modal models (2024)
Nabady Whisper transcrit votre voix hors ligne, en français, en arabe ou en anglais, avec des modèles de comptes rendus par spécialité.
Article d'information générale, vérifié à la date de publication ; il ne remplace ni un avis médical ni un conseil juridique.