Hallucinations de l'IA en médecine : comment vérifier une réponse

Références inventées, faux détails repris : ce que montrent les études sur les hallucinations de l'IA en médecine, et une méthode pour vérifier une réponse.

Hallucinations de l'IA en médecine : comment vérifier une réponse

Une réponse d'IA peut être claire, bien structurée, assortie de références… et fausse. C'est ce que l'on appelle une « hallucination » : le modèle produit une information plausible qui ne correspond à aucune réalité. En médecine, où une erreur de dose, de contre-indication ou de diagnostic peut avoir des conséquences graves, savoir repérer et vérifier ces erreurs est devenu une compétence clinique à part entière.

Pourquoi les modèles « hallucinent »

Un modèle de langage ne consulte pas une base de connaissances vérifiée : il génère, mot après mot, la suite la plus probable compte tenu de la question et de ce qu'il a appris. Quand l'information manque, est rare ou ambiguë, il ne s'arrête pas forcément : il comble le vide avec un contenu vraisemblable. Le style reste assuré, ce qui rend l'erreur difficile à détecter.

Ce que montrent les études

Des références inventées

En 2023, une étude publiée dans Cureus a demandé à ChatGPT (version 3.5) de rédiger 30 courts articles médicaux référencés. Sur 115 références produites, 47 % étaient totalement inventées et 46 % existaient mais comportaient des erreurs ; seules 7 % étaient à la fois authentiques et exactes. Les modèles récents font mieux, notamment lorsqu'ils peuvent effectuer une recherche, mais le risque n'a pas disparu.

Des faux détails repris et développés

En 2025, des chercheurs du Mount Sinai ont publié dans Communications Medicine une évaluation de plusieurs grands modèles à partir de 300 vignettes cliniques, chacune contenant un élément inventé : un examen biologique inexistant, un signe radiologique fictif ou une maladie imaginaire. Les modèles ont fréquemment repris ce faux détail et l'ont même expliqué, dans jusqu'à 83 % des cas selon les conditions. Une consigne demandant explicitement la prudence réduisait environ de moitié le taux d'erreur ; pour le modèle le plus performant de l'étude (GPT-4o), il passait de 53 % à 23 %. Baisser la « température » du modèle n'apportait pas d'amélioration significative.

Leçon pratique : si la question contient une erreur, l'IA risque de la confirmer plutôt que de la corriger.

Les hallucinations de la transcription

Le phénomène ne concerne pas que les assistants conversationnels. Une étude présentée en 2024 à la conférence ACM FAccT a montré qu'environ 1 % des transcriptions audio produites par le modèle de reconnaissance vocale Whisper contenaient des phrases inventées, souvent lors de silences ; une part notable de ces ajouts était potentiellement préjudiciable. Toute transcription automatique doit donc être relue.

Les signaux d'alerte

Certaines caractéristiques doivent déclencher une vérification immédiate :

  • une référence précise (auteurs, revue, année) que vous ne connaissez pas ;
  • un chiffre exact (pourcentage, posologie, seuil) sans source vérifiable ;
  • une réponse qui valide sans nuance une hypothèse formulée dans la question ;
  • un nom de test, de score ou de syndrome inhabituel ;
  • une réponse qui change quand on repose la même question autrement.

Une méthode de vérification en cinq étapes

  1. Reformuler la question sans orienter : éviter « confirmez que… » ; demander plutôt les diagnostics différentiels ou les arguments pour et contre.
  2. Demander les incertitudes : inviter le modèle à signaler ce qu'il ne sait pas ou ce qui est controversé.
  3. Remonter à la source primaire : vérifier chaque référence dans PubMed ou sur le site de l'éditeur ; chaque recommandation dans le texte officiel de la société savante ou de l'autorité sanitaire.
  4. Contrôler les données critiques : doses, interactions et contre-indications se vérifient dans le résumé des caractéristiques du produit ou un référentiel thérapeutique reconnu, jamais dans la réponse d'un assistant.
  5. Confronter au contexte clinique : la réponse est-elle cohérente avec le patient, l'épidémiologie locale, les moyens disponibles ?

Le piège du biais d'automatisation

Les lignes directrices de l'OMS sur les grands modèles d'IA en santé (2024) mettent en garde contre le biais d'automatisation : la tendance à accepter une proposition de la machine même quand on aurait détecté l'erreur seul. Ce biais augmente avec la fatigue et la pression du temps, exactement les conditions de la pratique quotidienne. Une règle simple aide : ne jamais intégrer une réponse d'IA dans un dossier sans pouvoir citer une source indépendante qui la confirme.

Quels usages limitent le risque ?

Type de tâcheRisque d'hallucinationPourquoi
Reformuler un texte fourniFaibleLe contenu de départ est connu
Résumer un document fourniModéréOmissions ou ajouts possibles, comparaison facile
Répondre à une question factuelle ouverteÉlevéLe modèle peut inventer
Citer des référencesÉlevéRisque documenté de références fictives
Dose, interaction, contre-indicationCritiqueVérification obligatoire dans un référentiel

En pratique

  • Traitez toute réponse d'IA comme un brouillon à vérifier, jamais comme une source.
  • Vérifiez chaque référence et chaque chiffre dans la source primaire avant usage.
  • Posez des questions neutres et demandez explicitement les incertitudes.
  • Ne prenez jamais une dose ou une contre-indication dans une réponse d'IA sans contrôle dans un référentiel.
  • Relisez toute transcription automatique : la reconnaissance vocale peut aussi inventer.

Questions fréquentes

Qu'est-ce qu'une hallucination d'IA en médecine ?

Une information plausible mais fausse produite par un modèle d'IA : référence inexistante, chiffre erroné, examen ou signe inventé.

Comment vérifier une référence donnée par ChatGPT ?

En la recherchant dans PubMed ou sur le site de la revue : titre, auteurs, année et contenu doivent correspondre exactement.

Les hallucinations disparaissent-elles avec les nouveaux modèles ?

Elles diminuent, mais les études de 2025 montrent qu'elles persistent, notamment quand la question contient elle-même une erreur.

Sources

  1. Cureus — High Rates of Fabricated and Inaccurate References in ChatGPT-Generated Medical Content (2023)
  2. Communications Medicine — Multi-model assurance analysis showing LLMs are highly vulnerable to adversarial hallucination attacks (PubMed, 2025)
  3. Healthcare IT News — Mount Sinai experts compare hallucinations across 6 LLMs
  4. arXiv — Koenecke et al., Careless Whisper: Speech-to-Text Hallucination Harms (2024)
  5. OMS — WHO releases AI ethics and governance guidance for large multi-modal models (2024)
Dictez vos comptes rendus, sans que rien ne quitte votre ordinateur

Nabady Whisper transcrit votre voix hors ligne, en français, en arabe ou en anglais, avec des modèles de comptes rendus par spécialité.

Article d'information générale, vérifié à la date de publication ; il ne remplace ni un avis médical ni un conseil juridique.

Partager LinkedIn WhatsApp X