Reconnaissance vocale médicale : précision, jargon et accents
Dictée médicale et IA : taux d'erreur mesurés, difficultés liées au vocabulaire médical et aux accents, et méthodes pour fiabiliser ses comptes rendus.
La reconnaissance vocale fait gagner un temps précieux à de nombreux médecins : on dicte plus vite qu'on ne tape, et les modèles récents comprennent bien mieux la parole naturelle qu'il y a dix ans. Mais une dictée médicale n'est pas une conversation ordinaire : noms de molécules, termes anatomiques, abréviations, chiffres, latéralité. Et au Maroc comme dans toute l'Afrique francophone, les médecins dictent avec des accents variés et passent parfois d'une langue à l'autre. Que sait-on réellement de la précision de ces outils ?
Ce que mesurent les études
Le taux d'erreur brut
L'étude de référence reste celle de Zhou et collaborateurs, publiée en 2018 dans JAMA Network Open. Les chercheurs ont analysé 217 notes cliniques dictées par 144 médecins de deux systèmes de santé américains, à trois étapes : la sortie brute du logiciel de reconnaissance vocale, la version corrigée par un transcripteur médical, puis la note signée par le médecin.
- Sortie brute : 7,4 % de mots erronés, et une majorité de documents contenant au moins une erreur.
- Après correction par un transcripteur : 0,4 %.
- Après signature par le médecin : 0,3 %.
Certaines erreurs résiduelles étaient cliniquement significatives. La conclusion des auteurs est sans ambiguïté : la relecture est indispensable.
Les erreurs des modèles récents
Les modèles d'IA de nouvelle génération sont beaucoup plus robustes, mais ils introduisent un type d'erreur nouveau : l'invention. Une étude présentée en 2024 à la conférence ACM FAccT a montré qu'environ 1 % des transcriptions produites par le modèle Whisper contenaient des passages entièrement inventés, apparaissant souvent pendant les silences ou les hésitations. Une partie de ces ajouts était potentiellement préjudiciable. Là où un ancien logiciel produisait un mot absurde, facile à repérer, un modèle moderne peut produire une phrase fluide… qui n'a jamais été prononcée.
Le défi du vocabulaire médical
Un modèle généraliste n'a pas forcément rencontré suffisamment de termes spécialisés pour les reconnaître de façon fiable. Les difficultés classiques :
- les homophones et quasi-homophones (« hypo » / « hyper », « ilium » / « iléon ») ;
- les noms de médicaments, nombreux et proches les uns des autres ;
- les chiffres et unités, où une erreur change le sens (dimensions d'une lésion, doses, valeurs biologiques) ;
- la latéralité (droite / gauche) ;
- les négations (« pas de », « absence de »), dont l'omission inverse le sens d'une phrase ;
- les abréviations propres à chaque spécialité.
Les solutions consistent à utiliser des modèles adaptés au domaine, des dictionnaires personnalisés et des modèles de compte rendu par spécialité, qui orientent la reconnaissance vers le vocabulaire attendu.
Accents et multilinguisme
Les grands modèles de reconnaissance vocale ont été entraînés sur des volumes massifs d'audio, mais pas de façon équilibrée entre langues et accents. Les performances sont généralement meilleures sur les variétés de langue les plus représentées dans les données d'entraînement. Pour un médecin marocain, sénégalais ou ivoirien, plusieurs facteurs peuvent dégrader la précision :
- un accent régional moins représenté dans les données ;
- l'alternance entre français, arabe et darija au sein d'une même dictée ;
- les noms propres et toponymes locaux ;
- l'environnement sonore (service d'urgence, bloc, cabinet ouvert sur la rue).
Les évaluations publiées portent surtout sur l'anglais : les performances réelles en français avec accent maghrébin ou africain, ou en arabe médical, restent peu documentées. La seule mesure fiable est donc un test sur ses propres dictées.
Comment évaluer un logiciel de dictée médicale
| Critère | Comment le tester |
|---|---|
| Précision sur votre spécialité | Dicter 10 comptes rendus réels types et compter les corrections |
| Vocabulaire | Vérifier molécules, termes anatomiques, abréviations courantes |
| Chiffres et latéralité | Dicter des mesures, des doses, droite/gauche |
| Accent et langues | Tester avec votre façon naturelle de parler, y compris en arabe si besoin |
| Bruit | Essayer en conditions réelles, pas seulement dans un bureau calme |
| Confidentialité | Vérifier où l'audio est traité : sur le poste ou sur un serveur distant |
Bonnes pratiques de dictée
- Le micro : un micro-casque ou un micro de dictée dédié améliore nettement le résultat par rapport au micro intégré d'un ordinateur portable.
- Le débit : parler de façon régulière, sans précipitation, en marquant la ponctuation si le logiciel l'exige.
- Les modèles : partir d'une trame de compte rendu propre à l'examen ou à la spécialité.
- Le dictionnaire : ajouter les termes que l'outil reconnaît mal.
- La relecture ciblée : vérifier en priorité chiffres, latéralité, négations et noms de médicaments.
En pratique
- Testez tout logiciel sur vos propres dictées, avec votre accent et dans votre environnement réel.
- Relisez systématiquement chaque compte rendu avant signature, en ciblant chiffres, côtés et négations.
- Investissez dans un micro de qualité : c'est souvent le gain de précision le plus simple.
- Enrichissez le vocabulaire et utilisez des modèles par spécialité.
- Privilégiez un traitement local de l'audio pour protéger la confidentialité des patients.
Questions fréquentes
Quel est le taux d'erreur de la reconnaissance vocale médicale ?
Une étude de 2018 dans JAMA Network Open mesurait 7,4 % de mots erronés en sortie brute, ramenés à 0,3 % après relecture et signature par le médecin.
La reconnaissance vocale fonctionne-t-elle avec un accent ?
Oui, mais la précision peut baisser pour les accents moins représentés dans les données d'entraînement. Il faut tester l'outil sur ses propres dictées.
Les logiciels de dictée à base d'IA peuvent-ils inventer du texte ?
Oui. Une étude de 2024 a montré qu'environ 1 % des transcriptions du modèle Whisper contenaient des passages inventés, d'où l'importance de la relecture.
Sources
- AHRQ PSNet — Analysis of errors in dictated clinical documents assisted by speech recognition software and professional transcriptionists
- Diagnostic Imaging — Speech recognition technology introduces errors in physician notes
- arXiv — Koenecke et al., Careless Whisper: Speech-to-Text Hallucination Harms (2024)
- Fortune — OpenAI transcription tool Whisper hallucinations in hospitals (2024)
Nabady Whisper transcrit votre voix hors ligne, en français, en arabe ou en anglais, avec des modèles de comptes rendus par spécialité.
Article d'information générale, vérifié à la date de publication ; il ne remplace ni un avis médical ni un conseil juridique.