Comparaison des performances de raisonnement diagnostique textuel des médecins urgentistes et des grands modèles de langage dans les diagnostics définitifs et différentiels à l'aide de vignettes cliniques standardisées : une étude préliminaire.
Comparing the text-based diagnostic reasoning performance of emergency medicine physicians and large language models in both definitive and differential diagnoses using standardized clinical vignettes: a preliminary study.
L’essentiel
Cette étude préliminaire descriptive et comparative a évalué la précision diagnostique de 10 médecins urgentistes et de 4 grands modèles de langage (ChatGPT GPT-5.2, Gemini 3, Microsoft Copilot GPT-4, Claude Opus 4.1) sur 10 vignettes cliniques standardisées issues de présentations aux urgences. La précision globale était de 61,79 %. Les modèles d'IA ont montré une précision globale significativement supérieure (73,75 %) à celle des médecins (57,00 %, p = 0,014). Les diagnostics définitifs étaient plus précis que les diagnostics différentiels (70,71 % vs 52,86 %). Les médecins ont montré une baisse significative de précision pour les diagnostics différentiels (45,0 %) par rapport aux diagnostics définitifs (69,0 %, p = 0,003), tandis que les modèles d'IA ont maintenu une précision élevée et constante (75,0 % vs 72,5 %, p = 1,000). Les résultats suggèrent que les grands modèles de langage pourraient servir d'outil d'aide à la décision clinique, en particulier pour les raisonnements diagnostiques complexes, mais les limites (petit nombre de scénarios et d'évaluateurs) imposent une interprétation prudente.
- Les grands modèles de langage ont surpassé les médecins urgentistes en précision diagnostique globale (73,75 % vs 57,00 %, p = 0,014).
- Les médecins ont montré une baisse significative de précision pour les diagnostics différentiels par rapport aux diagnostics définitifs (45,0 % vs 69,0 %, p = 0,003).
- Les modèles d'IA ont maintenu une précision élevée et constante entre les diagnostics définitifs et différentiels (75,0 % vs 72,5 %, p = 1,000).
Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Comprendre l’analyse ↓Analyse du résumé uniquement. Confiance faible dans les informations extraites.
Voir les sources ↓Synthèse détaillée
Synthèse
Cette étude préliminaire descriptive et comparative a évalué la précision diagnostique de 10 médecins urgentistes et de 4 grands modèles de langage (ChatGPT GPT-5.2, Gemini 3, Microsoft Copilot GPT-4, Claude Opus 4.1) sur 10 vignettes cliniques standardisées issues de présentations aux urgences. La précision globale était de 61,79 %. Les modèles d'IA ont montré une précision globale significativement supérieure (73,75 %) à celle des médecins (57,00 %, p = 0,014). Les diagnostics définitifs étaient plus précis que les diagnostics différentiels (70,71 % vs 52,86 %). Les médecins ont montré une baisse significative de précision pour les diagnostics différentiels (45,0 %) par rapport aux diagnostics définitifs (69,0 %, p = 0,003), tandis que les modèles d'IA ont maintenu une précision élevée et constante (75,0 % vs 72,5 %, p = 1,000). Les résultats suggèrent que les grands modèles de langage pourraient servir d'outil d'aide à la décision clinique, en particulier pour les raisonnements diagnostiques complexes, mais les limites (petit nombre de scénarios et d'évaluateurs) imposent une interprétation prudente.
Résultats principaux
Les grands modèles de langage ont surpassé les médecins urgentistes en précision diagnostique globale (73,75 % vs 57,00 %, p = 0,014). Les médecins ont montré une baisse significative de précision pour les diagnostics différentiels par rapport aux diagnostics définitifs (45,0 % vs 69,0 %, p = 0,003). Les modèles d'IA ont maintenu une précision élevée et constante entre les diagnostics définitifs et différentiels (75,0 % vs 72,5 %, p = 1,000). L'analyse GEE a révélé une interaction significative entre le groupe d'évaluateurs et le type de diagnostic (p = 0,036).
Repères pour la pratique
Les grands modèles de langage pourraient constituer un outil d'aide à la décision clinique fiable, en particulier pour les situations complexes nécessitant un raisonnement diagnostique différentiel. L'utilisation de l'IA pourrait aider à réduire les erreurs diagnostiques en médecine d'urgence, mais des études plus vastes sont nécessaires avant une application clinique. Les cliniciens doivent être conscients des limites actuelles de l'IA et de la nécessité d'une validation externe.
Limites et précautions
L'article est hors du périmètre de NeuroWatch (médecine d'urgence générale, IA diagnostique) et ne présente qu'un intérêt marginal pour la veille en neuropsychologie développementale. Petit nombre de scénarios cliniques (10) et d'évaluateurs (10 médecins, 4 IA). Étude préliminaire descriptive comparative, sans randomisation ni contrôle. Les vignettes cliniques étaient présentées uniquement sous forme textuelle, ce qui peut ne pas refléter la pratique clinique réelle. Les résultats doivent être interprétés avec prudence en raison de la généralisation limitée.
Analyse méthodologique
Non déterminable — Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Le texte intégral ouvert n’était pas accessible. Cela rend la robustesse non déterminable : l’absence d’information n’est pas interprétée comme une faiblesse de l’étude.
Une anomalie documentaire ou méthodologique a été détectée. L’article reste disponible et doit être interprété avec prudence.
Examiner les critères point par point
Cette étude transversale a évalué l'exactitude diagnostique de quatre grands modèles de langage (LLM) – ChatGPT (GPT-5.2), Gemini 3, Microsoft Copilot (GPT-4) et Claude Opus 4.1 – par rapport à dix médecins urgentistes, sur dix vignettes cliniques standardisées présentées sous forme de texte. Les résultats principaux indiquent que les LLM ont obtenu une exactitude globale significativement plus élevée (73,75 %) que les médecins (57,00 %, p = 0,014). De plus, une analyse par équations d'estimation généralisées (GEE) a révélé une interaction significative entre le groupe d'évaluateurs et le type de diagnostic (p = 0,036). Les médecins ont montré une baisse significative de leur exactitude pour les diagnostics différentiels par rapport aux diagnostics définitifs (45,0 % contre 69,0 %, p = 0,003, significatif après correction de Bonferroni), tandis que les LLM ont maintenu une exactitude constante (75,0 % pour les diagnostics définitifs contre 72,5 % pour les différentiels, p = 1,000). L'étude présente des limites méthodologiques, notamment un petit nombre de scénarios cliniques et d'évaluateurs, ce qui limite la généralisabilité des résultats. La validité des mesures est documentée : les vignettes ont été validées par un panel d'experts et un protocole de notation standardisé a été utilisé. Les méthodes statistiques sont également documentées et appropriées. Cependant, le contrôle des facteurs de confusion n'est pas rapporté dans le résumé, et les informations sur le financement et les conflits d'intérêts ne sont pas disponibles. L'analyse est automatisée et basée uniquement sur le résumé, ce qui limite la portée des conclusions.
confounding controlNon déterminable
Aucune information sur le contrôle des facteurs de confusion n'est rapportée dans le résumé.
L’information nécessaire n’est pas rapportée dans la source analysée.measure validityFavorable
La validité des mesures est documentée : les vignettes cliniques ont été validées par un panel d'experts et un protocole de notation standardisé a été utilisé pour évaluer les diagnostics.
Un élément méthodologique adéquat est explicitement documenté.population selectionPoint de vigilance
La sélection de la population est limitée par le petit nombre de participants (10 médecins, 4 LLM) et de scénarios cliniques (10), ce qui est explicitement mentionné comme une limitation.
Une limitation méthodologique est explicitement documentée.statistical analysisFavorable
Les méthodes statistiques sont documentées et appropriées : tests du Chi-carré de Pearson, test de McNemar, et équations d'estimation généralisées (GEE) avec correction de Bonferroni.
Un élément méthodologique adéquat est explicitement documenté.Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.
Classification détaillée
Informations sur l’article
- Publication
- Étude transversale
- Source
- PubMed — neurosciences cognitives developpementales
- Date
- 31 juil. 2026
- Langue
- Anglais
- Accès
- abstract only
- Licence
- Non déterminée