← Retour aux articles
Étude transversaleHors périmètre

Comparaison des performances de raisonnement diagnostique textuel des médecins urgentistes et des grands modèles de langage dans les diagnostics définitifs et différentiels à l'aide de vignettes cliniques standardisées : une étude préliminaire.

Comparing the text-based diagnostic reasoning performance of emergency medicine physicians and large language models in both definitive and differential diagnoses using standardized clinical vignettes: a preliminary study.

PubMed — neurosciences cognitives developpementales · Anglais

L’essentiel

Cette étude préliminaire descriptive et comparative a évalué la précision diagnostique de 10 médecins urgentistes et de 4 grands modèles de langage (ChatGPT GPT-5.2, Gemini 3, Microsoft Copilot GPT-4, Claude Opus 4.1) sur 10 vignettes cliniques standardisées issues de présentations aux urgences. La précision globale était de 61,79 %. Les modèles d'IA ont montré une précision globale significativement supérieure (73,75 %) à celle des médecins (57,00 %, p = 0,014). Les diagnostics définitifs étaient plus précis que les diagnostics différentiels (70,71 % vs 52,86 %). Les médecins ont montré une baisse significative de précision pour les diagnostics différentiels (45,0 %) par rapport aux diagnostics définitifs (69,0 %, p = 0,003), tandis que les modèles d'IA ont maintenu une précision élevée et constante (75,0 % vs 72,5 %, p = 1,000). Les résultats suggèrent que les grands modèles de langage pourraient servir d'outil d'aide à la décision clinique, en particulier pour les raisonnements diagnostiques complexes, mais les limites (petit nombre de scénarios et d'évaluateurs) imposent une interprétation prudente.

  • Les grands modèles de langage ont surpassé les médecins urgentistes en précision diagnostique globale (73,75 % vs 57,00 %, p = 0,014).
  • Les médecins ont montré une baisse significative de précision pour les diagnostics différentiels par rapport aux diagnostics définitifs (45,0 % vs 69,0 %, p = 0,003).
  • Les modèles d'IA ont maintenu une précision élevée et constante entre les diagnostics définitifs et différentiels (75,0 % vs 72,5 %, p = 1,000).
Robustesse de l’étudeNon déterminable

Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.

Comprendre l’analyse ↓
Portée de l’analyse NeuroWatchAnalyse partielle

Analyse du résumé uniquement. Confiance faible dans les informations extraites.

Voir les sources ↓

Synthèse détaillée

Synthèse

Cette étude préliminaire descriptive et comparative a évalué la précision diagnostique de 10 médecins urgentistes et de 4 grands modèles de langage (ChatGPT GPT-5.2, Gemini 3, Microsoft Copilot GPT-4, Claude Opus 4.1) sur 10 vignettes cliniques standardisées issues de présentations aux urgences. La précision globale était de 61,79 %. Les modèles d'IA ont montré une précision globale significativement supérieure (73,75 %) à celle des médecins (57,00 %, p = 0,014). Les diagnostics définitifs étaient plus précis que les diagnostics différentiels (70,71 % vs 52,86 %). Les médecins ont montré une baisse significative de précision pour les diagnostics différentiels (45,0 %) par rapport aux diagnostics définitifs (69,0 %, p = 0,003), tandis que les modèles d'IA ont maintenu une précision élevée et constante (75,0 % vs 72,5 %, p = 1,000). Les résultats suggèrent que les grands modèles de langage pourraient servir d'outil d'aide à la décision clinique, en particulier pour les raisonnements diagnostiques complexes, mais les limites (petit nombre de scénarios et d'évaluateurs) imposent une interprétation prudente.

Résultats principaux

Les grands modèles de langage ont surpassé les médecins urgentistes en précision diagnostique globale (73,75 % vs 57,00 %, p = 0,014). Les médecins ont montré une baisse significative de précision pour les diagnostics différentiels par rapport aux diagnostics définitifs (45,0 % vs 69,0 %, p = 0,003). Les modèles d'IA ont maintenu une précision élevée et constante entre les diagnostics définitifs et différentiels (75,0 % vs 72,5 %, p = 1,000). L'analyse GEE a révélé une interaction significative entre le groupe d'évaluateurs et le type de diagnostic (p = 0,036).

Repères pour la pratique

Les grands modèles de langage pourraient constituer un outil d'aide à la décision clinique fiable, en particulier pour les situations complexes nécessitant un raisonnement diagnostique différentiel. L'utilisation de l'IA pourrait aider à réduire les erreurs diagnostiques en médecine d'urgence, mais des études plus vastes sont nécessaires avant une application clinique. Les cliniciens doivent être conscients des limites actuelles de l'IA et de la nécessité d'une validation externe.

Limites et précautions

L'article est hors du périmètre de NeuroWatch (médecine d'urgence générale, IA diagnostique) et ne présente qu'un intérêt marginal pour la veille en neuropsychologie développementale. Petit nombre de scénarios cliniques (10) et d'évaluateurs (10 médecins, 4 IA). Étude préliminaire descriptive comparative, sans randomisation ni contrôle. Les vignettes cliniques étaient présentées uniquement sous forme textuelle, ce qui peut ne pas refléter la pratique clinique réelle. Les résultats doivent être interprétés avec prudence en raison de la généralisation limitée.

Analyse méthodologique

Non déterminableLe texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.

Le texte intégral ouvert n’était pas accessible. Cela rend la robustesse non déterminable : l’absence d’information n’est pas interprétée comme une faiblesse de l’étude.

Une anomalie documentaire ou méthodologique a été détectée. L’article reste disponible et doit être interprété avec prudence.

Examiner les critères point par point

Cette étude transversale a évalué l'exactitude diagnostique de quatre grands modèles de langage (LLM) – ChatGPT (GPT-5.2), Gemini 3, Microsoft Copilot (GPT-4) et Claude Opus 4.1 – par rapport à dix médecins urgentistes, sur dix vignettes cliniques standardisées présentées sous forme de texte. Les résultats principaux indiquent que les LLM ont obtenu une exactitude globale significativement plus élevée (73,75 %) que les médecins (57,00 %, p = 0,014). De plus, une analyse par équations d'estimation généralisées (GEE) a révélé une interaction significative entre le groupe d'évaluateurs et le type de diagnostic (p = 0,036). Les médecins ont montré une baisse significative de leur exactitude pour les diagnostics différentiels par rapport aux diagnostics définitifs (45,0 % contre 69,0 %, p = 0,003, significatif après correction de Bonferroni), tandis que les LLM ont maintenu une exactitude constante (75,0 % pour les diagnostics définitifs contre 72,5 % pour les différentiels, p = 1,000). L'étude présente des limites méthodologiques, notamment un petit nombre de scénarios cliniques et d'évaluateurs, ce qui limite la généralisabilité des résultats. La validité des mesures est documentée : les vignettes ont été validées par un panel d'experts et un protocole de notation standardisé a été utilisé. Les méthodes statistiques sont également documentées et appropriées. Cependant, le contrôle des facteurs de confusion n'est pas rapporté dans le résumé, et les informations sur le financement et les conflits d'intérêts ne sont pas disponibles. L'analyse est automatisée et basée uniquement sur le résumé, ce qui limite la portée des conclusions.

confounding controlNon déterminable

Aucune information sur le contrôle des facteurs de confusion n'est rapportée dans le résumé.

L’information nécessaire n’est pas rapportée dans la source analysée.
measure validityFavorable

La validité des mesures est documentée : les vignettes cliniques ont été validées par un panel d'experts et un protocole de notation standardisé a été utilisé pour évaluer les diagnostics.

Un élément méthodologique adéquat est explicitement documenté.
population selectionPoint de vigilance

La sélection de la population est limitée par le petit nombre de participants (10 médecins, 4 LLM) et de scénarios cliniques (10), ce qui est explicitement mentionné comme une limitation.

Une limitation méthodologique est explicitement documentée.
statistical analysisFavorable

Les méthodes statistiques sont documentées et appropriées : tests du Chi-carré de Pearson, test de McNemar, et équations d'estimation généralisées (GEE) avec correction de Bonferroni.

Un élément méthodologique adéquat est explicitement documenté.

Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.

Classification détaillée

Lecture multiaxiale

Ce que l’article étudie

Taxonomie 2026_10

L'article compare les performances diagnostiques de médecins urgentistes et de grands modèles de langage sur des vignettes cliniques générales, sans lien avec les troubles neurodéveloppementaux, les fonctions cognitives ou les contextes de la veille NeuroWatch.

Comparaison des performances de raisonnement diagnostique textuel des médecins urgentistes et des grands modèles de langage dans les diagnostics définitifs et différentiels à l'aide de vignettes cliniques standardisées : une étude préliminaire. | NeuroWatch