← Retour aux articles
Étude transversaleHors périmètre

Intelligence artificielle dans l'éducation médicale : performance de ChatGPT versus étudiants en médecine à un examen médical

Artificial intelligence in medical education: Performance of ChatGPT versus medical students on medical examination.

PubMed — neurosciences cognitives developpementales · Anglais

L’essentiel

Cette étude évalue la performance de ChatGPT (modèles 3.5 et 4.0) pour résoudre un examen de médecine de 50 questions (médecine préventive et psychiatrie) administré à 41 étudiants de quatrième année. Les réponses initiales et après re-prompting ont été comparées à celles des étudiants. Le score moyen des étudiants était de 29,5 ± 5,9. ChatGPT 4.0 a surpassé tous les étudiants après re-prompting (score de 46), et les deux modèles ont montré une probabilité plus élevée de bonnes réponses que les étudiants, sauf pour le premier prompt du modèle 3.5. Les auteurs concluent que ChatGPT 4.0 est un outil fiable, mais appellent à la prudence dans l'interprétation et l'application de ses résultats en contexte clinique et éducatif.

  • ChatGPT 4.0 a obtenu un score de 46/49 après re-prompting, surpassant tous les étudiants (moyenne 29,5 ± 5,9).
  • Le re-prompting améliore significativement les performances de ChatGPT, passant de 28 à 40 pour le modèle 3.5 et de 43 à 46 pour le modèle 4.0.
  • Pour les questions faciles, la précision des deux modèles ChatGPT diffère significativement de celle des étudiants.
Robustesse de l’étudeNon déterminable

Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.

Comprendre l’analyse ↓
Portée de l’analyse NeuroWatchAnalyse partielle

Analyse du résumé uniquement. Confiance faible dans les informations extraites.

Voir les sources ↓

Synthèse détaillée

Synthèse

Cette étude évalue la performance de ChatGPT (modèles 3.5 et 4.0) pour résoudre un examen de médecine de 50 questions (médecine préventive et psychiatrie) administré à 41 étudiants de quatrième année. Les réponses initiales et après re-prompting ont été comparées à celles des étudiants. Le score moyen des étudiants était de 29,5 ± 5,9. ChatGPT 4.0 a surpassé tous les étudiants après re-prompting (score de 46), et les deux modèles ont montré une probabilité plus élevée de bonnes réponses que les étudiants, sauf pour le premier prompt du modèle 3.5. Les auteurs concluent que ChatGPT 4.0 est un outil fiable, mais appellent à la prudence dans l'interprétation et l'application de ses résultats en contexte clinique et éducatif.

Résultats principaux

ChatGPT 4.0 a obtenu un score de 46/49 après re-prompting, surpassant tous les étudiants (moyenne 29,5 ± 5,9). Le re-prompting améliore significativement les performances de ChatGPT, passant de 28 à 40 pour le modèle 3.5 et de 43 à 46 pour le modèle 4.0. Pour les questions faciles, la précision des deux modèles ChatGPT diffère significativement de celle des étudiants. Pour les questions difficiles, la différence entre les étudiants et le premier prompt du modèle 3.5 n'était pas significative. Les auteurs recommandent une vérification constante de la fiabilité des informations générées par les grands modèles de langage avant usage clinique ou éducatif.

Repères pour la pratique

Les cliniciens doivent interpréter avec prudence les réponses de ChatGPT, en particulier pour les questions difficiles où la performance peut être comparable à celle des étudiants. L'utilisation de ChatGPT comme outil d'aide à la décision clinique nécessite une validation externe et une supervision humaine. Les éducateurs médicaux devraient intégrer des directives sur l'utilisation éthique et critique de l'IA dans la formation. Le re-prompting peut améliorer la fiabilité des réponses, mais ne garantit pas l'exactitude clinique.

Limites et précautions

L'article traite de l'IA dans l'éducation médicale, sans pertinence directe pour la neuropsychologie développementale ou les troubles neurodéveloppementaux. La note est faible (15/100) car le sujet est hors périmètre. L'étude repose sur un échantillon restreint de 50 questions et 41 étudiants, limitant la généralisation. Une question a été exclue car basée sur une image, ce qui réduit la couverture des compétences visuelles. La comparaison avec les étudiants ne tient pas compte de la variabilité individuelle des performances. Les résultats sont basés sur un seul type d'examen (médecine préventive et psychiatrie) et peuvent ne pas refléter d'autres domaines médicaux. L'étude n'évalue pas la validité clinique des réponses de ChatGPT dans des situations réelles.

Analyse méthodologique

Non déterminableLe texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.

Le texte intégral ouvert n’était pas accessible. Cela rend la robustesse non déterminable : l’absence d’information n’est pas interprétée comme une faiblesse de l’étude.

Une anomalie documentaire ou méthodologique a été détectée. L’article reste disponible et doit être interprété avec prudence.

Examiner les critères point par point

L'étude, de type transversal, a comparé les performances de ChatGPT (versions 3.5 et 4.0) à celles de 41 étudiants de quatrième année de médecine sur un examen de 49 questions à choix multiples en médecine préventive et psychiatrie. Les résultats montrent que le score moyen des étudiants était de 29,5 ± 5,9, tandis que les scores initiaux de ChatGPT 3.5 et 4.0 étaient respectivement de 28 et 43. Après un re-prompting, les scores sont passés à 40 et 46. Le modèle 4.0 a surpassé tous les étudiants après re-prompting. Les auteurs rapportent que, à l'exception du premier prompt de ChatGPT 3.5, les modèles ChatGPT avaient une probabilité plus élevée de fournir des réponses correctes que les étudiants. Pour les questions faciles, la précision des deux modèles ChatGPT différait significativement de celle des étudiants, tandis que pour les questions difficiles, la différence entre les étudiants et le premier prompt de ChatGPT 3.5 n'était pas significative. Une tendance non significative a été observée dans la comparaison de la précision par difficulté de question. L'analyse NeuroWatch note que le contrôle des facteurs de confusion n'est pas rapporté dans le résumé, ce qui rend cette dimension indéterminée. La validité de la mesure est limitée par l'exclusion d'une question basée sur une image, ce qui peut affecter la comparabilité. La population est restreinte à un seul établissement et à deux domaines médicaux, limitant la généralisabilité. Les analyses statistiques semblent limitées à des comparaisons de moyennes et de probabilités, sans détails sur les tests de signification ou les ajustements. Les intervalles de confiance, les valeurs p exactes, les détails sur la catégorisation de la difficulté, les données démographiques des étudiants et les analyses au niveau des items ne sont pas rapportés dans la source analysée. L'analyse est automatisée et basée uniquement sur le résumé, ce qui limite la robustesse des conclusions.

confounding controlNon déterminable

Aucune information sur le contrôle des facteurs de confusion n'est rapportée dans le résumé.

L’information nécessaire n’est pas rapportée dans la source analysée.
measure validityPoint de vigilance

La validité de la mesure est limitée car une question basée sur une image a été exclue, ce qui peut affecter la comparabilité des performances.

Une limitation méthodologique est explicitement documentée.
population selectionPoint de vigilance

La population est restreinte à 41 étudiants de quatrième année de médecine, ce qui limite la généralisabilité des résultats.

Une limitation méthodologique est explicitement documentée.
statistical analysisPoint de vigilance

Les analyses statistiques sont limitées à des comparaisons de moyennes et de probabilités, sans mention de tests de signification détaillés ou d'ajustements.

Une limitation méthodologique est explicitement documentée.

Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.

Classification détaillée

Lecture multiaxiale

Ce que l’article étudie

Taxonomie 2026_10

L'article évalue la performance de ChatGPT dans un examen médical, sans lien avec les troubles neurodéveloppementaux, les dimensions cliniques, fonctionnelles, sociales ou contextuelles de la veille NeuroWatch.

Intelligence artificielle dans l'éducation médicale : performance de ChatGPT versus étudiants en médecine à un examen médical | NeuroWatch