Évaluation des grands modèles de langage pour l'éducation sur le TDAH : une étude comparative de ChatGPT 5, DeepSeek V3 et Grok 4
Evaluating large language models for ADHD education: A comparative study of ChatGPT 5, DeepSeek V3, and Grok 4.
L’essentiel
Cette étude compare trois LLMs (ChatGPT 5, DeepSeek V3, Grok 4) pour générer du contenu éducatif sur le TDAH. Bien que tous les modèles soient alignés sur le DSM-5, leurs niveaux de lisibilité dépassent les recommandations pour le grand public (FKGL >12), limitant leur accessibilité pour les éducateurs non spécialistes. DeepSeek V3 produit les sorties les plus variables, Grok 4 les plus cohérentes, et ChatGPT 5 les plus concises. Les résultats suggèrent un potentiel mais nécessitent une calibration linguistique.
- Les trois modèles sont alignés sur le DSM-5 mais diffèrent en stabilité et emphase.
- DeepSeek V3 a produit les sorties les plus variables, Grok 4 les plus cohérentes, ChatGPT 5 les plus concises.
- Tous les modèles dépassent les niveaux de lisibilité recommandés (FKGL >12, FKRE <40, SMOG >12).
Les informations accessibles ne permettent pas d’évaluer tous les critères nécessaires.
Comprendre l’analyse ↓Analyse du texte intégral ouvert. Confiance faible dans les informations extraites.
Voir les sources ↓Synthèse détaillée
Synthèse
Cette étude compare trois LLMs (ChatGPT 5, DeepSeek V3, Grok 4) pour générer du contenu éducatif sur le TDAH. Bien que tous les modèles soient alignés sur le DSM-5, leurs niveaux de lisibilité dépassent les recommandations pour le grand public (FKGL >12), limitant leur accessibilité pour les éducateurs non spécialistes. DeepSeek V3 produit les sorties les plus variables, Grok 4 les plus cohérentes, et ChatGPT 5 les plus concises. Les résultats suggèrent un potentiel mais nécessitent une calibration linguistique.
Résultats principaux
Les trois modèles sont alignés sur le DSM-5 mais diffèrent en stabilité et emphase. DeepSeek V3 a produit les sorties les plus variables, Grok 4 les plus cohérentes, ChatGPT 5 les plus concises. Tous les modèles dépassent les niveaux de lisibilité recommandés (FKGL >12, FKRE <40, SMOG >12). Les LLMs montrent un potentiel pour générer du contenu éducatif sur le TDAH, mais leur lisibilité actuelle limite leur utilisation par des éducateurs non spécialistes.
Repères pour la pratique
Les cliniciens peuvent utiliser les LLMs comme outils de génération de contenu éducatif, mais doivent adapter les prompts pour améliorer la lisibilité. Les éducateurs non spécialistes doivent être informés des limites de lisibilité des LLMs actuels. Une calibration linguistique et une conception de prompts optimisée sont nécessaires pour une utilisation inclusive.
Limites et précautions
Étude comparative pertinente pour l'utilisation des LLMs en éducation sur le TDAH, mais limitations de lisibilité et de stabilité. Étude limitée à trois modèles de LLM et à un seul domaine (TDAH). Pas d'évaluation de la compréhension réelle par les utilisateurs cibles. Les résultats de lisibilité sont basés sur des formules standardisées, non sur des tests utilisateurs.
Analyse méthodologique
Non déterminable — Les informations accessibles ne permettent pas d’évaluer tous les critères nécessaires.
Examiner les critères point par point
L'étude, portant sur 90 réponses générées, a analysé la précision, la lisibilité et la stabilité des réponses de trois LLMs. Selon les auteurs, tous les modèles ont défini le TDAH conformément au DSM-5, ce qui indique une bonne précision du contenu. Cependant, les scores de lisibilité (FKRE < 40, FKGL > 12, SMOG > 12) étaient très élevés, correspondant à un niveau universitaire ou professionnel, bien au-dessus des recommandations de santé publique (généralement ≤ 8e année). La fiabilité inter-évaluateurs a été assurée par deux évaluateurs indépendants avec consensus. L'analyse NeuroWatch note que les validités de construit et de contenu n'ont pas été rapportées dans la source analysée, ce qui est une limitation majeure pour un instrument de validation. Aucun conflit d'intérêts n'a été rapporté, et le financement était nul. Les conclusions des auteurs soulignent le potentiel des LLMs pour fournir des informations précises, mais mettent en garde contre leur faible lisibilité et leur variabilité. L'analyse automatisée de NeuroWatch confirme ces points et insiste sur l'absence de données sur la validité de construit et de contenu, rendant l'évaluation globale de l'instrument encore indéterminée.
construct definitionFavorable
La lisibilité est définie par les indices FKRE, FKGL et SMOG ; la précision par l'alignement avec le DSM-5.
Un élément méthodologique adéquat est explicitement documenté.construct or criterion validityNon déterminable
Aucune validation de construit ou critère rapportée.
L’information nécessaire n’est pas rapportée dans la source analysée.content validityNon déterminable
Aucune évaluation de la validité de contenu rapportée.
L’information nécessaire n’est pas rapportée dans la source analysée.reliabilityFavorable
Fiabilité inter-évaluateurs mentionnée via deux évaluateurs indépendants et résolution des divergences par consensus. Stabilité des réponses des LLM également évaluée.
Un élément méthodologique adéquat est explicitement documenté.target populationFavorable
La population cible est clairement définie : éducateurs non spécialistes (parents, entraîneurs sportifs, instructeurs d'EPS occasionnels).
Un élément méthodologique adéquat est explicitement documenté.Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.
Classification détaillée
Informations sur l’article
- Publication
- Validation d’un instrument
- Source
- PubMed / PMC — neurodeveloppement open access
- Date
- 01 juin 2026
- Langue
- Anglais
- Accès
- Accès ouvert
- Licence
- CC-BY