← Retour aux articles
Validation d’un instrumentTDAH

Évaluation des grands modèles de langage pour l'éducation sur le TDAH : une étude comparative de ChatGPT 5, DeepSeek V3 et Grok 4

Evaluating large language models for ADHD education: A comparative study of ChatGPT 5, DeepSeek V3, and Grok 4.

PubMed / PMC — neurodeveloppement open access · Anglais

L’essentiel

Cette étude compare trois LLMs (ChatGPT 5, DeepSeek V3, Grok 4) pour générer du contenu éducatif sur le TDAH. Bien que tous les modèles soient alignés sur le DSM-5, leurs niveaux de lisibilité dépassent les recommandations pour le grand public (FKGL >12), limitant leur accessibilité pour les éducateurs non spécialistes. DeepSeek V3 produit les sorties les plus variables, Grok 4 les plus cohérentes, et ChatGPT 5 les plus concises. Les résultats suggèrent un potentiel mais nécessitent une calibration linguistique.

  • Les trois modèles sont alignés sur le DSM-5 mais diffèrent en stabilité et emphase.
  • DeepSeek V3 a produit les sorties les plus variables, Grok 4 les plus cohérentes, ChatGPT 5 les plus concises.
  • Tous les modèles dépassent les niveaux de lisibilité recommandés (FKGL >12, FKRE <40, SMOG >12).
Robustesse de l’étudeNon déterminable

Les informations accessibles ne permettent pas d’évaluer tous les critères nécessaires.

Comprendre l’analyse ↓
Portée de l’analyse NeuroWatchAnalyse du texte intégral

Analyse du texte intégral ouvert. Confiance faible dans les informations extraites.

Voir les sources ↓

Synthèse détaillée

Synthèse

Cette étude compare trois LLMs (ChatGPT 5, DeepSeek V3, Grok 4) pour générer du contenu éducatif sur le TDAH. Bien que tous les modèles soient alignés sur le DSM-5, leurs niveaux de lisibilité dépassent les recommandations pour le grand public (FKGL >12), limitant leur accessibilité pour les éducateurs non spécialistes. DeepSeek V3 produit les sorties les plus variables, Grok 4 les plus cohérentes, et ChatGPT 5 les plus concises. Les résultats suggèrent un potentiel mais nécessitent une calibration linguistique.

Résultats principaux

Les trois modèles sont alignés sur le DSM-5 mais diffèrent en stabilité et emphase. DeepSeek V3 a produit les sorties les plus variables, Grok 4 les plus cohérentes, ChatGPT 5 les plus concises. Tous les modèles dépassent les niveaux de lisibilité recommandés (FKGL >12, FKRE <40, SMOG >12). Les LLMs montrent un potentiel pour générer du contenu éducatif sur le TDAH, mais leur lisibilité actuelle limite leur utilisation par des éducateurs non spécialistes.

Repères pour la pratique

Les cliniciens peuvent utiliser les LLMs comme outils de génération de contenu éducatif, mais doivent adapter les prompts pour améliorer la lisibilité. Les éducateurs non spécialistes doivent être informés des limites de lisibilité des LLMs actuels. Une calibration linguistique et une conception de prompts optimisée sont nécessaires pour une utilisation inclusive.

Limites et précautions

Étude comparative pertinente pour l'utilisation des LLMs en éducation sur le TDAH, mais limitations de lisibilité et de stabilité. Étude limitée à trois modèles de LLM et à un seul domaine (TDAH). Pas d'évaluation de la compréhension réelle par les utilisateurs cibles. Les résultats de lisibilité sont basés sur des formules standardisées, non sur des tests utilisateurs.

Analyse méthodologique

Non déterminableLes informations accessibles ne permettent pas d’évaluer tous les critères nécessaires.

Examiner les critères point par point

L'étude, portant sur 90 réponses générées, a analysé la précision, la lisibilité et la stabilité des réponses de trois LLMs. Selon les auteurs, tous les modèles ont défini le TDAH conformément au DSM-5, ce qui indique une bonne précision du contenu. Cependant, les scores de lisibilité (FKRE < 40, FKGL > 12, SMOG > 12) étaient très élevés, correspondant à un niveau universitaire ou professionnel, bien au-dessus des recommandations de santé publique (généralement ≤ 8e année). La fiabilité inter-évaluateurs a été assurée par deux évaluateurs indépendants avec consensus. L'analyse NeuroWatch note que les validités de construit et de contenu n'ont pas été rapportées dans la source analysée, ce qui est une limitation majeure pour un instrument de validation. Aucun conflit d'intérêts n'a été rapporté, et le financement était nul. Les conclusions des auteurs soulignent le potentiel des LLMs pour fournir des informations précises, mais mettent en garde contre leur faible lisibilité et leur variabilité. L'analyse automatisée de NeuroWatch confirme ces points et insiste sur l'absence de données sur la validité de construit et de contenu, rendant l'évaluation globale de l'instrument encore indéterminée.

construct definitionFavorable

La lisibilité est définie par les indices FKRE, FKGL et SMOG ; la précision par l'alignement avec le DSM-5.

Un élément méthodologique adéquat est explicitement documenté.
construct or criterion validityNon déterminable

Aucune validation de construit ou critère rapportée.

L’information nécessaire n’est pas rapportée dans la source analysée.
content validityNon déterminable

Aucune évaluation de la validité de contenu rapportée.

L’information nécessaire n’est pas rapportée dans la source analysée.
reliabilityFavorable

Fiabilité inter-évaluateurs mentionnée via deux évaluateurs indépendants et résolution des divergences par consensus. Stabilité des réponses des LLM également évaluée.

Un élément méthodologique adéquat est explicitement documenté.
target populationFavorable

La population cible est clairement définie : éducateurs non spécialistes (parents, entraîneurs sportifs, instructeurs d'EPS occasionnels).

Un élément méthodologique adéquat est explicitement documenté.

Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.

Classification détaillée

Lecture multiaxiale

Ce que l’article étudie

Taxonomie 2026_10

Troubles et conditions neurodéveloppementales

Confiance élevée

L'article compare la précision, la lisibilité et la stabilité de trois LLMs pour générer du contenu éducatif sur le TDAH, avec un focus sur l'accessibilité pour les éducateurs non spécialisés.

Évaluation des grands modèles de langage pour l'éducation sur le TDAH : une étude comparative de ChatGPT 5, DeepSeek V3 et Grok 4 | NeuroWatch