Précision et reproductibilité des réponses de ChatGPT aux questions des parents et des patients sur le trouble du déficit de l'attention avec hyperactivité
Accuracy and reproducibility of ChatGPT responses to parent and patient inquiries on attention-deficit/hyperactivity disorder
L’essentiel
Cette étude transversale évalue la précision et la reproductibilité des réponses de ChatGPT (GPT-4o) à 88 questions fréquemment posées par des parents et patients sur le TDAH. Les questions couvraient les connaissances de base, le diagnostic, le traitement et les résultats à long terme. Deux psychiatres pour enfants et adolescents ont évalué indépendamment les réponses. Résultats : 59,1 % des réponses étaient complètes/correctes, 27,3 % incomplètes, et 13,6 % mixtes ou potentiellement trompeuses. La précision était la plus élevée pour les connaissances de base (66,7 %) et la plus faible pour le traitement (47,6 %). La reproductibilité globale était de 87,5 %. Les résultats suggèrent une utilité potentielle mais soulignent des limitations importantes, notamment dans les domaines cliniquement sensibles.
- 59,1% des réponses de ChatGPT sur le TDAH sont complètes/correctes, 27,3% incomplètes et 13,6% mixtes/potentiellement trompeuses.
- La précision est la plus élevée pour les questions de connaissances de base (66,7%) et la plus faible pour le traitement/médicaments (47,6%).
- La reproductibilité des réponses est de 87,5%, sans différence significative entre les domaines.
Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Comprendre l’analyse ↓Analyse du résumé uniquement. Confiance faible dans les informations extraites.
Voir les sources ↓Synthèse détaillée
Synthèse
Cette étude transversale évalue la précision et la reproductibilité des réponses de ChatGPT (GPT-4o) à 88 questions fréquemment posées par des parents et patients sur le TDAH. Les questions couvraient les connaissances de base, le diagnostic, le traitement et les résultats à long terme. Deux psychiatres pour enfants et adolescents ont évalué indépendamment les réponses. Résultats : 59,1 % des réponses étaient complètes/correctes, 27,3 % incomplètes, et 13,6 % mixtes ou potentiellement trompeuses. La précision était la plus élevée pour les connaissances de base (66,7 %) et la plus faible pour le traitement (47,6 %). La reproductibilité globale était de 87,5 %. Les résultats suggèrent une utilité potentielle mais soulignent des limitations importantes, notamment dans les domaines cliniquement sensibles.
Résultats principaux
59,1% des réponses de ChatGPT sur le TDAH sont complètes/correctes, 27,3% incomplètes et 13,6% mixtes/potentiellement trompeuses. La précision est la plus élevée pour les questions de connaissances de base (66,7%) et la plus faible pour le traitement/médicaments (47,6%). La reproductibilité des réponses est de 87,5%, sans différence significative entre les domaines. Aucune réponse inexacte ou non pertinente n'a été identifiée dans l'échantillon de 88 questions. ChatGPT montre une utilité potentielle pour des informations générales mais nécessite une interprétation prudente dans les domaines cliniques sensibles.
Repères pour la pratique
Les cliniciens peuvent utiliser ChatGPT comme un outil complémentaire pour fournir des informations de base sur le TDAH, mais ne doivent pas s'y fier pour des conseils thérapeutiques spécifiques. Dans les domaines du traitement et des médicaments, les réponses de ChatGPT peuvent être incomplètes ou ambiguës, nécessitant une supervision clinique professionnelle. Les parents et patients doivent être informés des limites des chatbots IA et encouragés à consulter un professionnel de santé pour des décisions cliniques.
Limites et précautions
Article directement pertinent pour le TDAH et l'utilisation de l'IA en clinique, avec une méthodologie claire mais des limites modérées. Note de 80/100 car il apporte des données empiriques utiles pour la pratique. Étude transversale avec un seul modèle de langage (GPT-4o) et un nombre limité de questions (88). Évaluation qualitative par deux psychiatres avec un accord inter-juges modéré (κ=0,52). Les questions proviennent de sources en ligne et peuvent ne pas représenter toutes les préoccupations des patients. Aucune analyse comparative avec d'autres modèles d'IA ou avec des réponses de professionnels de santé.
Analyse méthodologique
Non déterminable — Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Le texte intégral ouvert n’était pas accessible. Cela rend la robustesse non déterminable : l’absence d’information n’est pas interprétée comme une faiblesse de l’étude.
Examiner les critères point par point
L'étude, analysée à partir du résumé uniquement, a sélectionné 88 questions fréquentes sur le TDAH issues de moteurs de recherche, forums et sites professionnels. Deux psychiatres ont évalué en aveugle les réponses générées par ChatGPT (GPT-4o). La précision globale était de 59,1 % (52/88) de réponses complètes/correctes, 27,3 % incomplètes et 13,6 % mixtes ou potentiellement trompeuses. La reproductibilité était de 87,5 % (77/88) avec un accord inter-évaluateur modéré (κ=0,52). Les auteurs concluent que ChatGPT fournit des informations généralement exactes mais avec des limites dans les domaines sensibles comme le traitement. L'analyse NeuroWatch note que la validité des mesures, la sélection de la population et les analyses statistiques sont documentées comme adéquates. Cependant, le contrôle des facteurs de confusion n'est pas rapporté dans la source analysée (non requis pour ce design). La robustesse est indéterminée et la confiance dans l'analyse est faible car seul le résumé a été examiné. Analyse automatisée.
confounding controlNon déterminable
L'étude n'a pas contrôlé les facteurs de confusion car le design ne nécessite pas de contrôle de confusion.
L’information nécessaire n’est pas rapportée dans la source analysée.measure validityFavorable
La validité des mesures a été évaluée par deux psychiatres en aveugle, avec un accord inter-évaluateur modéré (κ=0,52).
Un élément méthodologique adéquat est explicitement documenté.population selectionFavorable
Les questions ont été sélectionnées à partir de moteurs de recherche, forums et sites professionnels, couvrant quatre domaines.
Un élément méthodologique adéquat est explicitement documenté.statistical analysisFavorable
Analyses statistiques incluant le kappa de Cohen et le test du chi carré pour les différences entre domaines.
Un élément méthodologique adéquat est explicitement documenté.Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.
Classification détaillée
Informations sur l’article
- Publication
- Étude transversale
- Source
- Semantic Scholar — neurodeveloppement transverse
- Date
- 19 juin 2026
- Langue
- Anglais
- Accès
- mixte
- Licence
- Non déterminée