Évaluation comparative des protocoles de traitement d'acupuncture générés par ChatGPT, DeepSeek et des médecins dans des contextes de langue chinoise et anglaise : étude d'évaluation transversale
Comparative Evaluation of ChatGPT, DeepSeek, and Physician-Generated Acupuncture Treatment Protocols Across Chinese and English Language Settings: Cross-Sectional Evaluation Study.
L’essentiel
Cette étude évalue l'application de grands modèles de langage, notamment ChatGPT et DeepSeek, dans la génération de protocoles de traitement par acupuncture en comparant leur valadité à celle de protocoles rédigés par des médecins. Les chercheurs ont analysé les différences de performance entre les corpus en langue chinoise et anglaise à l'aide d'un ensemble de données de cas cliniques bilingues. Dix médecins seniors en médecine traditionnelle chinoise ont évalué les protocoles selon sept critères incluant la sélection des points locaux, distaux, basés sur les syndromes, neuroanatomiques et les effets synergiques. Les résultats de l'analyse statistique révèlent des différences significatives entre les groupes pour la sélection des points locaux, basés sur les syndromes, neuroanatomiques et la couverture des points clés. DeepSeek a généralement montré de meilleures performances en chinois tandis que ChatGPT a excellé dans le contexte anglophone. L'intelligence artificielle démontre une capacité certaine à encoder les connaissances explicites en acupuncture, bien que des défis persistent concernant la personnalisation et la consistance interlinguistique. L'amélioration des corpus d'entraînement multilingues et le développement de modules de raisonnement spécifiques aux syndromes pourraient accroître la pertinence clinique de ces outils.
- L'étude compare les protocoles d'acupuncture générés par DeepSeek, ChatGPT et des médecins cliniciens.
- Dix médecins seniors ont évalué les protocoles selon sept critères cliniques et anatomiques rigoureux.
- DeepSeek a obtenu de meilleures performances dans le corpus de langue chinoise pour plusieurs critères.
Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Comprendre l’analyse ↓Analyse du résumé uniquement. Confiance faible dans les informations extraites.
Voir les sources ↓Synthèse détaillée
Synthèse
Cette étude évalue l'application de grands modèles de langage, notamment ChatGPT et DeepSeek, dans la génération de protocoles de traitement par acupuncture en comparant leur valadité à celle de protocoles rédigés par des médecins. Les chercheurs ont analysé les différences de performance entre les corpus en langue chinoise et anglaise à l'aide d'un ensemble de données de cas cliniques bilingues. Dix médecins seniors en médecine traditionnelle chinoise ont évalué les protocoles selon sept critères incluant la sélection des points locaux, distaux, basés sur les syndromes, neuroanatomiques et les effets synergiques. Les résultats de l'analyse statistique révèlent des différences significatives entre les groupes pour la sélection des points locaux, basés sur les syndromes, neuroanatomiques et la couverture des points clés. DeepSeek a généralement montré de meilleures performances en chinois tandis que ChatGPT a excellé dans le contexte anglophone. L'intelligence artificielle démontre une capacité certaine à encoder les connaissances explicites en acupuncture, bien que des défis persistent concernant la personnalisation et la consistance interlinguistique. L'amélioration des corpus d'entraînement multilingues et le développement de modules de raisonnement spécifiques aux syndromes pourraient accroître la pertinence clinique de ces outils.
Résultats principaux
L'étude compare les protocoles d'acupuncture générés par DeepSeek, ChatGPT et des médecins cliniciens. Dix médecins seniors ont évalué les protocoles selon sept critères cliniques et anatomiques rigoureux. DeepSeek a obtenu de meilleures performances dans le corpus de langue chinoise pour plusieurs critères. ChatGPT a montré de meilleurs résultats dans le corpus de langue anglaise pour la sélection des points. Des différences significatives ont été observées pour la sélection locale, par syndrome et neuroanatomique.
Repères pour la pratique
Les grands modèles de langage peuvent potentiellement assister les cliniciens dans la structuration des protocoles d'acupuncture. Les praticiens doivent rester prudents face aux variations de performance linguistique des intelligences artificielles. L'intégration future de modules de raisonnement clinique spécifiques pourrait améliorer la fiabilité des outils d'aide à la décision.
Limites et précautions
L'article aborde l'utilisation de l'intelligence artificielle pour des protocoles thérapeutiques en médecine traditionnelle, ce qui présente un intérêt méthodologique pour les neurosciences et la prise de décision clinique par IA, mais reste éloigné de la neuropsychologie clinique ou des troubles neurodéveloppementaux stricts. L'évaluation repose sur des cas cliniques publiés et traduits, ce qui peut ne pas refléter toute la complexité de la pratique réelle. La subjectivité des évaluateurs experts en médecine traditionnelle chinoise peut influencer les scores attribués. Les performances des modèles d'intelligence artificielle évoluent rapidement, limitant la pérennité temporelle des résultats.
Analyse méthodologique
Non déterminable — Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Le texte intégral ouvert n’était pas accessible. Cela rend la robustesse non déterminable : l’absence d’information n’est pas interprétée comme une faiblesse de l’étude.
Examiner les critères point par point
Cette analyse automatisée s'appuie exclusivement sur les métadonnées et le résumé fournis, ce qui constitue une limitation méthodologique importante nécessitant l'accès au texte intégral pour une validation complète. Selon les auteurs, dix médecins séniors en médecine traditionnelle chinoise ont évalué des protocoles issus de modèles de langage (ChatGPT et DeepSeek) et de médecins à l'aide de sept critères structurés appliqués à un ensemble de données de cas cliniques traduits. Les résultats principaux indiquent des différences statistiquement significatives entre les groupes pour la sélection des points locaux (P=0,006), la sélection des points basée sur le syndrome (P=0,005), la sélection neuroanatomique des points (P<0,001) et le principe de couverture des points clés (P=0,03). Concernant l'évaluation méthodologique menée par NeuroWatch, la validité des mesures et la sélection de la population sont documentées et jugées adéquates. En revanche, le contrôle des facteurs de confusion est indéterminé car non rapporté dans la source analysée, cette absence de mention ne constituant pas la preuve que la méthode n'a pas été appliquée. La taille de l'échantillon, le suivi, les financements et les conflits d'intérêts ne sont pas non plus rapportés dans la source analysée. Aucune recommandation clinique n'est formulée.
confounding controlNon déterminable
Le texte ne mentionne pas de mesures spécifiques pour contrôler les facteurs de confusion potentiels lors de l'évaluation par les experts.
L’information nécessaire n’est pas rapportée dans la source analysée.measure validityFavorable
Dix médecins séniors en médecine traditionnelle chinoise ont évalué les protocoles selon sept critères structurés et validés.
Un élément méthodologique adéquat est explicitement documenté.population selectionFavorable
Des cas cliniques d'acupuncture qualifiés publiés dans une revue spécifique ont été identifiés et utilisés pour constituer l'ensemble de données bilingue.
Un élément méthodologique adéquat est explicitement documenté.statistical analysisFavorable
Une analyse de variance à mesures répétées avec évaluation de la sphéricité a été employée pour analyser les différences entre les groupes.
Un élément méthodologique adéquat est explicitement documenté.Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.
Classification détaillée
Informations sur l’article
- Publication
- Étude transversale
- Source
- PubMed — neurosciences cognitives developpementales
- Date
- 08 oct. 2026
- Langue
- Anglais
- Accès
- abstract only
- Licence
- Non déterminée