← Retour aux articles
Étude transversaleHors périmètre

Évaluation comparative des protocoles de traitement d'acupuncture générés par ChatGPT, DeepSeek et des médecins dans des contextes de langue chinoise et anglaise : étude d'évaluation transversale

Comparative Evaluation of ChatGPT, DeepSeek, and Physician-Generated Acupuncture Treatment Protocols Across Chinese and English Language Settings: Cross-Sectional Evaluation Study.

PubMed — neurosciences cognitives developpementales · Anglais

L’essentiel

Cette étude évalue l'application de grands modèles de langage, notamment ChatGPT et DeepSeek, dans la génération de protocoles de traitement par acupuncture en comparant leur valadité à celle de protocoles rédigés par des médecins. Les chercheurs ont analysé les différences de performance entre les corpus en langue chinoise et anglaise à l'aide d'un ensemble de données de cas cliniques bilingues. Dix médecins seniors en médecine traditionnelle chinoise ont évalué les protocoles selon sept critères incluant la sélection des points locaux, distaux, basés sur les syndromes, neuroanatomiques et les effets synergiques. Les résultats de l'analyse statistique révèlent des différences significatives entre les groupes pour la sélection des points locaux, basés sur les syndromes, neuroanatomiques et la couverture des points clés. DeepSeek a généralement montré de meilleures performances en chinois tandis que ChatGPT a excellé dans le contexte anglophone. L'intelligence artificielle démontre une capacité certaine à encoder les connaissances explicites en acupuncture, bien que des défis persistent concernant la personnalisation et la consistance interlinguistique. L'amélioration des corpus d'entraînement multilingues et le développement de modules de raisonnement spécifiques aux syndromes pourraient accroître la pertinence clinique de ces outils.

  • L'étude compare les protocoles d'acupuncture générés par DeepSeek, ChatGPT et des médecins cliniciens.
  • Dix médecins seniors ont évalué les protocoles selon sept critères cliniques et anatomiques rigoureux.
  • DeepSeek a obtenu de meilleures performances dans le corpus de langue chinoise pour plusieurs critères.
Robustesse de l’étudeNon déterminable

Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.

Comprendre l’analyse ↓
Portée de l’analyse NeuroWatchAnalyse partielle

Analyse du résumé uniquement. Confiance faible dans les informations extraites.

Voir les sources ↓

Synthèse détaillée

Synthèse

Cette étude évalue l'application de grands modèles de langage, notamment ChatGPT et DeepSeek, dans la génération de protocoles de traitement par acupuncture en comparant leur valadité à celle de protocoles rédigés par des médecins. Les chercheurs ont analysé les différences de performance entre les corpus en langue chinoise et anglaise à l'aide d'un ensemble de données de cas cliniques bilingues. Dix médecins seniors en médecine traditionnelle chinoise ont évalué les protocoles selon sept critères incluant la sélection des points locaux, distaux, basés sur les syndromes, neuroanatomiques et les effets synergiques. Les résultats de l'analyse statistique révèlent des différences significatives entre les groupes pour la sélection des points locaux, basés sur les syndromes, neuroanatomiques et la couverture des points clés. DeepSeek a généralement montré de meilleures performances en chinois tandis que ChatGPT a excellé dans le contexte anglophone. L'intelligence artificielle démontre une capacité certaine à encoder les connaissances explicites en acupuncture, bien que des défis persistent concernant la personnalisation et la consistance interlinguistique. L'amélioration des corpus d'entraînement multilingues et le développement de modules de raisonnement spécifiques aux syndromes pourraient accroître la pertinence clinique de ces outils.

Résultats principaux

L'étude compare les protocoles d'acupuncture générés par DeepSeek, ChatGPT et des médecins cliniciens. Dix médecins seniors ont évalué les protocoles selon sept critères cliniques et anatomiques rigoureux. DeepSeek a obtenu de meilleures performances dans le corpus de langue chinoise pour plusieurs critères. ChatGPT a montré de meilleurs résultats dans le corpus de langue anglaise pour la sélection des points. Des différences significatives ont été observées pour la sélection locale, par syndrome et neuroanatomique.

Repères pour la pratique

Les grands modèles de langage peuvent potentiellement assister les cliniciens dans la structuration des protocoles d'acupuncture. Les praticiens doivent rester prudents face aux variations de performance linguistique des intelligences artificielles. L'intégration future de modules de raisonnement clinique spécifiques pourrait améliorer la fiabilité des outils d'aide à la décision.

Limites et précautions

L'article aborde l'utilisation de l'intelligence artificielle pour des protocoles thérapeutiques en médecine traditionnelle, ce qui présente un intérêt méthodologique pour les neurosciences et la prise de décision clinique par IA, mais reste éloigné de la neuropsychologie clinique ou des troubles neurodéveloppementaux stricts. L'évaluation repose sur des cas cliniques publiés et traduits, ce qui peut ne pas refléter toute la complexité de la pratique réelle. La subjectivité des évaluateurs experts en médecine traditionnelle chinoise peut influencer les scores attribués. Les performances des modèles d'intelligence artificielle évoluent rapidement, limitant la pérennité temporelle des résultats.

Analyse méthodologique

Non déterminable — Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.

Le texte intégral ouvert n’était pas accessible. Cela rend la robustesse non déterminable : l’absence d’information n’est pas interprétée comme une faiblesse de l’étude.

Examiner les critères point par point

Cette analyse automatisée s'appuie exclusivement sur les métadonnées et le résumé fournis, ce qui constitue une limitation méthodologique importante nécessitant l'accès au texte intégral pour une validation complète. Selon les auteurs, dix médecins séniors en médecine traditionnelle chinoise ont évalué des protocoles issus de modèles de langage (ChatGPT et DeepSeek) et de médecins à l'aide de sept critères structurés appliqués à un ensemble de données de cas cliniques traduits. Les résultats principaux indiquent des différences statistiquement significatives entre les groupes pour la sélection des points locaux (P=0,006), la sélection des points basée sur le syndrome (P=0,005), la sélection neuroanatomique des points (P<0,001) et le principe de couverture des points clés (P=0,03). Concernant l'évaluation méthodologique menée par NeuroWatch, la validité des mesures et la sélection de la population sont documentées et jugées adéquates. En revanche, le contrôle des facteurs de confusion est indéterminé car non rapporté dans la source analysée, cette absence de mention ne constituant pas la preuve que la méthode n'a pas été appliquée. La taille de l'échantillon, le suivi, les financements et les conflits d'intérêts ne sont pas non plus rapportés dans la source analysée. Aucune recommandation clinique n'est formulée.

confounding controlNon déterminable

Le texte ne mentionne pas de mesures spécifiques pour contrôler les facteurs de confusion potentiels lors de l'évaluation par les experts.

L’information nécessaire n’est pas rapportée dans la source analysée.
measure validityFavorable

Dix médecins séniors en médecine traditionnelle chinoise ont évalué les protocoles selon sept critères structurés et validés.

Un élément méthodologique adéquat est explicitement documenté.
population selectionFavorable

Des cas cliniques d'acupuncture qualifiés publiés dans une revue spécifique ont été identifiés et utilisés pour constituer l'ensemble de données bilingue.

Un élément méthodologique adéquat est explicitement documenté.
statistical analysisFavorable

Une analyse de variance à mesures répétées avec évaluation de la sphéricité a été employée pour analyser les différences entre les groupes.

Un élément méthodologique adéquat est explicitement documenté.

Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.

Classification détaillée

Lecture multiaxiale

Ce que l’article étudie

Taxonomie 2026_10

L'article evalue l'utilisation de grands modeles de langage pour generer des protocoles d'acupuncture. Bien que classe sous les neurosciences par la source, il ne concerne pas les troubles neurodeveloppementaux, la neuropsychologie ou les aspects cliniques de notre perimetre de veille.