→ العودة إلى الصفحة الرئيسية

هل خسر الذكاء الاصطناعي السريري أمام النماذج العامة؟ تقييمَان يقدمان إجابتين متعارضتين ويضعان الثقة في روبوتات الدردشة الطبية تحت الاختبار

تُظهر مقارنة مستقلة أن الذكاء الاصطناعي السريري المصمم خصيصًا للأطباء لا يتفوق بالضرورة على النماذج العامة المتقدمة؛ لكن تقييمًا آخر أجراه أطباء منح OpenEvidence تقدمًا كبيرًا. ولا يقتصر هذا التباين على قوائم الترتيب، بل يكشف أيضًا كيف تؤثر مصادر البيانات وطرق التقييم وتضارب المصالح في تعريف «الموثوقية».

By SURL BioNews

يلجأ الأطباء بصورة متزايدة إلى الذكاء الاصطناعي للاستفسار عن مؤشرات التشخيص وخيارات العلاج وأحدث الأدبيات، لكن هل النظام الذي يحمل وصف «مخصص للاستخدام السريري» أكثر موثوقية فعلًا من نماذج الدردشة العامة؟ قدّم تقييمان حديثان إجابتين متناقضتين تقريبًا، ما وسّع الجدل من قدرات النماذج إلى سؤال أكثر جوهرية: هل تستطيع الاختبارات الحالية إثبات أن أداة ما مؤهلة للدخول في عملية اتخاذ القرارات الطبية الفعلية؟

قارنت الدراسة الرئيسية المنشورة في 《Nature Medicine》 بين OpenEvidence وUpToDate Expert AI من جهة، وGPT-5.2 وGemini 3.1 Pro وClaude Opus 4.6 من جهة أخرى. شمل الاختبار 500 سؤال من MedQA، و500 مهمة من HealthBench، و100 استفسار سريري حقيقي؛ وفي الجزء الأخير، أجرى 12 طبيبًا سريريًا لم يكونوا على علم بمصدر الإجابات ما مجموعه 1,800 تقييم. وأظهرت النتائج أن النماذج العامة الثلاثة شكّلت مجموعة ذات أداء أعلى، بينما تأخرت الأداتان السريريتان إجمالًا.

لكن الفارق لا يعني ببساطة أن «النماذج العامة أكثر أمانًا». لم تجد الدراسة فروقًا ذات دلالة بين النماذج في المحتوى الضار والهلوسة؛ وظهرت المشكلات الأوضح في قابلية الاستخدام، إذ بلغ معدل امتناع UpToDate Expert AI عن الإجابة نحو 19%، فيما حصل OpenEvidence على أدنى تقييم من حيث الوضوح. وفي البيئات السريرية المزدحمة، قد يكون اكتمال الإجابة وسهولة فهمها وقدرتها على دعم الحكم مباشرةً بأهمية الإجابة الصحيحة عن أسئلة المعرفة نفسها.

ومع ذلك، ينطوي هذا التقييم أيضًا على نقاط عمياء لا يمكن تجاهلها. فقد أقرّ المؤلفون بأن بنوك الأسئلة الطبية المتاحة علنًا ربما دخلت في بيانات تدريب النماذج، ما قد يؤدي إلى تلوث المعايير المرجعية؛ كما شاركت نماذج متقدمة في تقييم جزء HealthBench، الأمر الذي قد يجعلها تميل إلى الإجابات المشابهة لأسلوبها في التعبير. كذلك، خضعت الأدوات السريرية للاختبار عبر واجهة المتصفح، وهو ما قد لا يعكس سير عملها المعتاد. ولم تقارن الدراسة جودة المراجع المستشهد بها أو قابلية تتبع الإجابات أو سرعة الاستجابة، مع أن هذه العوامل تحديدًا من الأسباب المهمة التي تدفع الأطباء إلى اختيار الأدوات المتخصصة.

وتصاعد الجدل أيضًا لأن دراسة أخرى منشورة على arXiv توصلت إلى نتيجة معاكسة. استخدم ذلك التقييم 620 سؤالًا قدّمها أطباء فعليًا إلى OpenEvidence، و187 مهمة من HealthBench، ودعا 149 طبيبًا ممارسًا لإجراء تقييمات مطابقة لتخصصاتهم. وفي مقارنات ثنائية معماة، فضّل الأطباء OpenEvidence على GPT-5.5 أو Gemini 3.1 Pro أو Claude Opus 4.8 من حيث الدقة والفائدة السريرية وجودة المصادر وقابلية التحقق والاكتمال؛ وبلغت أفضلية OpenEvidence على كل نموذج من النماذج الأخرى نحو 25 إلى 39 نقطة مئوية.

ويجب أيضًا تفسير هذا الانقلاب في ضوء تصميم الدراسة. جاءت أسئلة الدراسة الثانية من مستخدمي OpenEvidence الحاليين، كما شاركت OpenEvidence في تخطيط جمع البيانات واستقطاب الأطباء؛ وقد يجعل ذلك توزيع الأسئلة أقرب إلى سيناريوهات الاستخدام التي يجيدها المنتج. ومن ناحية أخرى، عالج تقييمها لجودة المصادر والفائدة السريرية جوانب أساسية لم تتناولها الدراسة الأولى. لذلك، قد لا يكون من الممكن اختزال النتيجتين في تحديد أيهما صائب وأيهما مخطئ؛ بل ربما تُظهران أن اختلاف بنوك الأسئلة وإصدارات النماذج وواجهات الاستخدام ومعايير التقييم يؤدي إلى فائزين مختلفين.

ما ينقص فعلًا هو إطار تحقق مشترك أكثر ارتباطًا بالعواقب السريرية: تستخدم فيه جهات مستقلة حالات وأسئلة غير منشورة وحديثة زمنيًا، وتُسجّل طرق التحليل مسبقًا، وتتحقق مما إذا كانت الاستشهادات تدعم الادعاءات، وتتابع ما إذا كانت الأخطاء ستغيّر قرارات التشخيص والعلاج. فالدرجات المرتفعة في أسئلة الاختبارات الطبية ليست سوى نقطة بداية؛ وحتى تتوافر هذه الشروط، لا ينبغي لأي نموذج، سواء كان متخصصًا أو عامًا، أن يكتسب الثقة الطبية استنادًا إلى قائمة ترتيب واحدة فقط.

References

  1. STAT
  2. Nature Medicine
  3. arXiv