→ العودة إلى الصفحة الرئيسية

الذكاء الاصطناعي الطبي يدخل المشاورات متعددة التخصصات: دراسة على مئة حالة تظهر فائدته، لكن توافق التوصيات لا يزال محدودًا

في التعامل مع الأمراض الالتهابية المعقدة، يستطيع OpenEvidence تقديم معلومات يراها الأطباء مفيدة؛ لكن نسبة التوافق الكامل مع استنتاجات المشاورات تبلغ نحو 40 إلى 50%، كما تتغير إجاباته عن السؤال نفسه بمرور الوقت.

By SURL BioNews

عندما تشمل الأمراض الالتهابية أعضاء مختلفة، غالبًا ما تتطلب خيارات العلاج موازنة مشتركة بين أطباء من تخصصات متعددة. فهل يستطيع الذكاء الاصطناعي القادر على تنظيم الأدبيات الطبية فورًا أن يساعد في توضيح هذه المسائل المعقدة؟ قدمت دراسة نُشرت في 2 أكتوبر في «Scientific Reports»، وأدخلت نموذج اللغة الكبير الطبي OpenEvidence في سير عمل المشاورات الفعلية، إجابة حذرة: المعلومات مفيدة، لكن توافق التوصيات لا يزال محدودًا.

شملت هذه الدراسة الرصدية الاستباقية، التي أُجريت في مركز واحد، 100 حالة متتالية من الأمراض الالتهابية المعقدة. ناقش الأطباء الحالات أولًا بأنفسهم وسجلوا توصياتهم الأولية، ثم اطلعوا على إجابات الذكاء الاصطناعي، وأكدوا توصياتهم النهائية بعد مناقشات إضافية. وأكمل 21 طبيبًا من سبعة تخصصات ما مجموعه 759 تقييمًا للحالات؛ وتعكس هذه التقييمات انطباعات الخبراء عن الاستخدام، وليست نتائج علاج 759 مريضًا.

أقر الأطباء عمومًا بالفائدة العملية للذكاء الاصطناعي. فعلى مقياس من خمس نقاط، حصل بند «تقديم معلومات سريرية ذات صلة بالحالة» على متوسط 4.06 نقاط، بينما بلغ متوسط التوصية بمواصلة استخدامه مستقبلًا 3.95 نقاط. ويشير ذلك إلى إمكانية دمجه في المناقشات، لكن اعتبار المعلومات مفيدة وقبول توصياته التشخيصية والعلاجية يظلان حكمين مختلفين.

قيّم طبيبان بصورة منفصلة 97 حالة قابلة للتقييم، وحدد كل منهما نسبة الإجابات التي توافق فيها الذكاء الاصطناعي تمامًا مع توصيات المشاورات النهائية، فبلغت النسبتان 40.2% و50.5% على التوالي. كما اختلفت تقييمات الطبيبين. لذلك، ينبغي فهم هذه الأرقام بوصفها درجة التوافق مع استنتاجات الخبراء، ولا يمكن اعتبارها مباشرةً مقياسًا لدقة التشخيص والعلاج لدى الذكاء الاصطناعي؛ خصوصًا أن التوصيات النهائية أُكدت بعد اطلاع الأطباء على إجابات الذكاء الاصطناعي، وبالتالي لم تكن معيارًا مستقلًا تمامًا للمقارنة.

عدّل فريق البحث بعد ذلك طريقة طرح الأسئلة، بحيث يتحقق النموذج أولًا من كفاية المعلومات قبل تقديم التوصيات. وأظهر توافق الإجابات اتجاهًا نحو التحسن، لكنه لم يبلغ الدلالة الإحصائية. ولأن جولتي الاختبار فصلت بينهما عدة أشهر، استمرت خلالها تحديثات المنصة، لم تتمكن الدراسة أيضًا من الفصل بوضوح بين أثر تحسين طريقة طرح الأسئلة وأثر التغييرات في النظام.

وتستحق الفروق الناجمة عن مرور الوقت الانتباه أيضًا: فعندما أعادت الدراسة إدخال الأسئلة نفسها، تغير كل من محتوى الإجابات والأدبيات المستشهد بها. وفي الاستخدام السريري، لا تضمن إجابة جيدة في مناسبة واحدة إمكانية الحصول على النتيجة نفسها لاحقًا؛ كما أن مقدار ما يفهمه النموذج عن الحالة المرضية يعتمد على المعلومات التي يقدمها الطبيب مسبقًا.

تدعم هذه الدراسة جدوى استخدام الذكاء الاصطناعي أداةً مساعدة في المشاورات، لكنها لم تثبت بعد قدرته على تحسين مآلات المرضى. ولم تقيّم الدراسة الأضرار السريرية، كما لم تختبر بصورة منهجية «الهلوسة» — أي المحتوى المُولَّد الذي يبدو معقولًا لكنه خاطئ في الواقع؛ وإضافةً إلى ذلك، جاءت الحالات من مركز واحد، مما يحد من إمكانية تعميم النتائج. وتظل كيفية التحقق المستمر من أداء النظام بعد تحديثه، وتمكين الخبراء من اكتشاف أوجه النقص في الإجابات، من الأسئلة التي تتطلب إجابة قبل الانتقال إلى الاستخدام في الرعاية الطبية اليومية.

References

  1. Scientific Reports