الذكاء الاصطناعي الطبي · global
لا تزال هناك فجوة في التشخيص الإشعاعي بالذكاء الاصطناعي التوليدي: تحليل تلوي لـ48 دراسة يُظهر تفوق الأطباء الخبراء في الدقة بـ13 نقطة مئوية
ما مدى بُعد الذكاء الاصطناعي التوليدي عن أن يصبح مساعدًا سريريًا موثوقًا في تقديم التشخيصات استنادًا إلى الصور والتاريخ المرضي؟ تشير دراسة جديدة إلى أن صيغة الإجابة والمعلومات المُدخلة تؤثران في الأداء، وأن متوسط النتائج عبر الدراسات لا يكفي بعد لتحديد ما إذا كان استخدامه في العيادة آمنًا وقابلًا للتطبيق.
غالبًا ما يتطلب تحويل شذوذ ظاهر في صورة إلى تشخيص ربطه بالتاريخ المرضي وقرائن أخرى. وقد اختُبرت هذه القدرة لدى الذكاء الاصطناعي التوليدي، لكن صياغة إجابة سلسة لا تعني أن الحكم موثوق. أظهرت مراجعة منهجية وتحليل تلوي نُشرا في 3 أكتوبر في «Japanese Journal of Radiology» أن دقة الذكاء الاصطناعي التوليدي لا تزال أقل من دقة الأطباء الخبراء في دراسات التشخيص الإشعاعي المشمولة.
جمع هذا التحليل 48 دراسة عُثر عليها من خلال البحث حتى مارس 2025، وسُجّل مسبقًا في PROSPERO؛ كما أكد ملخص الورقة نفسها المُدرج في PubMed نطاق البحث ونتائجه الرئيسية. شمل التقييم مدخلات نصية وصورية ومدخلات تجمع بين الاثنين، واختبر قدرة النماذج على تقديم التشخيص الصحيح. لذلك، لم يقتصر ما قاسه البحث على القدرة على «قراءة الصور» مباشرة، بل شمل أيضًا استنتاج المرض من الأوصاف النصية.
تؤثر طريقة الإجابة في النتائج: عندما طُلب من النماذج كتابة التشخيص من تلقاء نفسها، بلغت الدقة المجمّعة 42.9%؛ وعندما قُدمت لها خيارات، بلغت 58.1%. وقدّرت المقارنة باستخدام نموذج إحصائي عبر الدراسات أن دقة الأطباء الخبراء أعلى من دقة الذكاء الاصطناعي بنحو 13.0 نقطة مئوية، مع فاصل ثقة بنسبة 95% يتراوح بين 0.9 و25.2 نقطة مئوية، وقيمة P بلغت 0.038. وهذا فرق مطلق في الدقة، ولا يمكن تفسيره على أن الذكاء الاصطناعي يتأخر بالمقدار نفسه بصورة ثابتة في كل نوع من الفحوص أو الأمراض.
ولأساس المقارنة حدود أيضًا. فمن بين الدراسات الـ48، تضمنت 12 دراسة فقط مجموعة مقارنة من الأطباء؛ والفرق المذكور أعلاه ناتج عن تقدير بنموذج عبر الدراسات، وليس عن مقارنة جميع نماذج الذكاء الاصطناعي والأطباء على الحالات نفسها وفي الظروف نفسها. وقد تؤثر الاختلافات في تكوين الحالات ودرجة صعوبتها في النتائج، كما لا يمكن تحويل نتائج الإجابة هذه مباشرة إلى معدلات الخطأ في التشخيص اليومي بالمستشفيات.
ومن النتائج الأخرى التي يسهل إساءة فهمها أن الأداء مع المدخلات النصية وحدها كان أفضل من الأداء عند تقديم الصور وحدها أو الصور والنصوص معًا. وينبّه المؤلفون إلى أن النصوص تتضمن أحيانًا نتائج الصور التي كتبها أشخاص ونظّموها، وهو ما يعادل تقديم قرائن مهمة مسبقًا؛ كما أن صعوبة المهام قد لا تكون متساوية بين المجموعات. يدعم هذا الارتباط إجراء مزيد من الأبحاث حول الاستخدامات المساعدة للنصوص، لكنه لا يثبت أن حذف الصور يجعل التشخيص أكثر دقة.
وتحدّ جودة الأدلة أيضًا من تعميم الاستنتاجات: صُنّفت دراسة واحدة فقط على أنها منخفضة مخاطر التحيز، بينما كانت مخاطر التحيز في معظم الدراسات الأخرى غير واضحة أو مرتفعة. وكانت مواد الاختبار أيضًا باللغة الإنجليزية في معظمها تقريبًا، ولا تتوافر بعد أدلة كافية على قابلية تطبيق النتائج في السياقات الطبية باللغة الصينية. وإضافة إلى ذلك، انتهى البحث في الأدبيات في مارس 2025، لذا يعرض هذا التحليل الأدلة المتعلقة بالنماذج وطرق التقييم آنذاك، ولا يمكنه تمثيل قدرات جميع الإصدارات الجديدة اللاحقة.
أما سريريًا، فالخطوة التالية هي تحديد مراحل العمل التي يمكن للذكاء الاصطناعي أن يقدم فيها مساعدة موثوقة. ويقترح المؤلفون مواصلة تقييم استخدامات مثل تقديم اقتراحات للتشخيص التفريقي يراجعها الأطباء، لكن ينبغي قبل التطبيق إجراء اختبارات موحّدة، واستخدام عينات كافية، وتقديم تقارير شفافة عن المنهجية. ولتحديد ما إذا كانت هذه الأدوات قادرة على تحسين الرعاية، لا تزال هناك حاجة إلى اختبار أداء الأطباء وسلامة استخدامهم للذكاء الاصطناعي في ظروف قريبة من العمل الفعلي.