→ العودة إلى الصفحة الرئيسية

حين يعرف الذكاء الاصطناعي الطبي متى يسلّم المهمة: الفجوة السريرية وراء دقة تشخيص تبلغ 98.9%

قد يكون قصر عمل الذكاء الاصطناعي على الحالات التي يثق بها بدرجة أكبر أحد المسارات نحو التشخيص المستقل. لكن حين يُحال أكثر من نصف الحالات إلى الأطباء، يبقى السؤال الذي لم يُجب عنه هو ما إذا كان مسار العمل بأكمله يستطيع تحسين الرعاية.

By SURL BioNews

يبدو أن توقّف الذكاء الاصطناعي الطبي عند مواجهة حالات غير مؤكدة وطلبه من الطبيب تولّي المهمة تصميم معقول لضمان السلامة. لكن معدل دقة لافتًا لا يجيب تلقائيًا عن سؤالَي ما إذا كان تسليم المهمة يقلّل فعلًا من التشخيصات الخاطئة، وما إذا كان المرضى يتلقّون التدخل اللازم في الوقت المناسب. يركّز تعليق نشرته مجلة Nature Medicine في 2 أكتوبر على هذا الجزء من مسار العمل السريري الذي لم يُتحقق منه بعد: يستطيع الذكاء الاصطناعي انتقاء التشخيصات الأكثر موثوقية، لكن النتائج بعد إحالتها إلى المراجعة البشرية لا تزال تفتقر إلى أدلة مستمدة من اختبار فعلي.

يناقش التعليق دراسة نُشرت في المجلة نفسها في 15 سبتمبر. جعل فريق بحثي من دريسدن وكيلَين من الذكاء الاصطناعي يؤديان دورَي الطبيب والمريض يتفاعلان في بيئة محاكاة تعمل محليًا؛ وكان بإمكان «الطبيب» طرح أسئلة إضافية عن الأعراض، وطلب معلومات عن الفحوص، ثم تقديم تشخيص وأسبابه. استُمدت الحالات من سجلات صحية إلكترونية موجودة، وشملت أمراضًا مثل الالتهاب الرئوي، وعدوى المسالك البولية، والتهاب الزائدة الدودية. بقي النظام ومعالجة البيانات على أجهزة المؤسسة نفسها، ما يساعد على ضبط تدفّق البيانات وإصدارات النماذج وصلاحيات الوصول، لكن هذه المزايا الإدارية لا تضمن بحد ذاتها سلامة التشخيص.

في مجموعتَي اختبار مستمدّتَين من بيانات MIMIC-IV السريرية، بلغت دقة تشخيص النظام 90.04% في 551 حالة تغطي سبعة أمراض؛ وفي مجموعة اختبار أخرى تضم 2,400 حالة تغطي أربعة أمراض بطنية، بلغت الدقة 83.8%. واختبرت الدراسة أيضًا الأداء في نطاق أوسع باستخدام 990 حالة من VivaBench تغطي عشرة تخصصات. وهذه كلها محاكاة بأثر رجعي يمكنها قياس القدرات ضمن بيانات ومهام محددة، لكنها لا تمثّل بعدُ الفعالية في الرعاية اليومية بالمستشفيات.

كان التصميم الأهم في الدراسة هو جعل النظام يعالج الحالة نفسها مرارًا للتحقق من ثبات التشخيص. وعندما ضُبطت عتبة اتساق التشخيص عند 0.90، أُبقي على 49.4% من الحالات في الاختبار الرئيسي، وارتفعت الدقة في هذه المجموعة الفرعية إلى 98.9%، فيما أُحيلت الحالات المتبقية إلى مجموعة تنتظر المراجعة. وبعبارة أخرى، اقترنت الدقة العالية بتقليص نطاق الحالات التي يعالجها النظام، ولم يتحقق الأداء نفسه في جميع الحالات؛ كما أن تكرار إجابات متقاربة قد يظل مصحوبًا بأخطاء ثابتة.

وفّر التحقق البشري مستوى آخر من الفحص. ووفقًا لتوضيح مركز دريسدن للصحة الرقمية، بعد مراجعة الأطباء 181 حالة اختيرت عشوائيًا، تجاوز التوافق بين التقييم الآلي وإجماع الأطباء 90%. تدعم هذه النتيجة تمتع طريقة التقييم بقدر من الموثوقية، لكنها لم تختبر ما إذا كان الأطباء يستطيعون تصحيح الأخطاء عندما يتولّون الحالات فعليًا. وهنا تحديدًا تقع الفجوة التي يشير إليها التعليق الجديد: إحالة الحالات المعقدة لا تُنجز سوى الفرز، ولا تثبت بعدُ أن مسار الرعاية بأكمله أكثر أمانًا.

ستؤثر ظروف التطبيق الفعلي أيضًا في أداء هذه الطريقة. وجدت الدراسة أن عتبة الاتساق تحتاج إلى إعادة معايرة بحسب النموذج والإعدادات التقنية، ولا يمكن نقلها مباشرة إلى بيئة نشر أخرى. وأشار فريق دريسدن أيضًا إلى أن الأداء كان أضعف في الحالات المحاكاة التي تتعلق بمرضى أكبر سنًا، ولا تزال الأسباب بحاجة إلى توضيح؛ كما أن تكلفة العمليات الحسابية المتكررة دفعت الفريق إلى البحث عن طرق أكثر كفاءة للتحقق من الموثوقية. ترتبط هذه المسائل بتحديد المرضى الأكثر عرضة للإحالة إلى المراجعة، وبقدرة المؤسسات الصحية على مواصلة إجراء هذه الفحوص.

لذلك، تتمثل الخطوة التالية في إدراج الأطباء ومسارات العمل الفعلية ضمن دراسات مستقبلية. ويؤكد كل من مؤلفي الدراسة وتغطية ICT&health للحدث نفسه ضرورة تقييم اعتماد الأطباء على الذكاء الاصطناعي، وعبء المراجعة، وسلامة المرضى، والنتائج السريرية. ومن منظور الرعاية، ما ينبغي قياسه فعليًا هو النتائج المشتركة للحالات التي يحتفظ بها النظام والحالات التي يحيلها: هل يتيح الوقت الذي يوفره الذكاء الاصطناعي للأطباء التعامل على نحو أفضل مع الحالات المعقدة، وهل تتحسن تبعًا لذلك الجودة الإجمالية للتشخيص والعلاج؟

References

  1. Nature Medicine
  2. Nature Medicine
  3. Else Kröner Fresenius Center for Digital Health, TU Dresden
  4. ICT&health