الذكاء الاصطناعي الطبي · global
من صور الصدر إلى أسئلة السجلات الطبية وأجوبتها: دراسة MedGemma تُظهر تقدم النماذج المتخصصة في الطب
نشرت مجلة «Nature Medicine» تقييمًا لـMedGemma عبر مهام متعددة، يُظهر أن التدريب على البيانات الطبية يمكن أن يحسّن تفسير الصور وأداء الاستدلال. كانت النتائج الأساسية قد أُعلنت العام الماضي، وتُنشر الآن بعد مراجعة الأقران؛ أما تطبيقها في الرعاية الفعلية، فلا يزال يتطلب التحقق من كل استخدام على حدة.
صورة أشعة سينية للصدر، وقطعة صغيرة من شريحة نسيجية، وسجلات طبية تمتد لسنوات، تحمل قرائن طبية بأشكال مختلفة. إذا استطاع نظام ذكاء اصطناعي واحد التعامل مع هذه البيانات، فقد يتمكن الباحثون من تخفيف عبء بناء أدوات جديدة لكل مهمة. وتقدم دراسة MedGemma، المنشورة في 6 أكتوبر في مجلة «Nature Medicine»، أدلة تقييم لهذا المسار التطويري، لكن لا تزال هناك فجوات يجب سدّها بين نتائج الاختبارات والأداء الموثوق في العيادة.
يعتمد MedGemma على Gemma 3، ويُدرَّب باستخدام بيانات طبية لتمكين النموذج من معالجة الصور والنصوص. ولا يمثّل هذا النشر في المجلة الظهور الأول للنموذج: فقد أتاح فريق البحث تقريرًا تقنيًا في يوليو 2025، وكان آخر تعديل له في أبريل 2026. وظهرت التحسينات الأساسية، مثل تصنيف صور الأشعة السينية للصدر، في التقرير المبكر؛ أما التقدم هذه المرة، فهو النشر الرسمي للبحث بعد مراجعة الأقران.
يشير التقرير البحثي إلى أنه في المهام «خارج التوزيع»، التي لم يُستخدم فيها مجموعة بيانات الاختبار لتدريب النموذج أو ضبطه، تحسّن أداء MedGemma في تصنيف الموجودات في صور الأشعة السينية للصدر بنسبة تتراوح بين 15.5 و18.1% مقارنة بالنموذج الأساسي، وتحسّن أداؤه في الإجابة عن الأسئلة المتعلقة بالصور الطبية بنسبة تتراوح بين 2.6 و10%. تُستخدم هذه الاختبارات لاستكشاف قدرة النموذج عند التعامل مع بيانات مختلفة، لكنها لا تتيح الاستنتاج المباشر بأنه سيحافظ على الأداء نفسه عند الانتقال إلى مستشفى آخر أو مجموعة أخرى من المرضى.
تمثّل كيفية فهم النموذج للصور محورًا آخر لهذا العمل. وتوضح Google Research أن مُرمِّز الصور MedSigLIP يضم 400 مليون معلمة، وقد جرى ضبطه باستخدام صور الأشعة السينية للصدر والشرائح النسيجية وصور الجلد وقاع العين، لتحويل الصور إلى معلومات يستطيع النموذج معالجتها. ويشير التقرير التقني المبكر أيضًا إلى أنه بعد مزيد من الضبط الدقيق، يمكن للنموذج بلوغ أداء قريب من الأساليب المتخصصة في تصنيف استرواح الصدر والشرائح النسيجية، فيما تنخفض أخطاء استرجاع المعلومات من السجلات الطبية بنسبة 50%؛ وهذه كلها نتائج لمهام محددة، ولا يمكن اعتبارها معدل دقة موحدًا لجميع الاستخدامات الطبية.
أما تقييم توليد تقارير الأشعة السينية للصدر، فهو أقرب إلى سير عمل محتمل. استخدمت الدراسة مجموعة بيانات MIMIC-CXR؛ وكانت Google قد أوضحت سابقًا أنه في تقييم لم يُطبَّق فيه التعمية، رأى اختصاصي أشعة واحد حاصل على اعتماد تخصصي أمريكي أن 81% من التقارير التي ولّدها MedGemma 4B كانت دقيقة بما يكفي لتوجيه تدبير المرضى على نحو قريب مما توجّه إليه التقارير الأصلية. وهذا حكم خبير على تبعات التقارير، وليس إثباتًا لتساوي نتائج الرعاية من خلال متابعة فعلية للمرضى؛ كما أن معرفة المُقيِّم بمصدر التقارير تحدّ من تفسير الأدلة.
وتحتاج قدرة الاستدلال أيضًا إلى فهمها ضمن سياق الاختبار. فالتحسّن بنسبة 10.8% في مهام الوكيل، الوارد في التقرير التقني، ناتج عن تفاعلات سريرية محاكاة، وليس عن تجربة في عيادات فعلية. وحتى إن تحسّن النموذج في الإجابة عن الأسئلة والتصنيف، فهذا لا يعني أنه بات قادرًا على تولّي أخذ التاريخ المرضي أو التشخيص أو اتخاذ قرارات العلاج بأمان.
الاستخدام الذي تدعمه هذه النتائج بصورة أكثر مباشرة هو أن يكون النموذج نقطة انطلاق لأبحاث الذكاء الاصطناعي الطبي وتطوير تطبيقاته. وتشير Google بوضوح إلى أن النموذج يحتاج إلى التكييف والتحقق بحسب الاستخدام المحدد، وأن مخرجاته ينبغي ألا تُستخدم مباشرة في التشخيص السريري أو قرارات العلاج. وبالنسبة إلى المؤسسات التي تستعد لاعتماده، يجب أن تتمثل الخطوة التالية في تحديد كيفية وقوع النموذج في الأخطاء عند استخدام بياناتها ومجموعات مرضاها وسير عملها، وما إذا كانت هذه الأخطاء تؤثر في الرعاية؛ فالنشر في مجلة يسهّل فحص قدراته، بينما تُبنى موثوقيته السريرية من خلال التحقق اللاحق.