VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations
تقدم هذه الورقة VetScore، وهو إطار تقييم مرجح بالمخاطر للأسئلة والأجوبة الطويلة في المجال البيطري، يقيم مدى أمانة الادعاءات المُولدة لمقتطفات المصدر مع إعطاء الأولوية للادعاءات بناءً على ضررها المحتمل، محققاً توافقاً عالياً مع أحكام الخبراء.
المؤلفون الأصليون:Ivan Kartáč, Jan Tovarys, Mateusz Lango, Ondřej Dušek
تخيل أنك محقق تحاول حل لغز، ولكن بدلاً من مسرح جريمة، أنت تنظر إلى قصة طويلة ومفصلة كتبها روبوت ذكي للغاية، ولكنه مغرور أحياناً. هذا الروبوت هو ذكاء اصطناعي (AI) قرأ آلاف الكتب ويمكنه الإجابة على أي سؤال تطرحه عليه تقريباً. ومع ذلك، في عالم الطب -سواء للبشر أو لأصدقائهم من ذوي الفراء والريش والحراشف- فإن الخطأ في حقيقة ما ليس مجرد درجة سيئة؛ بل يمكن أن يكون خطيراً. إذا قال الروبوت إن كلباً يحتاج إلى كمية معينة من الدواء، لكنه أخطأ في الرقم، فقد يمرض الكلب.
ولمنع الروبوت من اختلاق الحقائق، علم العلماء هذا الروبوت أن "يوضح خطوات عمله" عبر إضافة استشهادات، مثل الهوامش الصغيرة التي تشير إلى الكتب الأصلية التي قرأها. لكن الأمر يشبه قول الروبوت: "لقد قرأت هذا في كتاب!". ولكن هنا يكمن الجزء الصعب: مجرد إشارة الروبوت إلى كتاب لا يعني أنه قرأ الصفحة الصحيحة، أو أنه فهم الجملة بشكل صحيح. أحياناً، قد يشير الروبوت إلى كتاب عن القطط بينما يتحدث عن الكلاب، أو قد يخترع جملة تبدو وكأنها تنتمي إلى الكتاب ولكنها ليست موجودة فيه حقاً. وهنا يبدأ العمل الحقيقي للمحقق: نحن بحاجة إلى طريقة لا تتحقق فقط مما إذا كان الروبوت قد استشهد بمصدر ما، بل أيضاً مما إذا كانت القصة التي رواها تتطابق بالفعل مع المصدر، ومدى سوء الأمر إذا كانت القصة خاطئة.
هذا هو بالضبط ما تعالجه ورقة البحث "VETSCORE". فقد قام الباحثون، بالتعاون مع خبراء بيطريين، ببناء أداة جديدة لتقييم الإجابات التي يولدها الذكاء الاصطناعي. لقد أدركوا أن ليس كل الأخطاء متساوية؛ فإذا أخطأ الروبوت في تاريخ ما (مثل قول إن دراسة حدثت في عام 2021 بدلاً من 2022)، فهذا أمر مزعج، لكن الكلب لن يتأذى على الأرجب. ولكن إذا أخطأ الروبوت في جرعة دواء للقلب، فهذه كارثة. لذا، ابتكروا نظاماً لا يكتفي فقط بعدّ الأخطاء، بل يزنها. إنهم يجزئون إجابة الذكاء الاصطناعي الطويلة إلى حقائق صغيرة سهلة الهضم. ثم، لكل حقيقة، يطرحون سؤالين: "هل وجد الروبوت هذه المعلومة بالفعل في الكتاب الذي استشهد به؟" و"ما مقدار الضرر الذي قد تسببه إذا كانت خاطئة؟". أخيراً، يدمجون هذه الإجابات في درجة واحدة تخبرنا بمدى أمان وموثوقية نصيحة الذكاء الاصطناعي.
اختبر الفريق هذا النظام من خلال جعل نماذج الذكاء الاصطناعي تولد إجابات لأسئلة بيطرية حقيقية، ثم جعل خبراء بشريين (أطباء بيطريين وطلاب) يقيمون نفس الإجابات. وقد وجدوا أن أداة "VETSCORE" الجديدة كانت جيدة جداً في مطابقة أحكام الخبراء البشريين، حتى عند استخدام نماذج ذكاء اصطناعي أصغر وأسرع للقيام بعملية التقييم. وتشير النت النتائج إلى أنه من خلال التركيز على مخاطر الخطأ بدلاً من مجرد عدد الأخطاء، يمكننا بناء طريقة أكثر أماناً للتحقق من الذكاء الاصطنا في المجالات عالية المخاطر مثل الطب البيطري. الأمر يشبه امتلاك مفتش سلامة لا يكتفي فقط بعدّ عدد الطوب غير المثبت في الجدار، بل يتحقق تحديداً مما إذا كانت الطوبات التي تحمل السقف مثبتة بإحكام.
ملخص تقني: VETSCORE
بيان المشكلة
تُطبق نماذج اللغات الكبيرة (LLMs) بشكل متزايد في الطب البيطري، ومع ذلك فإنها غالباً ما تنتج مخرجات قد تكون ضارة أو غير دقيقة واقعياً. وبينما تدعو النهج الحديثة إلى "توليد النصوص القابل للعزو" (بما في ذلك الاستشهادات ومقتطفات المصادر) لتحسين الموثوقية، فإن مجرد وجود الاستشهادات لا يضمن أن الادعاءات المولدة وفية للمصادر المقدمة. علاوة على ذلك، فإن طرق التحقق من الحقائق الحالية تعامل جميع الادعاءات بالتساوي. وفي المجالات عالية المخاطر مثل الطب البيطري، يعد هذا عيباً حرجاً: فالادعاء غير المتحقق منه بشأن جرعة دواء يشكل خطراً أكبر بكثير على سلامة المريض من الادعاء غير المتحقق منه بشأن سنة نشر دراسة ما. تفشل مقاييس التقييم الحالية في التمييز بين هذه المستويات من المخاطر، مما قد يسمح بمرور الهلوسات عالية الخطورة دون اكتشافها، بينما تعاقب عدم الدقة منخفضة المخاطر بشكل غير متناسب.
المنهجية: VETSCORE
يقدم المؤلفون VETSCORE، وهو مسار تقييم متعدد الخطوات مصمم لتقييم مدى وفاء مخرجات الأسئلة والأجوبة البيطرية طويلة التنسيق لمقتطفات المصادر المستشهد بها، مع وزنها حسب احتمالية الضرر. وتوسع هذه الطريقة نموذج "التفكيك ثم التحقق" القياسي من خلال التقييم المعدل حسب المخاطر.
يتكون المسار من أربع مراحل متميزة:
تجزئة المخرجات: يتم تقسيم النص المولد إلى أجزاء بناءً على الفواصل (الأسطر الفارغة أو الاستشهادات السابقة). ويرتبط كل جزء بمقتطفات المصدر المقابلة له.
تفكيك الادعاءات: يقوم نموذج لغوي كبير بتفكيك كل جزء نصي إلى ادعاءات ذرية فردية. ولضمان الحفاظ على السياق (مثل حل الإحالة)، يتم تزويد المفكك بالنص السابق للمخرج حتى آخر عنوان.
آلية التقييم المزدوج:
التحقق من الحقائق: يقوم حكم (نموذج لغوي كبير) بتقييم ما إذا كان كل ادعاء ذري مدعوم بمقتطفات المصدر المقدمة. ينتج عن ذلك درجة ثنائية (vi∈{0,1})، حيث تشير 1 إلى وجود دعم و0 تشير إلى عدم وجود دعم أو وجود تناقض.
تقييم احتمالية الضرر: بشكل مستقل، يقوم حكم (نموذج لغوي كبير) بتعيين درجة احتمالية الضرر (wi∈[1,5]) لكل ادعاء. تعكس هذه الدرجة شدة الضرر في حال كان الادعاء غير صحيح وتم العمل به من قبل ممارس بيطري. يتراوح المقياس من 1 (لا توجد عواقب سريرية، مثل بيانات وصف الدراسة) إلى 5 (ضرر مباشر للمريض، مثل جرعة دواء خاطئة أو موانع استخدام).
التجميع الموزون بالمخاطر: يتم حساب الدرجة النهائية للقسم من خلال تجميع درجات التحقق والضرر. يحدد المؤلفون عقوبة محلية بناءً على الإمكانات غير المتحقق منها، مقسومة على إجمالي احتمالية الضرر للقسم. تسمح الصيغة بالتحكم في مساهمة الادعاءات عالية الضرر عبر أس p (تم ضبطه عند 2.426 في التجارب). درجة التحقق النهائية المعدلة بالمخاطر هي 1−pglobal، والتي تمثل كسر إجمالي احتمالية الضرر التي هي مدعومة.
مجموعة البيانات والتقييم
للتحقق من صحة VETSCORE، أنشأ المؤلفون مجموعة بيانات تقييم ميتا:
المدخلات: 67 استعلاماً متنوعاً من نظام أسئلة وأجوبة بيطري إنتاجي، تغطي تخصصات مختلفة (أمراض الجهاز الهضمي، أمراض القلب، إلخ) وأنواعاً مختلفة من الحيوانات.
التوليد: قامت ستة نماذج لغوية كبيرة مختلفة (بما في ذلك GPT-5.4، وClaude Opus 4.6، وGemini 3.1 Pro، ونماذج ذات أوزان مفتوحة) بتوليد إجابات مع استشهادات بناءً على مصادر PubMed المسترجعة.
التعليق البشري: قام خبراء بيطريون (ممارسون وطلاب) بالتعليق على 1,200 جزء يحتوي على 4,986 ادعاءً. قاموا بمهمتين: التحقق الثنائي من الحقائق وتسجيل احتمالية الضرر من 1 إلى 5.
التجميع: نظراً لاتفاق المقيّمين المتوسط على تسجيل الضرر (α=0.462)، استخدم المؤلفون نظرية الاستجابة للمفردة (تحديداً نموذج الائتمان الجزئي) للتعديل وفقاً لشدة المقيّم واستخلاص الدرجات المجمعة.
النتائج الرئيسية
قيم المؤلفون VETSCORE باستخدام تسعة نماذج حكم مختلفة (تتراوح من النماذج المملوكة مثل GPT-5.6 Sol إلى النماذج الأصغر ذات الأوزان المفتوحة مثل Gemma 4 31B) مقابل التعليقات البشرية.
الارتباط مع الخبراء: حقق VETSCORE ارتباطات سبيرمان عالية مع الخبراء البشريين. وصلت ارتباطات التحقق من الحقائق إلى 0.783 (Gemini 3.6 Flash)، ووصلت ارتباطات احتمالية الضرر إلى 0.763 (Gemini 3.1 Pro).
كفاءة النموذج: أثبت النهج التركيبي فعاليته حتى مع النماذج الأصغر. حقق Gemma 4 31B (31 مليار معلمة) ارتباطات تنافسية مع النماذج المملوكة الأكبر بكثير، مما يشير إلى أن الطريقة لا تتطلب نماذج لغوية ضخمة للتقييم الفعال.
دراسات الاستئصال: أدى إزالة مكون احتمالية الضرر (خط الأساس المعتمد على التحقق فقط) إلى تقليل الارتباط مع الدرجات البشرية المجمعة بشكل كبير من حيث القيم المطلقة، مما يؤكد أن التوزين بالمخاطر ضروري للأهمية السريرية. كما أدى التقييم المشترك (الجمع بين التحقق والتسجيل في مطالبة واحدة) إلى تدهور الأداء مقارنة بالنهج التركيبي.
الاتساق: أظهرت النماذج المملوكة وGemma 4 31B اتساقاً عالياً عبر التشغيلات، في حين أظهرت بعض نماذج Mixture-of-Experts (MoE) ذات الأوزان المفتوحة تبايناً أعلى.
الأهمية والمساهمات
يدعي البحث ثلاث مساهمات رئيسية:
مسار VETSCORE: مسار تحقق فعال، قابل للتفسير، وتركيبي يوفر درجات وفاء موزونة بالمخاطر خصيصاً للأسئلة والأجوبة البيطرية طويلة التنسيق. بخلاف الطرق السابقة، فإنه يعاقب صراحةً الادعاءات عالية المخاطر غير المتحقق منها بشكل أكبر من الادعاءات منخفضة المخاطر.
مجموعة بيانات معتمدة من الخبراء: إصدار مجموعة بيانات تقييم ميتا معلّقة من قبل متخصصين بيطريين، والتي تثبت أن النهج المقترح يرتبط ارتباطاً وثيقاً بتقدير الخبراء البشريين.
الجدوى باستخدام النماذج الصغيرة: إثبات أن نهج التفكيك التركيبي والتوزين بالمخاطر يسمح بالتقييم الفعال باستخدام نماذج لغوية أصغر وأكثر كفاءة، مما يجعل النظام قابلاً للتوسع.
يؤكد المؤلفون أن VETSCORE يعالج الحاجة المحددة للتقييم "المعلوم بالمخاطر" في المجالات السريرية. ومن خلال تفكيك المخرجات ووزن الادعاءات حسب احتمالية الضرر، يقدم النظام تفسيراً دقيقاً، مما يسم يسمح للممارسين بتحديد أي الادعاءات عالية المخاطر تفتقر إلى الدعم بدقة. ويخلص البحث إلى أنه بينما تركز الطريقة حالياً على الوفاء القائم على المقتطفات، فإن إطار عملها المعدل بالمخاطر يعد خطوة حاسمة نحو ذكاء اصطناعي أكثر أماناً وقائماً على الأدلة في الطب البيطري.