← أحدث الأبحاث
💬 NLP

VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations

تقدم هذه الورقة VetScore، وهو إطار تقييم مرجح بالمخاطر للأسئلة والأجوبة الطويلة في المجال البيطري، يقيم مدى أمانة الادعاءات المُولدة لمقتطفات المصدر مع إعطاء الأولوية للادعاءات بناءً على ضررها المحتمل، محققاً توافقاً عالياً مع أحكام الخبراء.

المؤلفون الأصليون: Ivan Kartáč, Jan Tovarys, Mateusz Lango, Ondřej Dušek

نُشر 2026-08-05
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ivan Kartáč, Jan Tovarys, Mateusz Lango, Ondřej Dušek

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق تحاول حل لغز، ولكن بدلاً من مسرح جريمة، أنت تنظر إلى قصة طويلة ومفصلة كتبها روبوت ذكي للغاية، ولكنه مغرور أحياناً. هذا الروبوت هو ذكاء اصطناعي (AI) قرأ آلاف الكتب ويمكنه الإجابة على أي سؤال تطرحه عليه تقريباً. ومع ذلك، في عالم الطب -سواء للبشر أو لأصدقائهم من ذوي الفراء والريش والحراشف- فإن الخطأ في حقيقة ما ليس مجرد درجة سيئة؛ بل يمكن أن يكون خطيراً. إذا قال الروبوت إن كلباً يحتاج إلى كمية معينة من الدواء، لكنه أخطأ في الرقم، فقد يمرض الكلب.

ولمنع الروبوت من اختلاق الحقائق، علم العلماء هذا الروبوت أن "يوضح خطوات عمله" عبر إضافة استشهادات، مثل الهوامش الصغيرة التي تشير إلى الكتب الأصلية التي قرأها. لكن الأمر يشبه قول الروبوت: "لقد قرأت هذا في كتاب!". ولكن هنا يكمن الجزء الصعب: مجرد إشارة الروبوت إلى كتاب لا يعني أنه قرأ الصفحة الصحيحة، أو أنه فهم الجملة بشكل صحيح. أحياناً، قد يشير الروبوت إلى كتاب عن القطط بينما يتحدث عن الكلاب، أو قد يخترع جملة تبدو وكأنها تنتمي إلى الكتاب ولكنها ليست موجودة فيه حقاً. وهنا يبدأ العمل الحقيقي للمحقق: نحن بحاجة إلى طريقة لا تتحقق فقط مما إذا كان الروبوت قد استشهد بمصدر ما، بل أيضاً مما إذا كانت القصة التي رواها تتطابق بالفعل مع المصدر، ومدى سوء الأمر إذا كانت القصة خاطئة.

هذا هو بالضبط ما تعالجه ورقة البحث "VETSCORE". فقد قام الباحثون، بالتعاون مع خبراء بيطريين، ببناء أداة جديدة لتقييم الإجابات التي يولدها الذكاء الاصطناعي. لقد أدركوا أن ليس كل الأخطاء متساوية؛ فإذا أخطأ الروبوت في تاريخ ما (مثل قول إن دراسة حدثت في عام 2021 بدلاً من 2022)، فهذا أمر مزعج، لكن الكلب لن يتأذى على الأرجب. ولكن إذا أخطأ الروبوت في جرعة دواء للقلب، فهذه كارثة. لذا، ابتكروا نظاماً لا يكتفي فقط بعدّ الأخطاء، بل يزنها. إنهم يجزئون إجابة الذكاء الاصطناعي الطويلة إلى حقائق صغيرة سهلة الهضم. ثم، لكل حقيقة، يطرحون سؤالين: "هل وجد الروبوت هذه المعلومة بالفعل في الكتاب الذي استشهد به؟" و"ما مقدار الضرر الذي قد تسببه إذا كانت خاطئة؟". أخيراً، يدمجون هذه الإجابات في درجة واحدة تخبرنا بمدى أمان وموثوقية نصيحة الذكاء الاصطناعي.

اختبر الفريق هذا النظام من خلال جعل نماذج الذكاء الاصطناعي تولد إجابات لأسئلة بيطرية حقيقية، ثم جعل خبراء بشريين (أطباء بيطريين وطلاب) يقيمون نفس الإجابات. وقد وجدوا أن أداة "VETSCORE" الجديدة كانت جيدة جداً في مطابقة أحكام الخبراء البشريين، حتى عند استخدام نماذج ذكاء اصطناعي أصغر وأسرع للقيام بعملية التقييم. وتشير النت النتائج إلى أنه من خلال التركيز على مخاطر الخطأ بدلاً من مجرد عدد الأخطاء، يمكننا بناء طريقة أكثر أماناً للتحقق من الذكاء الاصطنا في المجالات عالية المخاطر مثل الطب البيطري. الأمر يشبه امتلاك مفتش سلامة لا يكتفي فقط بعدّ عدد الطوب غير المثبت في الجدار، بل يتحقق تحديداً مما إذا كانت الطوبات التي تحمل السقف مثبتة بإحكام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →