← أحدث الأبحاث
🤖 AI

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

تقدم هذه الورقة ACT-Eval، وهو إطار تقييم معزز بالأدوات يقوم بتفكيك التعليق على الشطرنج إلى ادعاءات ذرية لتقييم الصحة الواقعية والتغطية الاستراتيجية، كاشفاً أنه بينما يقلل دمج الأدوات من الهلوسة في النماذج اللغوية الكبيرة، لا تزال هناك فجوات كبيرة في التفسير الاستراتيجي على مستوى الخبراء عبر كل من النماذج المملوكة والنماذج مفتوحة الأوزان.

المؤلفون الأصليون: S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath

نُشر 2026-08-06
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية لعب لعبة الشطرنج. لديك أداتان قويتان تحت تصرفك. أولاً، لديك "المحرك الخارق"، وهو آلة يمكنها حساب ملايين النقلات في الثانية وتعرف النقلة المثالية رياضياً لأي موقف. إنه يشبه عالم رياضيات عبقري يحل لغزاً فوراً، لكنه لا يتحدث إلا بلغة الأرقام الباردة والقاسية. ثانياً، لديك "الحكواتي"، وهو نموذج لغوي كبير (LLM). هذا الروبوت بارع للغاية في الكتابة والتحدث والشرح بطريقة يفهمها البشر. يمكنه سرد قصة مثيرة عن معركة، لكنه قد يختلق بعض الأمور لأنه لا "يرى" رقعة الشطرنج فعلياً؛ هو فقط يخمن الكلمات التي تأتي عادةً مع بعضها البعض.

السؤال الكبير الذي يطرحه العلماء هو: هل يمكننا الجمع بين هذين الاثنين؟ هل يمكننا جعل الحكواتي يستخدم عقل المحرك الخارق لكتابة تعليق يكون مثيراً وصادقاً بنسبة 100%؟ المشكلة هي أن الحكواتي غالباً ما "يهلوس"؛ فهو يصف القطع على مربعات لا توجد فيها، أو يخترع نقلات غير قانونية. حتى الآن، واجهنا صعوبة في كشف هذه الأكاذيب. إذا طلبت من روبوت تقييم قصة روبوت آخر، فقد ينخدع الروبوت المقيم بالكلمات المنمقة، ويغفل عن الأخطاء الواقعية تماماً. الأمر يشبه طلب تقييم قصة عن مباراة شطرنج من طالب لا يعرف قواعد الشطرنج؛ قد يعطي درجة "امتياز" لجودة الكتابة حتى لو وصف الطالب قطعة "حصان" وهي تطير مثل الطائر.

هذه الورقة البحثية، التي تحمل عنوان "الهلوسة على الرقعة"، تقدم طريقة جديدة لاختبار هؤلاء الحكواتي من الذكاء الاصطناعي تسمى ACT-Eval. لقد بنى الباحثون نظاماً يعمل كحكم صارم يمتلك قائمة مراجعة. فبدلاً من مجرد قراءة القصة وإعطاء درجة، يقوم ACT-Eval بتفكيك التعليق إلى حقائق صغيرة فردية، مثل "الملكة في المربع E4" أو "هذه النقلة تهدد بكش ملك". بعد ذلك، يرسل كل حقيقة صغيرة إلى المحرك الخارق للتحقق مما إذا كانت صحيحة بالفعل على الرقعة. إذا قالت القصة إن قطعة ما تهاجم مربعاً ما، فإن النظام يتحقق من الرقعة ليرى ما إذا كان ذلك صحيحاً حقاً. وإذا أغفلت القصة فكرة استراتيجية رئيسية قد يلاحظها خبير بشري، فإن النظام يشير إلى ذلك أيضاً.

النتائج كانت بمثابة جرس إنذار. وجد الباحثون أنه حتى أذكى نماذج الذكاء الاصطناعي، عندما تُترك لشأنها دون مساعدة المحرك الخارق، تخطئ في الحقائق بشكل مفاجئ. على سبيل المثال، ارتكب أحد النماذج رفيعة المستوى أخطاءً واقعية في حوالي 22% من ادعاءاته، بينما أخطأت النماذج الأصغر في أكثر من 40% من المرات. كانوا يقولون بثقة إن قطعة ما في مكان ليست فيه، أو يصفون تهديداً لا وجود له. ومع ذلك، عندما منح الباحثون هذه النماذج إمكانية الوصول إلى أدوات المحرك الخارق للتحقق من حقائقهم قبل الكتابة، انخفض معدل الخطأ بشكل كبير، وأصبحت النماذج أفضل بكثير في ذكر الحقيقة.

ولكن هناك عقبة. بينما ساعدت الأدوات النماذج على التوقف عن الكذب بشأن الحقائق، إلا أنها لم تجعل النماذج بالضرورة أفضل في فهم قصة المباراة. فحتى مع وجود الأدوات، غالباً ما فاتت نماذج الذكاء الاصطناعي الأفكار الاستراتيجية العميقة والذكية التي قد يلاحظها لاعب محترف بشري. يمكنهم إخبارك بأن القطع في أماكنها الصحيحة، لكنهم واجهوا صعوبة في شرح سبب كون النقلة عبقرية بطريقة تبدو مكتملة. تشير الورقة إلى أنه بينما يمكننا إصلاح قدرة الذكاء الاصطناعي على التحقق من الحقائق، فإن تعليم فهم "السبب" وراء النقلة يظل تحدياً صعباً للغاية. وتخلص الدراسة إلى أننا بحاجة إلى أدوات التحقق المساعدة هذه لنثق فيما يقوله الذكاء الاصطناعي، ولكن لا ينبغي أن نتوقع منهم استبدال الخبراء البشر في الوقت الحالي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →