ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation
تقدم هذه الورقة ESG-Bench، وهو مجموعة بيانات مرجعية مُوسومة بشرياً صُممت لتقييم والحد من الهلوسة في النماذج اللغوية الكبيرة عند تحليل تقارير الحوكمة البيئية والاجتماعية وحوكمة الشركات المعقدة، مما يثبت أن استخدام أسلوب "سلسلة الأفكار" (Chain-of-Thought) في التلقين والضبط الدقيق على هذه المجموعة من البيانات يحسنان بشكل كبير من الدقة الواقعية والقدرة على التعميم.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق يحاول حل لغز، ولكن بدلاً من مسرح جريمة، فإن "مسرح جريمتك" هو تقرير مؤسسي ضخم مكون من 300 صفحة حول كيفية تعامل شركة ما مع البيئة، والعمال، والمديرين. هذا هو تقرير الحوكمة البيئية والاجتماعية وحوكمة الشركات (ESG).
في الماضي، كانت الشركات تكتب هذه التقارير طواعية. أما الآن، فالعديد من الحكومات تقول: "يجب عليكم كتابة هذه التقارير، ويجب أن تكون حقيقية". لكن هذه التقارير ضخمة، ومربكة، وأحياناً تحاول الشركات خداع الناس عبر المبالغة في إنجازاتها الجيدة (وهي ممارسة تسمى "الغسل الأخضر" أو Greenwashing).
هنا يأتي دور الذكاء الاصطناعي (النماذج اللغوية الكبيرة). قد تفكر: "رائع! دعونا نطلب من الذكاء الاصطناعي قراءة هذه الـ 300 صفحة وإخبارنا بالحقيقة".
إليك المشكلة: الذكاء الاصطناعي كاذب واثق.
إذا سألت ذكاءً اصطناعياً سؤالاً حول صفحة محددة في مستند مكون من 300 صفحة، فقد لا ينظر فعلياً إلى تلك الصفحة، بل قد يخمن بناءً على ما "يتذكره" من تدريبه العام. قد يقول: "أوه، لقد زرعوا بالتأكيد 1,000 شجرة!" بينما يقول التقرير في الواقع إنهم زرعوا 10 أشجار فقط. تُسمى هذه الظاهرة "الهلوسة" (Hallucination). وفي عالم التمويل والقانون، الكذبة الواثقة أمر خطير.
الحل: ESG-Bench
قام الباحثون في هذه الورقة البحثية ببناء "صالة ألعاب رياضية للذكاء الاصطناعي" تسمى ESG-Bench.
فكر في ESG-Bench كأرض تدريب متخصصة حيث أنشأوا مكتبة ضخمة من تقارير ESG الحقيقية ومجموعة من الأسئلة الماكرة حولها.
- الاختبار: طلبوا من الذكاء الاصطناعي الإجابة على أسئلة بناءً فقط على النص المقدم.
- التقييم: قام خبراء بشريون (طلاب دكتوراه في الاستدامة) بدور الحكام. لقد فحصوا كل إجابة من إجابات الذكاء الاصطناعي.
- صحيح: وجد الذكاء الاصطناعي الحقيقة في النص.
- هلوسة: اخترع الذكاء الاصطناعي شيئاً ما أو أغفل حقيقة كانت موجودة هناك بالفعل.
- التحول المفاجئ: علموا الذكاء الاصطناعي أيضاً متى يقول "لا أعرف"، إذا لم تكن الإجابة موجودة في النص.
السلاح السري: سلسلة الأفكـار (Chain-of-Thought - CoT)
وجدت الورقة البحثية أن مجرد تغذية الذكاء الاصطناعي بمزيد من البيانات لم يحل مشكلة الكذب. كان الذكاء الاصطناعي بحاجة إلى تعلم كيف يفكر قبل أن يتحدث.
استخدم الباحثون تقنية تسمى "سلسلة الأفكار" (CoT). تخيل أنك تطلب من طالب حل مسألة رياضية.
- الذكاء الاصطناعي السيئ: يلقي الإجابة فحسب. "الإجابة هي 42!" (حتى لو كانت خاطئة).
- الذكاء الاصطناعي الذي يستخدم (CoT): يُجبر على كتابة خطواته أولاً.
- "حسناً، السؤال يسأل عن استخدام المياه."
- "أحتاج إلى البحث في التقرير عن كلمة 'مياه'."
- "لقد وجدت جدولاً في الصفحة 45."
- "الجدول يقول 500 لتر."
- "لذلك، الإجابة هي 500 لتر."
ابتكر الباحثون طريقة خاصة تسمى "سلسلة الأفكار المكونة من 4 خطوات" لتقارير ESG. لقد علموا الذكاء الاصطناعي أن:
- يحدد الموضوع.
- يبحث في المستند عن أدلة.
- يقرر ما إذا كانت الإجابة موجودة بالفعل أم لا.
- بعد ذلك فقط يعطي الإجابة (أو يعترف بالهزيمة).
النتائج
عندما دربوا الذكاء الاصطناعي باستخدام طريقة "التفكير أولاً" هذه، كانت النتائج مذهلة:
- كذب أقل: توقف الذكاء الاصطناعي عن اختلاق الحقائق.
- أمانة أفضل: عندما لم تكن الإجابة في التقرير، تعلم الذكاء الاصطناعي أن يقول "لا يمكنني العثور على ذلك"، بدلاً من التخمين.
- مهارات عامة: هذا التدريب لم يساعدهم في تقارير ESG فحسب؛ بل جعل الذكاء الاصطناعي أفضل في الإجابة على الأسئلة في مجالات أخرى (مثل البيولوجيا أو المعلومات العامة).
الصورة الكبيرة
فكر في هذه الورقة البحثية كأنها دورة تعليم قيادة جديدة للذكاء الاصطناعي.
قبل ذلك، كان سائقو الذكاء الاصطناعي يسرعون عبر المدينة، ويخمنون أين توجد لوحات التوقف، مما يتسبب غالباً في حوادث (الهلوسة).
الآن، بفضل ESG-Bench، يتعلم سائقو الذكاء الاصطناعي:
- النظر إلى لوحات الطريق (المستند).
- تفقد مراياهم (البحث في النص).
- التوقف إذا لم يكونوا متأكدين (الامتناع عن الإجابة).
هذا أمر بالغ الأهمية لأن الذكاء الاصطناعي عندما يبدأ في تولي مهام أكثر أهمية مثل فحص القوانين المؤسسية أو السجلات الطبية، لا يمكننا تحمل كونه كاذباً واثقاً. نحن بحاجة لأن يكون محققاً حذراً وصادقاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.