How Much Do LLMs Hallucinate in Document Q&A Scenarios? A 172-Billion-Token Study Across Temperatures, Context Lengths, and Hardware Platforms
تستخدم هذه الدراسة تقييماً ضخماً يمتد عبر 172 مليار توكن عبر نماذج وأطوال سياق وأجهزة عتادية متنوعة لتكشف أنه في حين أن اختيار النموذج هو المحدد الرئيسي للدقة، فإن معدلات الهلوسة في أسئلة وأجوبة المستندات ترتفع بشكل ملحوظ مع طول السياق وتتفاوت بشكل غير خطي مع درجة الحرارة، مما يسلط الض الضوء على أن القدرة على الاستناد إلى المراجع ومقاومة التزييف هما قدرتان متمايزتان.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت فريقًا من أمناء المكتبات فائق الذكاء (نماذج الذكاء الاصطناعي) للإجابة على الأسئلة بناءً فقط على مجموعة محددة من الكتب التي تعطيها لهم. أنت تريدهم أن يكونوا مثاليين: إذا لم تكن الإجابة موجودة في الكتب، يجب أن يقولوا: "لا أعرف". وإذا كانت الإجابة هناك، فيجب أن يجدوها فورًا.
لكن الحقيقة المخيفة التي تكشفها هذه الورقة هي: حتى أفضل أمناء المكتبات قد يؤلفون قصصًا أحيانًا. قد يخبرونك بثقة عن حقيقة ليست موجودة في الكتب، فقط لأنها تبدو منطقية. هذا ما يسمى بـ "الهلوسة" (Hallucination).
مؤلفو هذه الورقة، من "Kamiwaza AI"، لم يكتفوا بطرح بضعة أسئلة والتخمين؛ بل أجروا تجربة ضخمة — 172 مليار توكن من الاختبارات (وهذا يعادل قراءة الإنترنت بأكمله 10 مرات) — ليروا بالضبط كم مرة يكذب هؤلاء الأمناء، ولماذا.
إليك تفصيل نتائجهم، مترجمة إلى لغة يومية بسيطة:
1. مشكلة "حجم المكتبة" (طول السياق)
تخيل أنك أعطيت أمين مكتبة كتيبًا واحدًا؛ سيتمكن على الأرجب من الإجابة على أسئلتك بشكل مثالي. الآن، تخيل أنك أعطيته مكتبة تحتوي على 200,000 كتاب.
- النتيجة: كلما كبر حجم المكتبة، يصاب أمناء المكتبة بالارتباك ويبدأون في اختلاق الأمور.
- التشبيه: الأمر يشبه محاولة العثور على إبرة معينة في كومة قش. إذا كانت كومة القش صغيرة، ستجدها. أما إذا كانت الكومة بحجم جبل، فقد تلتقط قطعة عشوائية من القش وتدعي أنها الإبرة لأنك شعرت بالإرهاق.
- البيانات: عند حجم مكتبة صغير (32K)، يكذب أفضل نماذج الذكاء الاصطناعي بنسبة 1% فقط. ولكن عند حجم مكتبة ضخم (200K)، يبدأ كل نموذج ذكاء اصطناعي في الكذب بنسبة تزيد عن 10%. بعض النماذج، التي كانت رائعة في المكتبات الصغيرة، تنهار تمامًا وتبدأ في الكذب بنسبة 70% في المكتبات الضخمة.
2. فخ "الذكاء" مقابل "الأمانة"
قد تعتقد: "إذا كان أمين المكتبة ذكيًا حقًا، فلن يكذب". تثبت الورقة أن هذا خاطئ.
- النتيجة: القدرة على إيجاد الحقائق (الاستناد إلى المصدر - Grounding) تختلف تمامًا عن القدرة على رفض اختلاق الحقائق (مقاومة التزييف - Fabrication Resistance).
- التشبيه: فكر في نموذج مثل Llama 3.1 70B؛ إنه يشبه عبقريًا يمكنه العثي على أي كتاب في المكتبة فورًا (دقة تتجاوز 90% في إيجاد الحقائق). لكنه أيضًا "حكواتي" مهووس، سيخترع فصلًا جديدًا بالكامل إذا سألته عن شيء غير موجود. إنه "ذكي ولكن غير جدير بالثقة".
- المقارنة: النماذج الأخرى، مثل GLM 4.5، أقل "بهرجة" في إيجاد الأشياء، لكنها منضبطة للغاية؛ فهي نادرًا ما تخترع أشياءً. تُظهر الورقة أن الأمانة هي عادة تدريبية، وليست مجرد نتيجة لكون النموذج كبيرًا وذكيًا.
3. مقبض "درجة الحرارة" (مفتاح الفوضى)
تمتلك نماذج الذكاء الاصطناعي إعدادًا يسمى "درجة الحرارة" (Temperature).
- درجة حرارة منخفضة (0.0): يكون النموذج مثل الروبوت. يختار الكلمة التالية الأكثر منطقية في كل مرة.
- درجة حرارة مرتفعة (1.0): يكون النموذج مثل عازف الجاز. يأخذ مخاطرات ويجرب كلمات مختلفة.
- القاعدة القديمة: كان الجميع يعتقد: "من أجل الحقائق، اضبط المؤشر دائمًا على 0.0 (وضع الروبوت)".
- الاكتشاف الجديد: هذه نصيحة خطيرة!
- خلل "الروبوت": عند ضبطه على 0.0، خاصة مع المكتبات الضخمة، يعلق الذكاء الاصطناعي أحيانًا في حلقة مفرغة، ويكرر نفس الجملة للأبد (مثل الأسطوانة المشروخة). يحدث هذا 48 مرة أكثر عند ضبطه على 0.0 مقارنة بالإعدادات الأعلى!
- فائدة "الجاز": من المثير للدهشة أن رفع المؤشر قليلاً (إلى 0.4 أو 0.7) يساعد الذكاء الاصطناعي في بعض الحالات على التوقف عن الكذب ويمنعه من العلوق في حلقات مفرغة.
- الخلاصة: لا تضبطه على الصفر فحسب. أنت بحاجة إلى ضبطه بعناية.
4. أسطورة الأجهزة (Hardware)
كثير من الناس يقلقون: "إذا قمت بتشغيل هذا الذكاء الاصطناعي على شريحة NVIDIA، فهل سيكذب أقل مما لو استخدمت شريحة AMD أو Intel؟"
- النتيجة: لا. لا يهم.
- التشبيه: الأمر يشبه التساؤل عما إذا كانت السيارة تسير بشكل أفضل بمحرك هوندا أو محرك فورد. إذا كان السائق (نموذج الذكاء الاصطناعي) هو نفسه، فسيكون أداء السيارة متماثلًا. اختبرت الورقة ثلاثة من عمالقة الأجهزة ووجدت فرقًا معدومًا في مقدار كذب الذكاء الاصطناعي. يمكنك اختيار أجهزتك بناءً على السعر، وليس بناءً على الخوف من الهلوسة.
5. تصنيف "أفضل أمين مكتبة"
اختبرت الورقة 35 نموذجًا مختلفًا للذكاء الاصطناعي. إليكم التسلسل الهرمي الذي وجدوه:
- المعيار الذهبي: يُعد GLM 4.5 البطل الحالي. فهو يكذب بنسبة 1.2% فقط في أحجام المكتبات الصغيرة.
- النماذج "الكبيرة ولكن المحفوفة بالمخاطر": نماذج Llama الضخمة (مثل 405B أو 70B) تحظى بشعبية كبيرة، لكنها تكذب بنسبة تتراوح بين 25% إلى 50%. إنها بارعة جدًا في إيجاد الحقائق، لكنها سيئة جدًا في معرفة متى لا تجيب.
- النماذج "الصغيرة ولكن الأمينة": بعض النماذج الأصغر (مثل MiniMax) صادقة وموثوقة بشكل مفاجئ.
الصورة الكبيرة: ماذا يجب أن تفعل؟
إذا كنت صاحب عمل يحاول استخدام الذكاء الاصطناعي للإجابة على الأسئلة من مستنداتك:
- لا تثق في أكبر نموذج. الحجم لا يعني الأمانة. اختر عائلة نماذج معروفة بكونها "أمينة" (مثل GLM أو MiniMax) بدلاً من مجرد النموذج الذي يمتلك أكبر عدد من المعلمات (Parameters).
- راقب حجم مكتبتك. إذا قدمت للذكاء الاصطناعي الكثير من النصوص دفعة واحدة، فسيبدأ في الهلوسة. قم بتقسيم المستندات الكبيرة إلى أجزاء أصغر.
- لا تضبط درجة الحرارة على الصفر بشكل أعمى. قد يجعل ذلك الذكاء الاصطناعي يعلق في حلقات مفرغة أو يكذب أكثر. جرب إعدادًا متوسطًا (0.4 أو 0.7).
- تقبل أن الأكاذيب تحدث. حتى أفضل نماذج الذكاء الاصطناعي ستكذب بنسبة 1% من الوقت. أنت بحاجة إلى شبكة أمان (مراجعة بشرية أو فحوصات أخرى) للإمساك بتلك الأكاذيب.
باخت de مختصر: الذكاء الاصطناعي يصبح أكثر ذكاءً في العثور على المعلومات، لكنه لم يتعلم بعد كيف يكون صادقًا تمامًا. كلما زاد النص الذي تقدمه له، زاد احتمال اختلاقه للأمور. اختر أدواتك بحكمة، ولا تدع النموذج "الأكبر" يخدعك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.