← أحدث الأبحاث
💬 NLP

IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation

تقدم هذه الورقة البحثية "تكميم عدم اليقين الاستفهامي" (IUQ)، وهو إطار عمل مبتكر يستفيد من نموذج "الاستجواب ثم الاستجابة" لتكميم عدم اليقين على مستوى الادعاء والوفاء في توليد النماذج اللغوية الكبيرة طويل الأمد وحر الشكل، متفوقاً بذلك على الأساليب الحالية عبر نماذج ومجموعات بيانات متنوعة.

المؤلفون الأصليون: Haozhi Fan, Jinhao Duan, Kaidi Xu

نُشر 2026-04-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haozhi Fan, Jinhao Duan, Kaidi Xu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تجري مقابلة مع ذكاء اصطناعي واثق جدًا من نفسه، واسع الاطلاع، ولكنه "راوٍ غير موثوق" يُدعى "الذكاء الاصطناعي". تطلب من هذا الذكاء الاصطناعي كتابة سيرة ذاتية طويلة لشخص مشهور.

يكتب الذكاء الاصطناعي قصة رائعة مكونة من 500 كلمة. تنساب الكلمات بشكل مثالي، والقواعد النحوية ممتازة، والمنطق يبدو سليمًا. لكن هنا تكمن الخدعة: لقد اخترع الذكاء الاصطناعي القصة بأكملها. لقد أخطأ في مهنة الشخص، واخترع طفولة وهمية، وابتكر جائزة لم يفز بها أبدًا.

إذا قرأت القصة فقط، فستبدو مثالية. وإذا طلبت من الذكاء الاصطناعي كتابة القصة ثلاث مرات أخرى، فسيكتب ثلاث نسخ مختلفة من نفس القصة الوهمية. ستكون جميعها متسقة مع بعضها البعض، لكنها جميعًا أكاذيب.

هذه هي المشكلة التي تحاول ورقة البحث IUQ (الاستجواب لتحديد عدم اليقين - Interrogative Uncertainty Quantification) حلها.

الطريقة القديمة: طريقة "العناق الجماعي"

حاولت الطرق السابقة معرفة ما إذا كان الذكاء الاصطناعي يكذب عبر الطلب منه سرد القصة خمس مرات لمعرفة مدى تطابق القصص.

  • الخلل: إذا قرر الذكاء الاصطناعي الكذب بشأن مهنة الشخص، فسيستمر في الكذب بشأن هذه المهنة في جميع القصص الخمس للحفاظ على اتساق الحبكة. "تتفق" القصص مع بعضها البعض، لذا تعتقد الطرق القديمة: "رائع! إنها تتفق جميعًا، إذًا لا بد أن هذا صحيح!"
  • الاستعارة: الأمر يشبه سؤال خمسة أصدقاء التقوا للتو لوصف شخص غريب رأوه لمدة 5 ثافٍ. إذا اتفقوا جميعًا على تفصيل معين، تفترض أنه حقيقي. لكن إذا تهيأ لهم جميعًا نفس الشيء (هلوسة جماعية)، فسيظلون متفقين، وسوف تخدعك تلك الموافقة.

الطريقة الجديدة: "غرفة الاستجواب" (IUQ)

أدرك مؤلفو هذه الورقة أنه لكي تمسك بكاذب، لا يكفي أن تطلب منه تكرار القصة فحسب، بل يجب عليك استجوابه.

لقد ابتكروا نظامًا جديدًا يسمى IUQ. وإليك كيف يعمل، خطوة بخطوة، باستخدام تشبيه بسيط:

1. القصة (التوليد طويل المدى)

يكتب الذكاء الاصطناعي سيرته الذاتية الطويلة. لنقل إنها تتضمن الادعاء التالي: "كان شيغيرو فوكومومي ضابطًا في البحرية." (في الواقع، كان لاعب بيسبول).

2. التفكيك (استخراج الادعاءات)

يقوم النظام بتفكيك تلك القصة الطويلة إلى حقائق صغيرة ومنفردة (ادعاءات).

  • الادعاء (أ): "كان ضابطًا في البحرية."
  • الادعاء (ب): "ولد في عام 1976."
  • الادعاء (ج): "لعب لصالح فريق هانشين تايجرز."

3. الاستجواب (المستجوب)

هذا هو الجزء السحري. يأخذ النظام الادعاء (أ) ("كان ضابطًا في البحرية") ويضعه في غرفة منفصلة. ثم يوجه للذكاء الاصطناعي سؤالًا مباشرًا وجديدًا حول هذه الحقيقة تحديدًا، دون السماو له برؤية بقية القصة التي كتبها للتو.

  • السؤال: "ماذا كانت مهنة شيغيرو فوكومومي؟"
  • إجابة الذكاء الاصطناعي: "كان لاعب بيسبول."

4. الاستجواب المضاد (فحص الأمانة)

يقارن النظام بين القصة الأصلية (الادعاء أ: "ضابط بحرية") وبين الإجابة الجديدة ("لاعب بيسبول").

  • النتيجة: إنهما متناقضان! يقوم النظام بوضع علامة تنبيه باعتبار ذلك "كذبة".
  • الاستبصار: كان الذكاء الاصطناعي واثقًا بما يكفي لكتابة القصة، ولكن عندما سُئل سؤالًا مباشرًا وبسيطًا دون "سياق القصة" ليتكئ عليه، اعترف بالحقيقة (أو على الأقل، أعطى إجابة مختلفة).

5. تأثير الدومينو (الانتشار)

تشير الورقة إلى أنه إذا كذب الذكاء الاصطناعي بشأن أول شيء (المهنة)، فإنه غالبًا ما يكذب بشأن كل ما يتبع ذلك للحفاظ على منطقية القصة.

  • إذا قال إنه كان ضابطًا في البحرية، فقد يخترع مسيرة عسكرية وهمية.
  • يدرك نظام IUQ: "إذا كانت القاعدة (المهنة) كذبة، فإن المبنى بأكمله مهزوز".
  • لذلك، يقوم النظام بخفض درجة الثقة لـ السيرة الذاتية بأكملها، وليس لتلك الجملة الواحدة فقط.

لماذا يعد هذا أمرًا مهمًا؟

فكر في الذكاء الاصطناعي كطالب يؤدي اختبارًا.

  • الطريقة القديمة: يكتب الطالب مقالاً طويلاً. يتحقق المعلم مما إذا كان المقال منطقيًا داخليًا. إذا كان كذلك، يعطيه درجة "امتياز".
  • طريقة IUQ: يوقف المعلم الطالب، ويأخذ منه المقال، ثم يسأله: "حسنًا، ما هي الفكرة الرئيسية للفقرة الثالثة؟" إذا تلعثم الطالب أو أعطى إجابة مختلفة، فإن المعلم يعرف أن الطالب كان يرتجل ويكتب أشياء من خياله أثناء الكتابة.

النتائج

اختبر الباحثون هذا على العديد من نماذج الذكاء الاصطناعي المختلفة (مثل GPT-4، Llama، إلخ) باستخدام نوعين من الاختبارات:

  1. سير ذاتية لأشخاص حقيقيين (FActScore).
  2. أسئلة معرفية عامة (LongFact).

ووجدوا أن نظام IUQ أفضل بكثير في كشف هؤلاء "الكاذبين الواثقين" مقارنة بالطرق السابقة. فهو لا يكتفي بالتحقق مما إذا كان الذكاء الاصطناعي متسقًا مع نفسه؛ بل يتحقق مما إذا كان الذكاء الاصطناعي أمينًا للحقائق عندما يتم تجريده من سياقه الخاص.

الملخص

إن IUQ هو "جهاز كشف كذب" للقصص الطويلة التي ينتجها الذكاء الاصطناعي. بدلًا من مجرد طلب تكرار القصة من الذكاء الاصطناعي لمعرفة مدى اتساقها، يقوم النظام بتفكيك القصة، وتوجيه أسئلة مباشرة للذكاء الاصطناعي حول كل جزء، والتحقق مما إذا كانت الإجابات تتطابق مع القصة. إذا ناقض الذكاء الاصطناعي نفسه أثناء الاستجواب، فإن النظام يدرك أن القصة هي محض "هلوسة"، حتى لو بدت القصة مثالية تمامًا في نظرة أولى.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →