← أحدث الأبحاث
💬 NLP

Look Before You Leap: Factual Decoding with Internal Attribution Signals

تقدم الورقة البحثية DescaPE، وهو إطار عمل لفك التشفير يستخدم إشارات النموذج الداخلية المستمدة من نطاق طبقة بارزة واقعياً للكشف عن المسارات المعرضة للهلوسة ومعاقبتها أثناء الاستدلال، مما يحسن الواقعية بشكل كبير مع حد أدنى من زمن التأخير الإضافي.

المؤلفون الأصليون: Hayeong Ryu, JungMin Yun, Byeonggeuk Lim, Sunhee Jo, YoungBin Kim

نُشر 2026-09-15
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Hayeong Ryu, JungMin Yun, Byeonggeuk Lim, Sunhee Jo, YoungBin Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تُعد النماذج اللغوية الكبيرة محركات قوية للنصوص، قادرة على كتابة القصص، والإجابة على الأسئلة، وتلخيص الأفكار المعقدة. وهي تعمل من خلال التنبؤ بالكلمة التالية في الجملة، واحدة تلو الأخرى، لبناء استجابة تشبه سلسلة من قطع الدومينو التي تسقط بالتتابع. ومع ذلك، فإن هذه العملية نفسها تحمل خطراً خفياً: فإذا ارتكب النموذج خطأً واقعياً صغيراً في البداية، يمكن لهذا الخطأ أن يتضخم ككرة الثلج. فالنموذج، في محاولته للبقاء متسقاً مع كلماته السابقة، قد يضاعف من حدة الخطأ، ناسجاً رواية واثقة ولكنها كاذبة تماماً. هذه الظاهرة، المعروفة باسم "الهلوسة"، لا تزال تمثل أحد أكثر التحديات استعصاءً في الذكاء الاصطائي. وبينما حاول الباحثون إصلاح ذلك عبر تدريب النماذج على المزيد من البيانات أو إضافة أدوات خارجية للتحقق من الحقائق، إلا أن هذه الحلول غالباً ما تتطلب قدرة حوسبية هائلة أو تؤدي إلى إبطاء النظام بشكل كبير. وتكمن الصعوبة الجوهرية في حقيقة أنه بمجرد أن يبدأ النموذج في السير في مسار خاطئ، يصبح من الصعب جداً إيقافه دون إعادة كتابة دماغه بالكامل أو الانتظار حتى النهاية لتصحيح الخطأ.

اقترح فريق من الباحثين في جامعة تشونغ آنغ في كوريا الجنوبية طريقة جديدة للتعامل مع هذه المشكلة، وهي طريقة تعمل بمثابة "مكبح أمان" أثناء لحظة تفكير النموذج ذاتها. وقد أطلقوا على طريقتهم اسم "DESCAPE". فبدلاً من انتظار انتهاء النموذج من الجملة ثم التحقق مما إذا كانت صحيحة، أو محاولة إجبار النموذج على قول الحقيقة من خلال إعادة التدريب المكثف، نظروا إلى داخل الآلية الداخلية للنموذج أثناء عمله. واكتشفوا أنه بينما يقوم النموذج بتوليد النص، هناك مجموعة محددة من الطبقات الداخلية — نطاق متميز من خطوات المعالجة — تضيء بشكل مختلف عندما يسترجع النموذج حقائق حقيقية مقابل عندما يختلق أشياء من خياله. تعمل هذه الإشارة الداخلية كإشارة دقيقة على الموثوقية، حيث ترتفع وتنخفض في نمط يكشف ما إذا كان النموذج يقف على أرض صلبة أم ينزلق نحو الخيال.

وجد الباحثون أن هذه الإشارة ليست موحدة عبر النموذج بأكمله. فمن خلال حجب أجزاء من المعالجة الداخلية للنموذذج بشكل منهجي، حددوا نطاقاً معيناً من الطبقات "المميزة للحقائق" (factual-salient) وهو أمر بالغ الأهمية لاسترجاع المعلومات الدقيقة. فعندما يقوم النموذج بتوليد حقيقة صحيحة، يتصرف هذا القسم من الشبكة بطريقة ثابتة ومتوقعة. ومع ذلك، عندما يوشك النموذج على توليد هلوسة، ينتج هذا القسم نفسه طفرة شاذة ومفاجئة. الأمر كما لو أن بوصلة النموذج الداخلية تعطي صدمة تحذيرية حادة قبل أن يقود المحادثة نحو الهاوية. وأدرك الفريق أنه إذا تمكنوا من اكتشاف هذه الطفرة في الوقت الفعلي، فيمكنهم التدخل قبل اختيار الكلمة الخاطئة، وتوجيه النموذج مرة أخرى نحو الحقيقة.

ولجعل هذا الأمر عملياً، قام الباحثون بتدريب مساعد صغير وخفيف الوزن، أطلقوا عليه اسم "المسبار" (probe)، للتعرف على علامات التحذير هذه. لا يحتاج هذا المسبار إلى إعادة قراءة النص بأكمله أو تشغيل عملية تحقق منفصلة وبطيئة؛ بل إنه يراقب الإشارات الداخلية للنموذง الرئيسي أثناء توليده لكل كلمة. وعندما يكتشف المسبار الطفرة المميزة المرتبطة باحتمالية حدوث هلوسة، فإنه يصنف اختيار تلك الكلمة تحديداً على أنه عالي المخاطر. بعد ذلك، يقوم النظام بتعديل تقييم الكلمات المحتملة التالية، حيث يقلل من قيمة الكلمات المحفوفة بالمخاطر ويعزز فرص اختيار الكلمات المستندة إلى الحقائق. ويحدث هذا فوراً، في نفس الجزء من الثانية الذي يستغرقه النموذج للتفكير في الكلمة التالية.

جاءت نتائج هذا النهج دقيقة وفعالة في آن واحد. ففي الاختبارات عبر خمسة معايير مختلفة مصممة لقياس الدقة الواقعية، نجحت طريقة DESCAPE في تقليل الهلوسة وتحسين صدق النص المولد. وفي اختبار محدد يتعلق بالسير الذاتية طويلة المدى، حققت الطريقة درجة 67.20، متفوقة بشكل كبير على التقنيات الحالية الأخرى. ولعل الأهم من ذلك هو أن هذا التحسن جاء دون تكلفة تذكر في السرعة؛ إذ لم يضف النظام سوى تأخير ضئيل جداً، يعادل تقريباً 1.10 ضعف سرعة النموذج القياسي غير المدعوم. وهذا يتناقض بشكل صارخ مع الطرق الأخرى التي قد تبطئ العملية بسبع مرات أو أكثر لأنها تتطلب من النموذج التوقف، والتفكير، وإعادة كتابة إجاباته.

كما فحص الباحثون كيفية تعامل هذه الطريقة مع أنواع مختلفة من الأسئلة. فبالنسبة للأسئلة مفتوحة النهايات حيث يُتوقع إجابة سردية مفصلة، عملت الطريقة بشكل استثنائي، مما منع النموذج من الانزلاق إلى قصص كاذبة. أما بالنسبة للأسئلة القصيرة والمحددة، فقد كانت النتائج مختلطة نوعاً ما، ويرجع ذلك إلى حد كبير إلى أن الطريقة شجعت النموذج أحياناً على تقديم إجابات أطول وأكثر تفصيلاً مما تفضله قواعد التقييم الصارمة. ومع ذلك، عندما تم تعديل التقييم للبحث عن وجود معلومات صحيحة بدلاً من المطابقة التامة للكلمات، تحسن الأداء، مما يشير إلى أن الطريقة كانت تجد بالفعل الحقائق الصحيحة حتى لو اختلف الصياغة قليلاً.

أحد أكثر الجوانب إثارة للإعجاب في هذا العمل هو أنه لا يتطلب من النموذج أن يعرف أنه مراقب. يعمل المسبار بصمت في الخلفية، مستخدماً الإشارات الموجودة بالفعل داخل بنية النموذج نفسه. فهو لا يعتمد على قاعدة بيانات خارجية للحقائق أو نموذج ثانٍ للتحقق. بدلاً من ذلك، يستفيد من حقيقة أن النموذج نفسه يمتلك بصمة داخلية متميزة للصدق والكذب. ومن خلال الاستماع إلى هذه البصمة، يمكن للنظام التدخل في اللحظة التي توشك فيها الخطأ على الحدوث، مما يوقف كرة الثلج بفعالية قبل أن تكتسب زخماً.

كما استكشفت الدراسة حدود هذا النهج. وأشار الباحثون إلى أن الطبقات الداخلية المحددة التي تشير إلى الصدق تختلف قليلاً من نموذج لآخر، مما يعني أن النظام يحتاج إلى معايرة لكل نموذج جديد يتم تطبيقه عليه. كما وجدوا أنه بينما تعد الطريقة ممتازة في رصد الأخطاء عندما يمتلك النموذج المعرفة ولكنه يختار المسار الخاطئ، إلا أنها أقل فعالية في تحديد الحالات التي لا يعرف فيها النموذج الإجابة على الإطلاق. في تلك الحالات، قد يظل النموذج يولد استجابة واثقة ولكن غير صحيحة لأن الإشارة الداخلية لـ "عدم المعرفة" ليست متميزة مثل إشارة "الهلوسة".

رغم هذه التفاصيل، تقدم النتائج اتجاهاً واعداً لجعل الذكاء الاصطناعي أكثر موثوقية. فمن خلال التعامل مع الهلوسة ليس كعيب يجب إصلاحه بعد وقوعه، بل كنمط يمكن اكتشافه داخل عملية التوليد نفسها، أظهر الباحثون أنه من الممكن توجيه النموذج للعودة إلى الواقع في الوقت الفعلي. وتثبت الطة أن الأدوات اللازمة لمنع الأخطاء موجودة بالفعل داخل النموذج؛ بل احتاجت فقط إلى العثور عليها وضبطها. ويشير هذا النهج إلى مستقبل يمكن فيه لنماذج اللغات الكبيرة توليد نصوص إبداعية ومعقدة مع الحفاظ على فحص مستمر وصامت لدقتها، مما يضمن أن تظل القصص التي ترويها راسخة في الحقيقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →