← أحدث الأبحاث
🤖 machine learning

GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning

يقدم GradCuit إطار عمل جديداً للاستدلال أثناء وقت الاختبار يعمل على تحسين الحالات الكامنة الوسيطة داخل طبقات المحولات (Transformer) باستخدام تدفق التدرج المباشر من النتائج النهائية، محققاً دقة ومتانة وقابلية تفسير فائقة مقارنة بالطرق الحالية من خلال تمكين النماذج من تكييف عمليات الاستدلال الداخلية الخاصة بها بدلاً من مجرد إعادة توليد المخرجات.

المؤلفون الأصليون: Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong Zheng

نُشر 2026-08-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong Zheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت عبقري لكنه عنيد قليلاً كيفية حل لغز معقد. لا يمكنك ببساطة إعادة كتابة عقل الروبوت (كوده الداخلي) لأن ذلك قد يؤدي إلى تعطل كل ما يعرفه بالفعل. بدلاً من ذلك، عليك التحدث إليه، وإعطاؤه تلميحات، والأمل في أن يجد الطريق الصحيح بنفسه. هذا هو عالم "النماذج اللغوية الكبيرة" (LLMs)، وهي برامج الدردشة الآلية فائقة الذكاء التي نستخدمها اليوم. عادةً، عندما يتعثر هؤلاء الروبوتات، نطلب منهم "التفكير بصوت عالٍ" عبر كتابة خطواتهم، تماماً مثل طالب يوضح خطوات حله في اختبار رياضيات. يُسمى هذا "سلسلة الأفكار" (Chain-of-Thought). ولكن في بعض الأحيان، حتى مع كل هذا الكلام، لا يزال الروبوت يخطئ في الإجابة.

مؤخراً، جرب العلماء حيلة جديدة: بدلاً من جعل الروبوت يكتب المزيد من الكلمات، حاولوا تحفيز "أفكاره غير المرئية" — الأرقام المخفية داخل عقله التي تحدث قبل أن يكتب حرفاً واحداً. أملوا أنه من خلال تعديل هذه الأرقام غير المرئية، سيفهم الروبوت الأمر فجأة. ومع ذلك، كانت الطريقة القديمة في القيام بذلك تشبه محاولة توجيه سفينة عبر الصراخ بالتعليمات من منارة بعيدة؛ حيث تضيع الإشارة، ومن الصعب معرفة أي جزء بالضبط من تفكير الروبوت يحتاج إلى إصلاح. تقدم هذه الورقة البحثية طريقة جديدة، أكثر دقة بكثير للقيام بذلك، حيث تحول الأسلاك الداخلية للروبوت نفسه إلى لوحة تحكم مباشرة.


الورقة البحثية: GradCuit – ضبط المقابض غير المرئية

تعرف على GradCuit (اختصار لـ "Gradient through Circuit" أو التدرج عبر الدائرة). فكر في النموذج اللغوي الكبير كمصنع ضخم متعدد الطوابق، حيث تدخل فكرة خام (السؤال) من الأسفل وتنتقل عبر العديد من الطوابق من العمال (الطبقات) قبل أن يخرج منتج نهائي (الإجابة) من الأعلى. في الماضي، إذا ارتكب المصنع خطأً، كان العلماء يحاولون إصلاحه بتغيير التعليمات المعطاة للعمال بعد أن بدأوا بالفعل في التحدث. كان الأمر فوضوياً وغير مباشر.

يغير GradCuit قواعد اللعبة من خلال إدخال "مقبض تحكم" خاص وغير مرئي في منتصف أرضية المصنع تماماً. فبدلاً من انتظار الروبوت ليتحدث ثم محاولة تصحيح كلماته، يقوم GradCuit بضبط هذه المقابض المخفية بينما لا يزال الروبوت يفكر. وهنا يكمن السحر: تُظهر الورقة أن الأسلاك الداخلية للروبوت (المسماة "الانتباه الذاتي" أو self-attention) تعمل كدائرة كهربائية مثالية. عندما تقوم بضبط مقبض في المنتصف، ينتقل التأثير فوراً وبوضوح إلى الإجابة النهائية، تماماً كما يؤدي الضغط على مفتاح إلى إضاءة مصباح معين.

ولأن هذا الاتصال مباشر للغاية، يمكن للعلماء استخدام "إشارة مكافأة" (مثل درجة "صحيح!" أو "خطأ!") لإخبار الروبوت بدقة كيف يضبط تلك المقابض. إذا كانت الإجابة خاطئة، يقوم النظام بحساب الاتجاه الدقيق الذي يجب أن تدفع به الأفكار غير المرئية لجعل المحاولة التالية أفضل. إنه يشبه امتلاك نظام تحديد مواقع (GPS) لا يكتفي فقط بإخبارك بأنك "ضائع"، بل يقوم فعلياً بتوجيه عجلات السيارة لتعيدك إلى الطريق، وكل ذلك دون تغيير محرك السيارة.

ما وجدوه

اختبر الباحثون هذه الطريقة الجديدة على خمسة أنواع مختلفة من الروبوتات الذكية وثلاثة تحديات استدلالية صعبة (مثل مسائل الرياضيات والأسئلة العلمية). كانت النتائج مثيرة للإعجاب حقاً:

  • نتائج أفضل: في المتوسط، نجح GradCuit في الحصول على الإجابات الصحيحة بنسبة 64.5%. وقد تفوق هذا على طريقة "التفكير بصوت عالٍ" القياسية بنسبة 6.6 نقطة مئوية، بل وتفوق حتى على أقوى طريقة منافسة تعتمد على "الأفكار غير المرئية" بنسبة 2.4 نقطة.
  • استقرار راسخ: أحد أكبر الصعوبات في طرق الضبط هذه هو أنها حساسة جداً لسرعة دوران المقابض (معدل التعلم). إذا قمت بتدويرها بسرعة كبيرة، سيصاب الروبوت بالجنون؛ وإذا كانت بطيئة جداً، فلن يتعلم أبداً. كان GradCuit مستقراً للغاية؛ فحتى عندما قام العلماء بتغيير إعدادات السرعة بشكل جامح، ظل GradCuit يعمل بشكل جيد. في الواقع، كان أداؤه ثابتاً لدرجة أن "التذبذب" (الانحراف المعياري) في درجاته انخفض من 1.53 إلى 0.82.
  • يعمل حتى بالصدفة: في اختبار مفاجئ، استبدل العلماء "إشارة المكافأة" الذكية باتجاهات عشوائية متذبذبة (مثل المشي العشوائي). وحتى بدون توجيه ذكي، ظل GradCந்து يعمل بشكل جيد تقريباً مثل الطرق الرائدة الأخرى. هذا يشير إلى أن "الطابق الأوسط" من عقل الروبوت هو مكان جيد حقاً لإجراء التغييرات، بغض النظر عن كيفية القيام بها.

لماذا يهم الأمر (وما ليس عليه)

نظرت الورقة أيضاً داخل الروبوت لمعرفة ما يحدث فعلياً. ووجدوا أن المقابض غير المرئية تؤثر غالباً على الكلمات "الرابطة" — تلك الكلمات الصغيرة مثل "لذلك"، "لأن"، و"ثم" التي تربط الحجة المنطقية معاً. يخبرنا هذا أن GradCuit لا يخمن كلمات عشوائية فحسب، بل يساعد الروبوت على بناء جسور منطقية أفضل بين أفكاره.

ومع ذلك، من المهم معرفة ما لا تفعله هذه الورقة. فهي لا تعلم الروبوت حقائق جديدة أو تغير ذاكرته الدائمة. وهي لا تعمل من خلال جعل الروبوت يجرب آلاف الإجابات المختلفة ويختار الأفضل (وهو أمر بطيء ومكلف). بدلاً من ذلك، تجد طريقة لجعل عملية تفكير الروبوت الحالية أكثر قوة وقابلية للتفسير.

يقترح المؤلفون أنه من خلال استخدام الدوائر الداخلية للروبوت لتوجيه هذه الأفكار المخفية، يمكننا جعل استدلال الذكاء الاصطناعي أكثر موثوقية وسهولة في الفهم. إنها خطوة نحو ذكاء اصطناعي لا يتوقع الإجابة الصحيحة فحسب، بل يدرك فعلياً كيف يفكر للوص_ل إليها، من خلال دفعة غير مرئية واحدة في كل مرة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →