تقترح الورقة البحثية إطار عمل CoLT، وهو إطار عمل مبتكر يعزز كفاءة استدلال النماذج اللغوية الكبيرة من خلال توليد رموز بذرية (seed tokens) تحفز النماذج الخارجية على فك تشفيرها إلى خطوات استدلال كاملة، مما يحقق دقة أعلى وأطوال استدلال أقصر دون الحاجة إلى تعزيز بنية النموذج أو التدريب الشامل.
تخيل أن لديك طباخاً عبقرياً ولكنه مشغول جداً (النموذج اللغوي الكبير) يحاول حل مسألة رياضية معقدة. عادةً، لحل المسألة، يتعين على الطباخ كتابة كل خطوة من خطوات تفكيره على ورقة طويلة، كلمة بكلمة. هذا ما يسمى "سلسلة الأفكار" (Chain-of-Thought). هذا الأسلوب فعال، لكنه يستغرق وقتاً طويلاً في الكتابة والقراءة، مما يجعل العملية بطيئة ومكلفة.
حاول بعض الباحثين تسريع هذه العملية من خلال توجيه الطباخ لـ "التفكير بصمت" داخل رأسه دون كتابة أي شيء. لكن هذا يشبه مطالبة الطباخ بحفظ وصفة كاملة في ذاكرته دون تدوين ملاحظات؛ الأمر صعب، ويتطلب غالباً إعادة بناء دماغ الطباخ (تغيير بنية النموذج)، وأحياناً ينسى الطباخ الخطوات أو يصاب بالارتباك.
CoLT هي طريقة ذكية لمساعدة الطباخ على التفكير بسرعة دون أن يفقد قدرته على شرح عمله. إليك كيف تعمل، باستخدام تشبيه بسيط:
نظام "الملاحظة السرية"
بدلاً من كتابة فقرة كاملة من الاستنتاج، يكتب الطباخ ملاحظة سرية صغيرة (تسمى "رمز البذرة" أو seed token).
الملاحظة: هذه الملاحظة هي مجرد رموز خاصة قليلة. لا تبدو كجملة، لكنها تحتوي على كل "النكهة" والمعلومات الخاصة بخطوة استنتاج كاملة، مضغوطة في حزمة صغيرة جداً.
المُفكك (المترجم): عندما يكتب الطباخ هذه الملاحظة السرية، فإنه يقرع جرساً. يسمع مساعد صغير وسريع (المُفكك/الـ decoder) صوت الجرس، فيلتقط الملاحظة السرية، ويترجمها فوراً إلى جمل كاملة ومقروءة.
الحلقة: يقرأ الطباخ الجمل المترجمة، ويضيفها إلى عمله، ثم يكتب الملاحظة السرية التالية للخطوة التالية.
لماذا هذا أفضل؟
السرعة: كتابة ملاحظة سرية أسرع بكثير من كتابة فقرة كاملة. يقضي الطباخ وقتاً أقل في "الطباعة" ووقتاً أكثر في الحل.
الوضوح: على عكس طرق "التفكير الصامت" حيث يظل الاستنتاج مخفياً للأبد، يقوم CoLT بترجمة الملاحظات مرة أخرى إلى نص عادي. لذا، في نهاية اليوم، لا يزال لديك قصة واضحة ومقروءة لكيفية حل المشكلة. لم يفقد الطباخ قدرته على التحدث؛ بل تعلم فقط لغة مختصرة.
لا حاجة لإعادة البناء: لا تحتاج إلى إعادة بناء دماغ الطباخ. أنت فقط تضيف مساعداً صغيراً (المُفكك) يعرف كيفية ترجمة الملاحظات. يظل الطباخ الرئيسي كما هو تماماً.
سحر "استدعاء الأداة" (Tool Call)
تسمي الورقة البحثية هذا "استدعاء الأداة". تخيل الأمر كأن الطباخ يقول: "أحتاج إلى مترجم لهذه الخطوة!"
يقوم النظام بتوليد رمز تشغيل خاص (مثل ضغطة زر).
يختار النظام المترجم المناسب (المُفكك) بناءً على ذلك الزر.
يأخذ المترجم "الفكرة" المخفية داخل الزر ويفك تشفيرها إلى كلمات.
ماذا وجدوا؟
اختبر الباحثون هذا على المسائل الرياضية (مثل مسائل الكلمات في المرحلة الابتدائية).
أسرع: أدت طريقة "الملاحظة السرية" إلى إنتاج سلاسل استنتاج أقصر بكثير من كتابة كل شيء، وكانت أسرع من طرق "التفكير الصامت" الأخرى.
أذكى: حققت بالفعل درجات أفضل (دقة أعلى) من طرق الاختصار الأخرى.
مرنة: جربوا أنواعاً مختلفة من "المترجمين" (بعضها كان بسيطاً، وبعضها معقداً). كانت أفضل النسخ هي نسخ صغيرة وسريعة من دماغ الطباخ الرئيسي (Transformers)، ولكن حتى المترجمين الأكثر بساطة عملوا بشكل جيد.
التعلم: حتى أنهم علموا النظام كيف يتعلم من أخطائه باستخدام تقنية "التعلم التعزيزي" (Reinforcement Learning). استطاع النظام تجربة مسارات مختلفة، وتلقي الملاحظات، وأن يصبح أفضل في حل المسائل الصعبة.
باختختصار
CoLT يشبه إعطاء ذكاء اصطناٍعي فائق الذكاء لغة مختصرة. فهو يسمح للذكاء الاصطناعي بضغط تفكيره في حزم صغيرة وفعالة، ويسمح لمساعد بفك تشفيرها فوراً، ثم مواصلة العمل. إنه يحافظ على سرعة "التفكير الصامت" وفي الوقت نفسه يحافظ على وضوح "كتابة كل شيء"، وكل ذلك دون الحاجة إلى إعادة بناء دماغ الذكاء الاصطناعي من الصفر.
ملخص تقني: CoLT – الاستدلال باستخدام سلاسل استدعاء الأدوات الكامنة
بيان المشكلة
أثبت أسلوب "سلسلة الأفكب" (Chain-of-Thought - CoT) أهميته الجورية في تعزيز قدرات الاستدلال لدى النماذج اللغوية الكبيرة (LLMs) من خلال تقسيم المشكلات المعقدة إلى خطوات متسلسلة. ومع ذلك، يتطلب أسلوب CoT الصريح توليد سلاسل الاستدلال خطوة بخطوة (token-by-token)، مما يؤدي إلى تكاليف حوسبة عالية أثناء الاستنتاج. وبينما تم اقتراح طرق CoT ضمنية (مثل COCONUT وCODI وCOLAR) للاستدلال في فضاء كامن مستمر لتقليل طول الرموز (tokens)، إلا أنها تعاني عموماً من قصورين حرجين:
الجمود الهيكلي: غالباً ما تتطلب تعديلات كبيرة في بنية النموذج وتدريباً مكثفاً.
قابلية التطبيق: تحد هذه القيود من اعتمادها على نطاق أوسع عبر المهام وهياكل النماذج المختلفة.
علاوة على ذلك، فإن طرق الاستدلال الكامنة الموجودة تعمل غالباً بالكامل في فضاء كامن "صندوق أسود"، مما قد يضحي بالقابلية للتفسير وقدرات الاستدلال المدربة مسبقاً للنموذج الأساسي.
المنهجية: إطار عمل CoLT
يقترح المؤلفون إطار عمل CoLT (سلسلة الأدوات الكامنة - Chain-of-Latent-Tools)، وهو إطار مبتدئ ينفذ الاستدلال الكامن كـ "استدعاءات أدوات بارامترية". بدلاً من الاستدلال بالكامل داخل الفضاء الكامن، يسمح CoLT للنموذج اللغوي الكبير الأساسي بالعمل في فضاء الرموز الصريح مع إسناد عملية توسيع خطوات الاستدلال إلى فك تشفير خارجي قابل للتفاضل.
الآلية الجوهرية
رموز البذرة واستدعاءات الأدوات الكامنة: خلال عملية الاستدلال، يولد النموذج اللغوي الكبير رموز "بذرة" (seed tokens) خاصة لتمثيل خطوة استدلال مكثفة. وتتكون هذه الرموز من:
رموز المتن (<BDY>): حاملة لتمثيلات كامنة (embeddings) تحتوي على المعلومات المضغوطة لخطوة الاستدلال.
رموز المحفز (<TRG>): مؤشرات تشير إلى نهاية استدعاء الأداة الكامنة وتحدد أي مفكك تشفير خارجي يجب استدعاؤه.
فك التشفير القابل للتفاضل: عند ظهور رمز المحفز، يتم استخراج الحالات الخفية (hidden states) لرموز البذرة وتمريرها إلى مفكك تشفير خارجي قابل للتفاضل (على سبيل المثال، Transformer خفيف الوزن، أو RNN، أو مفكك Multi-hot).
يقوم مفكك التشفير هذا بفك ضغط الحالات الخفية وإعادتها إلى رموز نصية صريحة كاملة (مثل المعادلات الرياضية).
يتم دمج هذه الرموز المفككة مع السياق، ويواصل النموذج اللغوي الكبير توليده التتابعي (autoregressive) مع السياق المحدث والقابل للقراءة.
أهداف التدريب: يتم تدريب إطار العمل بشكل كامل (end-to-end) باستخدام مكوني خسارة تحت الإشراف:
الخسارة الرئيسية (Lmain): تضمن أن النموذج الأساسي يولد رموز البذرة وإشارات المحفز بشكل صحيح.
الخسارة الكامنة (Llat): تضمن أن مفكك التشفير يعيد بناء الرموز النصية بشكل صحيح من تمثيلات البذرة الكامنة.
إجمالي الخسارة:Lsup=Lmain+Llat.
التوافق مع التعلم التعزيزي (RL): بما أن مفاتيح التشفير قابلة للتفاضل ويمكنها دعم أخذ العينات (sampling)، يمكن نمذجة عملية الاستدلال بأكملها كحوار متعدد الجولات. وهذا يسمح بتطبيق تحسين السياسة النسبي للمجموعات (GRPO) لاستكشاف مسارات استدلال متنوعة وتعزيز السلاسل الصحيحة دون حقن الضوضاء يدوياً.
المساهمات الرئيسية
إطار عمل مبتكر: يقدم CoLT طريقة لتنفيذ الاستدلال الكامن كاستدعاءات للأدوات، مما يمكّن النموذج الأساسي من الاستدلال في فضاء النص المدرب مسبقاً مع ضغط الخطوات المتوسطة في رموز البذرة.
مرونة مفكك التشفير: صمم المؤلفون وقيموا هياكل مختلفة لمفكك التشفير (Transformer، RNN، Multi-hot)، موضحين أنه بينما يحقق Transformer أفضل أداء، فإن إطار العمل قابل للتكيف مع أشكال مختلفة.
الكفاءة والأداء: يحقق CoLT دقة أعلى وأطوال استدلال أقصر مقارنة بنماذج الاستدلال الكامنة المرجعية (بما في ذلك COCONUT وCODI وCOLAR وSIM-CoT)، ويتطلب دورات تدريبية أقل وتعديلات هيكلية أقل.
التكامل مع التعلم التعزيزي: ثبت توافق إطار العمل مع خوارزميات التعلم التعزيزي، مما يسمح بتحقيق مكاسب في الأداء على مجموعات البيانات الصعبة من خلال الاستكشاف.
النتائج التجريبية
قيم المؤلفون CoLT على أربعة معايير للاستدلال الرياضي: GSM8k، وGSM8k-hard، وSVAMP، وMultiArith.
الدقة مقابل الطول: تفوق CoLT على النماذج المرجعية للاستدلال الكامن (بما في ذلك COCONUT وCODI وCOLAR وSIM-CoT) في كل من الدقة وطول سلسلة الاستدلال. على سبيل المثال، في GSM8k-Aug، حقق CoLT تحسناً في الدقة بنسبة 5% عن COLAR (2x) مع تقليل طول رموز الاستدلال من 12.7 إلى 7.73.
التعميم: أظهر النموذج قدرة قوية على التعميم خارج النطاق، لا سيال في مجموعة بيانات MultiArith حيث تفوق على نموذج CoT الخاضع للإشراف.
دراسات الاستئصال (Ablation Studies):
طبقات مفكك التشفير: أدى زيادة طبقات مفكك التشفير وطول رموز البذرة إلى تحسين الدقة، وإن كان ذلك بعوائد متناقصة بالنسبة للتكلفة الحوسبية.
هيكل مفكك التشفير: حققت مفكات التشفير من نوع Transformer أفضل أداء، تلتها RNNs. أما مفكات التشفير من نوع Multi-hot فقد كان أداؤها ضعيفاً، مما يشير إلى أن الهياكل التكرارية (recurrent structures) هي الأنسب لفك حزم البذور.
التعلم التعزيزي: أدى تطبيق GRPO على نماذج CoLT على مجموعتي بيانات GSM8k-Aug وMATH (باستخدام DeepSeek-R1-Distill-Qwen-1.5B) إلى تعزيز الأداء بشكل أكبر، مما أثبت قدرة إطار العمل على التعلم من مسارات الاستدلال المتنوعة.
الأهمية والادعاءات
يزعم البحث أن CoLT يقدم حلاً عملياً للمفاضلة بين كفاءة الاستدلال وقدرة النموذج. ومن خلال تثبيت النموذج الأساسي في فضاء النص المدرب مسبقاً واستخدام مفكات تشفير خارجية للتعامل مع التوسع "الكامن"، يحافظ CoLT على قابلية تفسير سلاسل الاستدلال (المخرج النهائي هو نص كامل) مع تقليل تكاليف الاستنتاج بشكل كبير.
يؤكد المؤلفون أن CoCT يتطلب تعديلاً طفيفاً في بنية النموذج الأصلية، مما يجعله أكثر قابلية للتطبيق على نطاق واسع من طرق الاستدلال الكامنة السابقة التي تتطلب تغييرات هيكلية ثقيلة. بالإضافة إلى ذلك، فإن توافق إطار العمل مع التعلم التعزيزي يشير إلى مسار لتوسيع نطاق الاستدلال الكامن لمهام أكثر تعقيداً، بشرما يتم ضبط دقة استدعاءات الأدوات وهياكل مفكك التشفير لتناسب المجال المحدد. ويخلص البحث إلى أنه رغم تركيزه حالياً على الاستدلال الرياضي، فإن مفهوم استدعاء الأدوات الكامنة يحمل إمكانات لتطبيقات أوسع، بما في ذلك استرجاع الكيانات والاستدلال متعدد الوسائط.