← أحدث الأبحاث
🤖 machine learning

Amortizing intractable inference in large language models

تقترح هذه الورقة استخدام شبكات التدفق الموزعة (GFlowNets) لاستيعاب الاستدلال المستعصي في النماذج اللغوية الكبيرة، مما يمكنها من أخذ عينات من توزيعات خلفية معقدة لمهام مثل التوليد المقيد والاستدلال عبر سلسلة الأفكار كبديل فعال في استهلاك البيانات مقارنة بالتدريب التقليدي القائم على تعظيم الاحتمالية القصوى أو تعظيم المكافأة.

المؤلفون الأصليون: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

نُشر 2026-09-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تُعد النماذج اللغوية الكبيرة مكتبات شاسعة من المعرفة البشرية، مضغوطة في شبكات رقمية تتنبأ بالكلمة التالية في الجملة بناءً على ما سبقها. لقد تم تدريبها لتكون ممتازة في إكمال قصة أو الإجابة على سؤال عند إعطائها نقطة بداية، وهي عملية تتدفق بشكل طبيعي من اليسار إلى اليمين. ومع ذلك، فإن العديد من المهام الأكثر إثارة للاهتمام التي نريد من هذه النماذج القيام بها تتطلب التفكير بشكل عكسي أو ملء منتصف القصة. تخيل أنك أُعطيت بداية ونهاية حكاية وطُلب منك ابتكار المنتصف، أو طُلب منك شرح المنطق وراء إجابة محددة. في هذه السيناريوهات، لا يمكن للنموذج ببسا আসে تخمين الكلمة التالية؛ بل يجب عليه البحث عبر مشهد هائل ومعقد من الاحتمالات للعثور على المسار المحدد الذي يربط البداية بالنهاية. هذه مشكلة رياضية صعبة لأن عدد المسارات الممكنة هائل لدرجة أن فحصها واحداً تلو الآخر أمر مستحيل، كما أن الطرق القياسية للتنقل في هذا المشهد غالباً ما تتعثر في مسار أو مسارين شائعين فقط، مما يؤدي إلى تفويت التنوع الغني للحلول الصالحة الموجودة.

لقًد طور باحثون في معهد "ميلا" (Mila) للذكاء الاصطناعي في كيبيك وجامعة أكسفورد طريقة جديدة لتعليم هذه النماذج كيفية التنقل في ذلك المشهد المعقد. فبدلاً من تدريب النموذج ببساطة على تعظيم درجة الإجابة "الأفضل"، وهو ما يؤدي غالباً إلى تفكير متكرر وضيق، استخدموا طريقة تسمى "الاستدلال الموزع" (amortized inference). يعامل هذا النهج المشكلة كبحث عن مجموعة متنوعة من المسارات الصحيحة بدلاً من مسار واحد مثالي. ولتحقيق ذلك، استخدموا تقنية تُعرف باسم "شبكة التدفق التوليدية" (generative flow network)، والتي تعمل كمرشد يتعلم أخذ عينات من كامل نطاق الحلول الممكنة، مما يضمن استكشاف النموذج لسلاسل استدلال مختلفة وصحيحة بدلاً من الانهيار في نمط واحد مكرر.

وقد أثبت الفريق ذلك من خلال ضبط النماذج اللغوية الكبيرة لأداء مهام تتطلب استدلالاً متعدد الخطوات، مثل الحسابات الرياضية أو تصنيف ما إذا كان تقييم فيلم يعبر عن رأي أو حقيقة. في إحدى التجارب، طلبوا من النموذج ملء جملة المنتصف المفقودة في قصة قصيرة، مع إعطائه البداية والنهاية. كانت الطرق القياسية تنتج غالباً جملًا صحيحة لغوياً ولكنها لا تتناسب مع التدفق السردي. ومع ذلك، نجحت الطريقة الجديدة في توليد جمل منتصف تربط البداية والنهاية بشكل متماسك، مما أظهر قدرة أكبر بكثير على فهم السياق الكامل. وفي اختبار آخر يتضمن مسائل رياضية بسيطة، تم تزويد النموذج بأداة حاسبة وطُلب منه تقسيم العملية الحسابية إلى خطوات. وبينما تسببت طرق التدريب الأخرى في جعل النموذج يكرر الأرقام أو يفشل في استخدام الأداة بشكل صحيح، علمت الطريقة الجديدة النموذج التخطيط لخطواته بعناقة، مما أدى إلى تحسن كبير في الدقة، خاصة في المسائل التي لم يسبق له رؤيتها.

وتشير النتائج إلى أن هذه الطريقة فعالة بشكل خاص عندما تكون البيانات شحيحة. ففي اختبار باستخدام عشرة أمثلة فقط من تقييمات الأفلام للتعلم منها، حققت الطريقة الجديدة دقة أعلى بكert بشكل ملحوظ من تقنيات التدريب القياسية، واستمرت في التفوق عليها حتى مع وجود خمسين مثالاً. ووجد الباحثون أنه من خلال تشجيع النموذج على أخذ عينات من مجموعة متنوعة واسعة من مسارات الاستدلال ثم دمج استنتاجاتها، أصبح النظام أكثر قوة وموثوقية. وهذا تمييز حاسم لأنه يعني أن النموذج لا يحفظ مجرد طريقة واحدة لحل المشكلة، بل يتعلم الهيكل الأساسي لكيفية التفكير فيها. وتشير الدراسة إلى أنه من خلال تحويل الهدف من إيجاد الإجابة الأكثر احتمالاً واحدة إلى استكشاف التنوع الكامل للإجابات الصحيحة، يمكننا جعل هذه الأدوات القوية أكثر مرونة وملاءمة لمهام الاستدلال المعقدة.

كما يسلط العمل الضوء على قصور في كيفية تدريب النماذج الحالية غالباً. فعندما يتم دفع النماذج لتعظيم المكافأة، فإنها تميل إلى إيجال طرق مختصرة، مثل تكرار نفس العبارة أو تجاهل المنطق الفعلي للمشكلة، وذلك فقط للحصول على درجة عالية. وقد أظهر الباحثون أن طريقتهم تتجنب هذا الفخ من خلال مطابقة التوزيع الكامل للحلول الممكنة، مما يضمن عدم انهيار النموذج في نمط تفكير واحد معيب. يسمح هذا النهج للنموذج بالتعميم بشكل أفضل في المواقف الجديدة، مثل حل المسائل الحسابية بأعداد أكثر مما تدرب عليه، حيث فشلت الطرق الأخرى. وتقدم هذه النتائج مساراً واعداً لجعل الذكاء الاصطناዊ أكثر قدرة على الاستدلال الحقيقي، والانتقال من مجرد مطابقة الأنماط إلى فهم أكثر دقة لكيفية بناء الحجج وحل المشكلات خطوة بخطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →