← أحدث الأبحاث
🤖 machine learning

Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner

تقدم هذه الورقة Vintix II، وهو امتداد قابل للتوسع لنموذج المحول المسبق التدريب على اتخاذ القرار (DPT) يستخدم مطابقة التدفق (Flow Matching) لتدريب وكيل عام عبر مئات المهام المتنوعة، محققاً تعميماً فائقاً على المهام غير المرئية ومتفوقاً على تقنيات تقطير الخوارزميات السابقة في التوسع في كل من الاستدلال عبر الإنترنت والاستدلال دون اتصال.

المؤلفون الأصليون: Andrei Polubarov, Lyubaykin Nikita, Alexander Derevyagin, Artyom Grishin, Igor Saprygin, Aleksandr Serkov, Mark Averchenko, Daniil Tikhonov, Maksim Zhdanov, Alexander Nikulin, Ilya Zisman, Albina Klep
نُشر 2026-04-08
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Andrei Polubarov, Lyubaykin Nikita, Alexander Derevyagin, Artyom Grishin, Igor Saprygin, Aleksandr Serkov, Mark Averchenko, Daniil Tikhonov, Maksim Zhdanov, Alexander Nikulin, Ilya Zisman, Albina Klepach, Alexey Zemtsov, Vladislav Kurenkov

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيف يفعل كل شيء: المشي، الطبخ، قيادة السيارة، وإصلاح أنبوب مسرب.

في الأيام الخوالي للذكاء الاصطناعي، كان عليك استئجار "معلم" مختلف لكل وظيفة. كنت تدرب روبوتاً واحداً على المشي، ثم تمسح ذاكرته لتدرب روبوتاً جديداً تماماً على القيادة. هذا الأمر بطيء ومكلف، والروبوت ينسى كيف يمشي بمجرد أن يبدأ في تعلم القيادة.

Vintix II هو نوع جديد من وكلاء الذاء الاصطناعي الذي يغير قواعد اللعبة. فبدلاً من تعلم شيء واحد في كل مرة، هو يتعلم "كيف يتعلم" من مكتبة ضخمة من التجارب، بحيث يمكنه التقاط مهمة جديدة فوراً بمجرد النظر إلى بضعة أمثلة.

إليك التبسيط السهل لكيفية عمله، باستخدام بعض التشبيهات من حياتنا اليومية:

1. المشكلة: الروبوت "فاقد الذاكرة"

معظم الروبوتات اليوم تشبه الطلاب الذين يحفظون كتاباً مدرسياً واحداً عن ظهر قلب. إذا سألتهم سؤالاً من كتاب آخر، سيضيعون. إنهم يحتاجون إلى إعادة تدريب من الصفر لكل بيئة جديدة.

2. الحل: "المتدرب المثالي"

فكر في Vintix II كمتدرب مثالي قرأ الملايين من الكتيبات المختلفة (من وصفات الطبخ إلى أدلة إصلاح السيارات).

  • الخدعة السحرية: عندما تضع هذا المتدرب في مطبخ جديد، لا تحتاج إلى إعادة تدريبه. يكفي فقط أن تريه بضعة أمثلة حول كيفية رغبتك في خفق البيض (وهذا ما يسمى "التعلم في السياق").
  • النتيجة: يفهم المتدرب النمط فوراً ويبدأ في الطبخ بشكل مثالي، حتى لو لم يرَ هذا المطبخ المحدد من قبل.

3. السر الخفي: "مطابقة التدفق" (خلاط العصير)

يقدم البحث تقنية تقنية جديدة تسمى "مطابقة التدفق" (Flow Matching). إليك التشبيه:

  • الطريقة القديمة (رؤوس غاوس): تخيل أنك تحاول وصف شكل معقد، مثل السحابة، برسم دائرة بسيطة. قد يكون ذلك جيداً لكرة، لكنه سيء جداً لسحابة. هذا ما كانت تفعله نماذج الذكاء الاصطناعي القديمة؛ حيث كانت تحاول تخمين الأفعال باستخدام تخمينات دائرية بسيطة.
  • طريقة Vintix II (مطابقة التدفق): تخيل أن لديك خلاط عصير. تبدأ بماء سادة (ضوضاء عشوائية) ثم تضيف المكونات ببطء (تفاصيل المهمة المحددة) أثناء الخلط. الماء "يتدفق" ويتحول بسلاسة إلى العصير المثالي (الفعل المثالي).
  • لماذا يهم هذا: الحياة الواقعية فوضوية. أحياناً تحتاج للقيادة بسرعة، وأحياناً ببطء. أحياناً تحتاج للإمساك بكوب بلطف، وأحياناً بقوة. هذا "الخلاط" يسمح للذكاء الاصطناعي بالتعامل مع هذه المواقف الفوضوية والمتعددة الأوجه بشكل أفضل بكثير من طرق "رسم الدوائر" القديمة.

4. بيانات التدريب: "المكتبة العالمية"

لجعل هذا المتدرب ذكياً جداً، لم يكتفِ الباحثون بإعطائه كتاباً واحداً. بل بنوا مكتبة ضخمة تحتوي على أكثر من 700 مليون تجربة مختلفة.

  • تتضمن تجارب روبوتات تمشي، وأذرع تلتقط الأشياء، وسيارات تقود، وحتى أنظمة تتحكم في التدفئة والتبريد في المباني.
  • من خلال التدريب على كل هذه الأشياء المختلفة في وقت واحد، تعلم الذكاء الاصطناعي "القواعد العالمية" للحركة واتخاذ القرار. لقد تعلم أن "تجنب الجدار" يتشابه سواء كنت ذراعاً روبوتية أو سيارة ذاتية القيادة.

5. النتائج: "صاحب المهارات المتعددة"

عندما اختبروا Vintix II على مهام لم يسبق له رؤيتها من قبل:

  • لم يتوقف عن العمل. بل نظر إلى بضعة أمثلة وفهم الأمر.
  • تفوق على الخبراء. في كثير من الحالات، بعد رؤية بضعة أمثلة فقط، كان أداؤه يضاهي (أو يتفوق على) الروبوتات المتخصصة التي تم تدريبها خصيصاً لتلك الوظيفة الواحدة.
  • يعمل في وضعين:
    • بدون اتصال (Offline): تعطيه "ورقة غش" من الأمثلة قبل أن يبدأ.
    • متصل (Online): يتعلم أثناء العمل، ويصحح أخطاءه في الوقت الفعلي، تماماً مثل الإنسان الذي يتعلم ركوب الدراجة عبر الترنح والتعديل.

الصورة الكبيرة

هذا البحث خطوة عملاقة نحو الذكاء الاصطناعي العام. بدلاً من بناء روبوت لكل وظيفة في العالم، نحن نبني "وكيلاً عالمياً" يمكنه الدخول إلى أي موقف، والنظر إلى ما يحدث، ومعرفة ما يجب فعله.

إنه الفرق بين توظيف متخصص لكل مشكلة، وبين توظيف شخص عبقري وقابل للتكيف يمكنه التعامل مع أي شيء تلقيه في طريقه. Vintix II هو ذلك الشخص القادر على حل المشكلات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →