← أحدث الأبحاث
🤖 AI

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

تقدم هذه الورقة البحثية "التفكير كفء الميزانية" (BET)، وهو إطار عمل ثنائي المراحل يعمل على تحسين حسابات وقت الاختبار لنماذج الاستدلال الكبيرة من خلال تعلم تخصيص الميزانيات ديناميكيًا بناءً على العوائد المتوقعة بدلاً من الصعوبة المتصورة، مما يحقق تقليلاً كبيراً في عدد الرموز (tokens) مع تحسين الأداء من خلال سلوكيات "الحل القصير"، و"الطي اللطيف"، و"نداء البطل" التكيفية.

المؤلفون الأصليون: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً عبقرياً ولكنه مفرط في الحماس، يحاول حل كومة هائلة من الألغاز من أجلك. هذا المساعد بارع في التفكير، لكن لديه عادة سيئة: فهو أحياناً يقضي ساعات في التحديق في لغز مستحيل الحل، وأحياناً أخرى يبالغ في تحليل لغز بسيط كان يمكن حله في دقيقة واحدة. هذا يهدر وقتك ومالك (في شكل قدرة حوسبة).

تقدم هذه الورقة البحثية طريقة تدريب جديدة تسمى BET (التفكير ذو الميزانية الفعالة) لتعليم هذا المساعد كيف يكون أذكى في تحديد مقدار "طاقة التفكير" التي ينفقها على كل لغز.

إليك كيف تعمل BET، باستخدام تشبيهات بسيطة:

المشكلة: "المفرط في التفكير" مقابل "المفرط في التبسيط"

حالياً، تتصرف نماذج الذكاء الاصطناعي الكبيرة كطالب لا يعرف متى يتوقف عن الدراسة.

  • اللغز السهل: إذا سألت "ما هو 2+2؟"، قد يكتب الطالب مقالاً من 10 صفحات ليثبت لماذا 2+2 تساوي 4، مما يهدر الوقت.
  • اللغز المستحيل: إذا طرحت سؤالاً صعباً للغاية بالنسبة للطالب حالياً (مثل مسألة رياضية معقدة لم يتعلمها بعد)، فقد يستمر في المحاولة لساعات دون جدوى، لمجرد أنه لا يعرف أنه لا يستطيع حلها.
  • اللغز الصعب ولكن القابل للحل: إذا كان اللغز صعباً ولكنه قابل للحل، يحتاج الطالب إلى الاستمرار في التفكير. لكن الطرق الحالية قد تقطع عليه الطريق مبكراً جداً، مما يجعله يستسلم أمام لغز كان بإمكانه حله.

الحل: القوى الثلاث الخارقة لـ BET

تعلم الورقة البحثية الذكاء الاصطناعي ثلاثة سلوكيات محددة، والتي يسميها المؤلفون "الحل السريع" (Short Solve)، و**"الانسحاب اللطيف" (Nice Fold)، و"نداء البطل" (Hero Call)**. فكر في هذه كاستراتيجيات في لعبة البوكر:

  1. الحل السريع (الربح السريع):

    • التشبيه: ترى يداً سهلة في البوكر. أنت تعلم أنك ستفوز، لذا لا تحتاج إلى المزايدة أو المبالغة في التحليل. أنت فقط تأخذ الرهانات وتمضي قدماً.
    • ما تفعله BET: إذا رأى الذكاء الاصطناعي سؤالاً سهلاً، فإنه يجيب بسرعة وإيجاز. يتوقف عن إضاعة الطاقة في أشياء يعرفها بالفعل.
  2. الانسحاب اللطيف (معرفة متى تتوقف):

    • التشبيه: أنت تلعب البوكر، وتدرك أن يدك سيئة للغاية وأن الاحتمالات ضدك. اللاعب الذكي "ينسحب" (يستسلم) فوراً ليوفر أمواله للأيدي الأفضل. هم لا يستمرون في رمي الأموال في لعبة خاسرة.
    • ما تفعله BET: إذا أدرك الذكاء الاصطناği أن السؤال صعب جداً على قدراته الذهنية الحالية، فإنه يقول: "لا أستطيع حل هذا"، ويتوقف فوراً. إنه لا يضيع الوقت في محاولة فرض إجابة على مشكلة لا يستطيع فك شفرتها. هذا يوفر كمية هائلة من قدرة الحوسبة.
  3. نداء البطل (المغامرة بكل شيء في اللحظة المناسبة):

    • التشبيه: لديك يد قوية، لكنها ليست واضحة تماماً بعد. أنت تعلم أنك بحاجة لاستثمار المزيد من المال للفوز بالجائزة الكبرى. تقوم بـ "نداء البطل" وتستمر في اللعب بعمق.
    • ما تفعله BET: إذا رأى الذكاء الاصطناعي سؤالاً صعباً يمكنه حله إذا فكر بعمق، فإنه يحافظ على طاقته ويستمر في المضي قدماً. إنه لا يقطع طريقه مبكراً جداً.

كيف علموا الذكاء الاصطناعي (التدريب ذو المرحلتين)

لم يكتفِ الباحثون بإخبار الذكاء الاصطناعي "كن فعالاً"، بل علموه في خطوتين:

  • المرحلة 1: خطة الدرس (البداية الباردة): عرضوا على الذكاء الاصطناعي أمثلة لكيفية التصرف. أظهروا له: "هذه مشكلة سهلة؛ إليك كيفية الإجابة عليها بسرعة". "هذه مشكلة مستحيلة؛ إليك كيف تقول 'أنا أستسلم'". "هذه مشكلة صعبة؛ إليك كيف تستمر في التفكير".
  • المرحلة 2: لعبة الممارسة (التعلم التعزيزي): تركوا الذكاء الاصطناعي يلعب اللعبة. في كل مرة يحاول فيها الذكاء الاصطناعي حل مشكلة، يتحقق النظام: "هل أضعت الوقت في مشكلة مستحيلة؟ هل استسلمت مبكراً في مشكلة صعبة؟". بناءً على النتائج، منحوا الذكاء الاصطناعي درجة (مكافأة). إذا وفر الذكاء الاصطناعي المال في المشكلات المستحيلة ولكنه حل المشكلات الصعبة أيضاً، فإنه يحصل على درجة عالية.

النتائج

عندما اختبروا هذه الطريقة الجديدة على سبعة اختبارات مختلفة في الرياضيات والمنطق:

  • وفرت حوالي 55% من وقت التفكير. استخدم الذكاء الاصطناعي تقريباً نصف قدرة الحوسبة التي كان يستخدمها سابقاً.
  • أصبحت أفضل في حل المشكلات. لأنها لم تكن تضيع الوقت في المهام المستحيلة أو تبالغ في التفكير في المسائل السهلة، فقد تمكنت في الواقع من حل المزيد من المشكلات الصعبة بشكل صحيح.
  • تعمل على أنواع جديدة من الألغاز. على الرغم من أنهم دربوه فقط على الرياضيات، إلا أنه طبق عادات "الإنفاق الذكي" هذه على أسئلة علمية وألغاز منطقية لم يرها من قبل.

الخلا الخلاصة

تعلم BET نماذج الذكاء الاصطناعي أن تكون مثل المستثمر الذكي. بدلاً من إنفاق المال (قدرة الحوسبة) بشكل عشوائي، فإنها تحسب "عائد الاستثمار" لكل سؤال.

  • إذا كان العائد منخفضاً (سؤال سهل)، أنفق القليل.
  • إذا كان العائد سالباً (سؤال مستحيل)، فلا تنفق أي شيء.
  • إذا كان العائد مرتفعاً (صعب ولكن قابل للحل)، استثمر بكثافة.

هذا يجعل الذكاء الاصطناعي أسرع، وأرخص في التشغيل، وأفضل بشكل مدهش في حل الأمور الصعبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →