← أحدث الأبحاث
💻 computer science

Dynamic Mixed-Precision Routing for Efficient Multi-step LLM Interaction

تقترح هذه الورقة البحثية "التوجيه الديناميكي متعدد الدقة" (DMR)، وهو إطار عمل يختار بشكل تكيفي بين النماذج اللغوية الكبيرة ذات الدقة العالية والمنخفضة عند كل خطوة قرار باستخدام مسار تدريب ثنائي المراحل لتحقيق التوازن الأمثل بين الدقة والتكلفة في المهام متعددة الخطوات طويلة المدى.

المؤلفون الأصليون: Yuanzhe Li, Jianing Deng, Jingtong Hu, Tianlong Chen, Song Wang, Huanrui Yang

نُشر 2026-05-15
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuanzhe Li, Jianing Deng, Jingtong Hu, Tianlong Chen, Song Wang, Huanrui Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعيين فريق من المحققين لحل لغز معقد ومتعدد الخطوات (مثل البحث عن قطعة محددة في متجر ضخم عبر الإنترنت أو التنقل داخل منزل افتراضي).

في عالم الذكاء الاصطناعي، هؤلاء "المحققون" هم النماذج اللغوية الكبيرة (LLMs). وللحصول على أفضل النتائج، عادة ما تستعين بالمحقق السينيور (كبير المحققين) الأكثر تكلفةً وتدريباً (نموذج عالي الدقة - High-Precision Model). إنه عبقري لكنه بطيء ويكلف ثروة لتشغيله. بدلاً من ذلك، يمكنك تعيين فريق من المحققين المبتدئين (الجنود) السريعين والرخيصين (نماذج منخفضة الدقة/مكممة - Low-Precision/Quantized Models). إنهم سريعون ورخيصون، لكنهم قد يرتكبون أخطاءً سخيفة أو يفوتون أدلة حاسمة.

المشكلة هي أن المهام الطويلة والمعقدة تتطلب خطوات عديدة. إذا استعنت بالمحقق السينيور الغالي لكل خطوة، فستكون التكلفة باهظة جداً. وإذا استعنت بالمحققين المبتدئين الرخيصين لكل خطوة، فقد يفشلون في حل القضية لأنهم قد يرتبكون عند الأجزاء الصعبة.

تقدم هذه الورقة حلاً ذكياً يسمى التوجيه الديناميكي متعدد الدقة (DMR). فكر في الأمر كأنه موزع فائق الذكاء يدير عملية توظيف المحققين.

كيف يعمل الموزع

بدلاً من تعيين نوع واحد فقط من المحققين للمهمة بأكملها، يقوم "الموزع" بمراقبة التحقيق الذي يتكشف في الوقت الفعلي ويتخذ قراراً في جزء من الثانية عند كل خطوة:

  1. الخطوات السهلة: عندما تكون المهمة مباشرة (مثل "انظر إلى الباب" أو "ابحث عن قميص أحمر")، يرسل الموزع العمل إلى المحققين المبتدئين الرخيصين والسريعين. إنهم يتعاملون مع الأمر بسرعة ودقة كافية.
  2. الخطوات الحرجة: عندما تصطدم المهمة بـ "فخ" أو لغز معقد (مثل "اكتشف أي مفتاح يفتح الصندوق المغلق" أو "تفاوض على السعر النهائي")، يقوم الموزع فوراً بالتحول إلى المحقق السينيور المكلف لضمان إنجاز المهمة بشكل صحيح.

الهدف هو استخدام المحقق الغالي فقط عند الضرورة القصوى، مما يوفر المال والوقت مع ضمان حل اللغز بنجاح.

كيف يتعلم الموزع

تصف الورقة عملية تدريب من خطوتين لتعليم هذا الموزع كيفية رصد "الخطوات الحرجة":

  • الخطوة 1: مرحلة "المراقبة الظلية" (تباعد KL):
    تخيل أن الموزع يشاهد المحقق السينيور والمحقق المبتدئ يعملان على نفس القضية جنباً إلى جنب. في معظم الأوقات، يتفقان على ما يجب فعله. لكن أحياناً، يرتبك المحقق المبتدئ ويقترح خطوة خاطئة. يتعلم الموزع التعرف على هذه اللحظات المحددة التي يختلف فيها المحققان. إنه يتعلم: "آه، كلما بدأ المحقق المبتدئ في التذبذب، عليّ استدعاء المحقق السينيور".

  • الخطوة 2: مرحلة "التدريب العملي" (التعلم المعزز):
    بمجرد أن يعرف الموزع الأساسيات، يبدأ في القيام بجولات تدريبية فعلية. يجرب استراتيجيات مختلفة: "ماذا لو استدعيت المحقق السينيور هنا؟ ماذا لو انتظرت؟" يحصل على درجة بناءً على أمرين: هل حللنا القضية؟ و كم استهلكنا من الوقت/المال؟ ومع مرور الوقت، يتعلم التوازن المثالي لحل أكبر عدد من القضايا بأقل تكلفة.

النتائج

اختبر الباحثون هذا النظام في سيناريوهين من الواقع:

  1. WebShop: وكيل يحاول شراء قطعة معينة عبر الإنترنت من خلال البحث والنقر.
  2. ALFWorld: وكيل يحاول ترتيب غرفة افتراضية عن طريق التقاط الأشياء ووضعها.

كانت النتائج واضحة:

  • نهج "الرخص الدائم": سريع، لكنه غالباً ما يفشل في إتمام المهمة لأن المحققين المبتدئين يعلقون في الخطوات الصعبة.
  • نهج "الغلاء الدائم": ناجح جداً، ولكنه بطيء ومكلف للغاية.
  • نهج "الموزع" (DMR): حقق معدلات نجاح مطابقة تقريباً للمحقق السينيور الغالي، لكنه فعل ذلك بشكل أسرع وأرخص بك كثيراً. في كثير من الحالات، كان جيداً جداً مثل المحقق السينيور، لكنه استخدم المحققين المبتدين الرخصين للقيام بحوالي 60-80% من العمل.

الخلاصة

تظهر هذه الورقة أنك لست مضطراً للاختيار بين "الغالي والذكي" أو "الرخيص والغبي". فباستخدام موجه ذكي ينتقل ديناميكياً بين الاثنين بناءً على صعوبة الخطوة الحالية، يمكنك الحصول على أفضل ما في العالمين: معدلات نجاح عالية مع تكاليف أقل بكثير. الأمر يشبه امتلاك فريق يتولى فيه الموظفون المبتدئون الأعمال الروتينية، بينما لا يتدخل الخبير إلا عندما يصبح الموقف معقداً حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →