← أحدث الأبحاث
🤖 machine learning

Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference

تقدم هذه الورقة Conformal Cascade، وهو إطار عمل استدلالي متعدد المستويات للنماذج اللغوية الكبيرة (LLM) غير معتمد على التوزيع وغير معتمد على التدريب، يستخدم أحجام مجموعات التنبؤ المطابق كقاعدة تأجيل لتوفير ضمانات دقة رسمية مع تحسين كفاءة التكلفة بشكل صارم مقارنة بالنماذج المرجعية القائمة على الاستدلال عبر اختبارات معيارية متنوعة.

المؤلفون الأصليون: Yifan Dou, Shikan Fang, Shibo Li

نُشر 2026-07-29
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yifan Dou, Shikan Fang, Shibo Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مكتبة ضخمة حيث يتعين عليك الإجابة على ملايين الأسئلة كل يوم. لديك متدرب صغير فائق السرعة يمكنه القراءة بسرعة ولكنه يرتبك أحياناً، وبروفيسور عبقري بطيء يعرف كل شيء ولكنه يستغرق ساعات للإجابة. إذا سألت البروفيسور عن كل سؤال بمفرده، ستفلس المكتبة من حيث الوقت والمال. وإذا اعتمدت فقط على المتدرب، فستحصل على الكثير من الإجابات الخاطئة. الحل الذكي هو ترك المتدرب يحاول أولاً، واستدعاء البروفيسور فقط إذا كان المتدرب غير متأكد حقاً. هذا هو عالم "سلاسل النماذج اللغوية الكبيرة" (LLM cascades)، وهي استراتيجية تستخدمها شركات الذكاء الاصطوي الكبرى لتوفير المال مع الحفاظ على دقة الإجابات.

لكن هنا يكمن الجزء الصعب: كيف تعرف متى يكون المتدرب "غير متأكد"؟ عادةً ما يعطي المتدرب درجة ثقة، مثل قوله: "أنا متأكد بنسبة 80% أن هذه هي الإجابة". المشكلة هي أن نماذج الذكاء الاصطناعي سيئة جداً في تقدير مدى ثقتها بنفسها؛ فغالباً ما تبدو واثقة جداً حتى عندما تكون مخطئة تماماً. وهذا يجعل من المستحيل وضع قاعدة مثالية لمتى يجب استدعاء البروفيسور. إذا وضعت القاعدة صارمة للغاية، فستضيع المال باستدعاء البروفيسور للأسئلة السهلة. وإذا جعلتها فضفاضة للغاية، فستحصل على إجابات خاطئة. لقد حاول العلماء إصلاح "مشكلة الثقة" هذه لسنوات، لأنه بدون طريقة موثوقة لتحديد متى يتم التصعيد، تصبح أنظمة توفير التكاليز هذه مجرد مقامرة.

تقدم هذه الورقة البحثية طريقة جديدة وآمنة رياضياً لإدارة هذه المكتبة، تسمى "الشلال المتوافق" (Conformal Cascade). بدلاً من سؤال المتدرب: "ما مدى تأكدك؟"، يسأل النظام: "كم عدد الإجابات المحتملة التي تفكر فيها؟". تعمل هذه الطريقة مثل مرشح سحري. لكل سؤال، يقوم المتدرب بإنشاء قائمة بالإجابات المحتملة. إذا قالت الرياضيات إن القائمة تتقلص لتصبح إجابة واحدة فقط، فإن النظام يثق في المتدرب ويتوقف عند هذا الحد. أما إذا ظلت القائمة تحتوي على خيارين أو أكثر، فإن النظام يدرك أن الأمر ينطوي على مخاطرة عالية ويستدعي البروفيسور فوراً.

اختبر المؤلفون هذه الفكرة على 18 نوعاً مختلفاً من الأسئلة، تتراوح بين العلوم والطب والمعلومات العامة، باستخدام أربع عائلات مختلفة من نماذج الذكاء الاصطناعي. ووجدوا أن طريقة "عدّ الإجابات" هذه أفضل بكثير من طريقة "تخمين الثقة" القديمة. وفي مهام الاستنتاج الصعبة حيث يعاني الذكاء الاصطناعي عادةً، نجح النظام الجديد في الإجابة على عدد أكبر بكثير من الأسئلة بشكل صحيح. وفي الأسئلة السهلة، سمح للمتدرب الرخيص بالتعامل مع كل شيء تقريباً بشكل صحيح، مما وفر قدراً هائلاً من المال.

الجزء الأكثر إثارة هو أن هذا ليس مجرد تخمين محظوظ؛ فالرياضيات تثبت نجاحه. لقد أظهر المؤلفون أنه إذا قلت للنظام: "أريد أن أكون مخطئاً بنسبة لا تزيد عن 5% من الوقت"، فإن النظام يضمن بقاءه ضمن هذا الحد، بغض النظر عن نوع الأسئلة التي تطرحها. إنه يشبه امتلاك شبكة أمان مضمونة رياضياً لالتقاطك إذا سقطت. وبينما يعمل الإصدار الحالي بشكل أفضل مع أسئلة الاختيار من متعدد (حيث تكون الإجابات مدرجة بالفعل)، يقترح الباحثون أنه مع بعض الخطوات الإضافية، يمكن لهذا أن يعمل في النهاية مع المحادثات المفتوحة أيضاً. في الوقت الحالي، يوفر هذا الطريقة لاستخدام الذكاء الاصطناعي بشكل أرخص وأكثر موثوقية، محولاً المقامرة الخطيرة إلى أداة موثوقة ومناسبة للميزانية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →