Error-Driven Prompt Optimization for Arithmetic Reasoning
تقدم هذه الورقة إطار عمل لتحسين الأوامر القائم على الخطأ، والذي يعزز بشكل كبير قدرات الاستدلال الحسابي للنماذج اللغوية الصغيرة الملحقة محلياً، مما يمكنها من التفوق على النماذج الأكبر مثل GPT-3.5 Turbo في البيئات الصناعية المتوافقة مع معايير الخصوصية دون الحاجة إلى عملية ضبط دقيق مكلفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
الصورة الكبيرة: محاسب محلي مقابل عملاق السحابة
تخيل أن لديك محاسبًا محليًا ذكيًا جدًا، ولكنه ينسى بعض التفاصيل (نموذج لغوي صغير - SLM) يعمل في مكتبك الآمن. ولديك أيضًا مستشار فائق العبقرية (نموذج لغوي كبير مثل GPT-3.5) يعيش في مكتب سحابي ضخم.
المشكلة؟ شركتك تتعامل مع بيانات مالية حساسة. لا يمكنك إرسال هذه البيانات إلى المستشار السحابي بسبب قواعد الخصوصية. يجب أن تبقي كل شيء داخل مكتبك المحلي.
ومع ذلك، فإن محاسبك المحلي سيء جدًا في الرياضيات. إذا سألته: "ما هو التغير المئوي في الإيرادات؟"، فقد يخمن الرقم أو يخطئ في الوحدات (يقول "مليون" بدلًا من "نسبة مئوية"). إنه سريع وخاص، لكنه ليس دقيقًا بما يكفي للعمل الجاد.
تقدم هذه الورقة البحثية طريقة تدريب ذكية لتحويل ذلك المحاسب المحلي النساي إلى ساحر في الرياضيات، دون إرسال بياناتهم إلى السحابة أو دفع تكالٍ باهظة لإعادة التدريب.
الاستراتيجية: "اكتب كودًا، لا تخمن"
أدرك الباحثون أن طلب "التفكير" في الرياضيات من المحاسب كان هو المشكلة. بدلاً من ذلك، علموا المحاسب أن يتصرف مثل مبرمج.
- الطريقة القديمة: "إليك جدول من الأرقام. أخبرني بالإجابة". (المحاسب يخمن).
- الطريقة الجديدة: "إليك جدول. اكتب نصًا برمجيًا قصيرًا (كود Python) يقوم بالعمليات الحسابية نيابة عنك، ثم قم بتشغيله".
هذا يشبه إعطاء المحاسب آلة حاسبة بدلًا من مطالبته بإجراء قسمة مطولة في ذهنه. الكود البرمجي مثالي في الرياضيات؛ كل ما على المحاسب فعله هو كتابة التعليمات بشكل صحيح.
السر الخفي: التعلم من الأخطاء (حلقة "المدفوع بالأخطاء")
حتى مع وجود الآلة الحاسبة، ظل المحاسب يرتكب أخطاءً. أحيانًا كتبوا صيغة خاطئة، أو أخطأوا في "المقياس" (قالوا إن الإجابة بـ "الآلاف" بينما يجب أن تكون بـ "النسبة المئوية").
الابتكار الرئيسي في الورقة البحثية هو عملية "محقق الأخطاء" المنهجية:
- تشغيل الاختبار: يحاول المحاسب حل 497 سؤالًا ماليًا.
- رصد الأخطاء: يقوم النظام بفحص الأسئلة التي أخطأ فيها المحاسب.
- تجميع القرائن: بدلًا من النظر إلى كل خطأ بشكل فردي، يقوم النظام بتجميع الأخطاء المتشابهة معًا.
- تشبيه: تخيل معلمًا يصحح اختبارًا. بدلًا من قول "لقد أخطأت في السؤال 5"، يلاحظ قائلاً: "أوه، كل طالب أخطأ في السؤال 5 أخطأ أيضًا في السؤال 12 لأنهم جميعًا نسوا القسمة على 100".
- كتابة قاعدة: لكل مجموعة من الأخطاء، يكتب الباحثون قاعدة محددة لإصلاحها.
- مثال لقاعدة: "إذا كان السؤال يطلب 'التغير المئوي'، فيجب أن تكون الإجابة بـ 'النسبة المئوية'، وليس بـ 'الدولار'".
- المحاولة مرة أخرى: يضيفون هذه القاعدة إلى تعليمات المحاسب ويجرون الاختبار مرة أخرى.
- التكرار: يستمرون في العثور على أكبر مجموعة من الأخطاء المتبقية، وكتابة قاعدة جديدة، والاختبار حتى تتوقف الأخطاء عن التحسن.
النتائج: التغلب على "الرجل الكبير"
من خلال اتباع دورة "جد الخطأ، اكتب قاعدة، كرر" هذه، حقق الباحثون شيئًا مفاجئًا:
- نقطة البداية: بدأ المحاسب المحلي (Qwen3 4B) بدقة تبلغ حوالي 30% (أفضل قليًا من التخمين).
- التحسن: بعد إضافة ثلاث قواعد محددة فقط مشتقة من تحليل الأخطاء، قفزت الدقة إلى 70.8%.
- النصر: هذا المحاسب المحلي والخاص تفوق على المستشار السحابي العملاق (GPT-3.5 Turbo)، الذي سجل 66.2% فقط.
فخ "كثرة القواعد"
اكتشفت الورقة أيضًا حدًا مهمًا. تخيل أنك تعطي محاسبك كتاب قواعد.
- قواعد قليلة جدًا: سيرتكب أخطاءً بسيطة.
- العدد الصحيح من القواعد: سيكون مثاليًا.
- قواعد كثيرة جدًا: سيصاب المحاسب بالارتباك. سيصبح كتاب القواعد سميكًا ومعقدًا لدرجة أنهم يبدأون في تجاهل القواعد أو خلطها ببعضها البعض.
وجد الباحثون "عددًا أمثل" من القواعد. إضافة المزيد من القواعد بعد هذه النقطة أدى في الواقع إلى تدهور الأداء. الأمر يشبه محاولة حفظ دليل تعليمات مكون من 50 صفحة لمهمة بسيطة؛ ستشعر فقط بالارتباك.
ملخص الادعاءات
- الخصوصية أولاً: يمكنك بناء ذكاء اصطناعي عالي الدقة للبيانات الحساسة (المالية، الصحية) يبقى بالكامل داخل جهازك الخاص (On-premises).
- لا تدريب مكلف: لست بحاجة لإنفاق الملايين لإعادة تدريب النموذج. أنت فقط بحاجة لتحليل أخطائه وكتابة قواعد نصية بسيطة لإصلاحها.
- الصغير يمكن أن يهزم الكبير: النموذج الصغير والفعال، عندما يتم توجيهه بواسطة "القواعد المدفوعة بالأخطاء" الصحيحة، يمكنه القيام بعمل أفضل من نموذج ضخم ومكلف في الاستنتاج الحسابي.
- المنهجية: المفتاح هو توليد الكود (جعل الذكاء الاصطناعي يكتب كودًا للقيام بالرياضيات) مقترنًا بـ تحسين المطالبة التكراري (إصلاح أنواع أخطاء الذكاء الاصطناعي المحددة بشكل منهجي).
باختًا، تظهر الورقة البحثية أنك لست بحاجة إلى دماغ أكبر لحل المسائل الرياضية؛ بل تحتاج فقط إلى مجموعة أفضل من التعليمات التي تساعد الدماغ على تجنب نقاط ضعفه الخاصة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.