← أحدث الأبحاث
💬 NLP

Analyzing LLM Instruction Optimization for Tabular Fact Verification

تقدم هذه الورقة أول تقييم منهجي لتحسين التعليمات القائم على DSPy للتحقق من الحقائق الجدولية، مما يثبت أن أدوات التحسين مثل MiPROv2 وSIMBA تعزز بشكل كبير أداء استراتيجيات التلقين المختلفة (بما في ذلك CoT وReAct) عبر مختلف أحجام النماذج، مع تميز SIMBA بتحسين الاستدلال العددي وكفاءة استخدام الأدوات.

المؤلفون الأصليون: Xiaotang Du, Giwon Hong, Wai-Chung Kwan, Rohit Saxena, Ivan Titov, Pasquale Minervini, Emily Allaway

نُشر 2026-02-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xiaotang Du, Giwon Hong, Wai-Chung Kwan, Rohit Saxena, Ivan Titov, Pasquale Minervini, Emily Allaway

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً ذكياً جداً، ولكنه درامي أحياناً (نموذج لغوي كبير أو LLM). هدفك هو جعل هذا المساعد يتحقق مما إذا كانت عبارة ما صحيحة أم خاطئة من خلال النظر في جدول بيانات (جدول بيانات).

المشكلة هي أن حتى المساعدين الأذكياء قد يصابون بالارتباك. فقد يبالغون في التفكير في سؤال بسيط، أو يختلقون حقائق، أو يواجهون صعوبة في الرياضيات.

هذه الورقة البحثية تشبه دليل تدريب (Manual) لهذا المساعد. لقد تساءل الباحثون: "كيف نكتب أفضل تعليمات ممكنة (Prompts) لمساعدة المساعد على إنجاز المهمة بشكل صحيح، دون الحاجة إلى إعادة تدريب المساعد بالكامل من الصرة؟"

إليك تفصيل لنتائجهم باستخدام بعض التشبيهات اليومية:

1. الطرق الأربع لطرح السؤال

اختبر الباحثون أربعة "أساليب" مختلفة لطلب العمل من المساعد:

  • التنبؤ المباشر (Direct Prediction): "فقط انظر إلى الجدول وأخبرني بنعم أو لا". (مثل طلب تخمين سريع من صديق).
  • سلسلة الأفكار (Chain-of-Thought - CoT): "انظر إلى الجدول، واكتب خطوات تفكيرك خطوة بخوة، ثم أخبرني بالإجابة". (مثل طلب من طالب أن يوضح خطوات حله في اختبار رياضيات).
  • ريأكت (ReAct - مستخدم الأدوات): "انظر إلى الجدول. إذا احتجت للقيام بعمليات حسابية أو العثور على رقم محدد، استخدم آلة حاسبة (أداة SQL). ثم أخبرني بالإجابة". (مثل محقق يستخدم عدسة مكبرة وقاعدة بيانات).
  • كودأكت (CodeAct - المبرمج): "لا تكتفِ بالحديث عن الأمر؛ بل اكتب برنامج كمبيوتر (كود Python) لتحليل الجدول وإعطائي الإجابة". (مثل توظيف مبرمج لكتابة نص برمجي لحل المشكلة).

2. المدربون الثلاثة (المحسنات - Optimizers)

لم يكتفِ الباحثون بالتخمين لأفضل التعليمات؛ بل استخدموا ثلاثة "مدربين ذكاء اصطناعي" (يُطلق عليهم محسنات) لإعادة كتابة التعليمات تلقائياً لجعلها أفضل.

  • COPRO: هو مدرب التجربة والخطأ. يجرب نسخاً مختلفة من التعليمات، ويرى أيها يعمل بشكل أفضل، ويحتفظ بالفائزين.
  • MiPROv2: هو مدرب المنهج الدراسي. ينظر إلى بيانات التدريب، وينشئ بضعة أمثلة للإجابات الجيدة، ثم يصيغ تعليمات تعلم النموذج كيفية التعامل مع تلك الأمثلة.
  • SIMBA: هو المدرب المتأمل ذاتياً. ينظر إلى الأماكن التي أخطأ فيها النموذج، ويسأل النموذج "لماذا فشلت هنا؟"، ثم يكتب قاعدة جديدة لمنع هذا الخطأ المحدد في المرة القادمة.

3. الاكتشافات الكبرى

🏆 استراتيجية "وضح عملك" هي الفائزة (غالباً)

بالنسبة للمساعدين الأصغر حجماً والأسرع، كانت طريقة سلسلة الأفكار (CoT) هي الفائزة.

  • التشبيه: الأمر يشبه إعطاء مسألة رياضية لطالب. إذا قلت له فقط "أعطني الإجابة"، فقد يخمن. أما إذا قلت له "اكتب خطواتك أولاً"، فمن المرجح ألا يرتكب خطأً حسابياً سخيفاً.
  • النتيجة: كان المدرب MiPROv2 هو الأفضل في تعليم النموذج كيفية "توضيح عمله"، مما أدى إلى تحسينات ثابتة.

🛠️ مستخدم الأدوات يحتاج إلى خريطة جيدة

بالنسبة لعميل ReAct (الذي يستخدم الأدوات/الآلات الحاسبة)، كانت النتائج مختلطة.

  • المشكلة: بدون تعليمات جيدة، كان العميل يستخدم الأداة بكثرة مفرطة. كان يحاول استخدام الآلة الحاسبة لسؤال بسيط مثل "هل 5 أكبر من 3؟" وهو أمر بطيء ومعرض للأخطاء.
  • الحل: كان مدرب SIMBA هو البطل هنا. فقد علّم العميل أن يكون "كسولاً" (بطريقة جيدة!). تعلم أن يقول: "انتظر، يمكنني رؤية الإجابة هنا في الجدول مباشرة؛ لست بحاجة لاستدعاء الآلة الحاسبة".
  • النتيجة: قلل SIMBA من استدعاء الأدوات غير الضرورية وجعل العميل أكثر دقة، خاصة عند استخدام نماذج أكبر وأذكى.

🤖 العقول الأكبر تحتاج إلى تعليمات أفضل

وجد الباحثون أن النماذج الأكبر (مثل GPT-4o أو نماذج Qwen الضخمة) استفادت من هذه التعليمات المحسنة أكثر من النماذج الأصغر.

  • التشبيه: النموذج الصغير يشبه طفلاً ذكياً يحتاج إلى تعليمات بسيطة ومباشرة. أما النموذج العملاق فهو يشبه بروفيسوراً عبقرياً؛ إذا أعطيته تعليمات غامضة، فقد يبالغ في تحليلها. ولكن إذا أعطيته تعليمات دقيقة وخبيرة (تم تحسينها بواسطة SIMBA أو MiPROv2)، فيمكنه حل مشكلات كانت مستحيلة سابقاً.

4. ماذا تغير في التعليمات؟

عندما نظر الباحثون في التعليمات "المحسنة"، وجدوا أن المدربين كانوا يضيفون قواعد محددة جداً تشبه قواعد البشر:

  • للرياضيات: "مهلاً، إذا كانت العبارة تقول 'أ أكبر من ب'، تحقق فعلياً من الأرقام. لا تخمن فقط".
  • للترتيب: "إذا كانت العبارة تقول 'أولاً، ثانياً، ثالثاً'، فتأكد من أن الجدول يسردها بهذا الترتيب بالفعل".
  • للأدوات: "إذا كانت الإجابة واضحة، فلا تضيع الوقت في استدعاء أداة SQL. فقط اقرأ الجدول".

الخلاصة

تثبت هذه الورقة أن طريقة طرحك للسؤال تهم بقدر أهمية ذكاء النموذج نفسه.

لا تحتاج دائماً إلى كمبيوتر ضخم وفائق التكلفة للتحقق من الحقائق في جدول. أحياناً، تحتاج فقط إلى مدرب أفضل (محسن) لتعليم نموذج قياسي كيف يفكر بوضوح، وكيف يتحقق من حساباته، ومتى لا يستخدم أداة ما.

  • النماذج الصغيرة؟ التزم باستراتيجية "وضح عملك" (CoT) مع مدرب جيد.
  • النماذج الكبيرة؟ يمكنها استخدام الأدوات (ReAct)، ولكن فقط إذا علمها المدرب أن تكون فعالة وألا تعقد الأمور.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →