← أحدث الأبحاث
💬 NLP

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

يُعد CopT إطار عمل استدلالي لا يتطلب تدريباً، حيث يعكس نموذج "سلسلة الأفكو" التقليدي عبر توليد إجابة مسودة أولاً، ثم توظيف أدوات تحقق تباينية في الفضاء المستمر لتفعيل التأمل الذاتي المعتمد على السياسة (on-policy reflection) ديناميكياً عند الضرورة فقط، مما يؤدي إلى تحسين الدقة بشكل كبير وتقليل تكاليف الرموز (tokens) عبر مهام استدلالية متنوعة.

المؤلفون الأصليون: Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

نُشر 2026-05-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق بارع تحاول حل لغز ما.

الطريقة القديمة (سلسلة الأفكار - Chain-of-Thought):
تقليدياً، عندما تحاول النماذج اللغوية الكبيرة (LLMs) حل مشكلة ما، فإنها تتصرف مثل محقق يصر على كتابة تقرير شرطة مكون من 10 صفحات قبل أن يُسمح له بقول من هو الجاني. إنهم يفكرون، ويفكرون، ويفكرون، ويكتبون كل خطوة، ثم يعطون الإجابة.

  • المشكلة: في بعض الأحيان، يكون المحقق قد عرف الإجابة بالفعل في الثانية الأولى. ولكن لأن القواعد تفرض "التفكير أولاً"، يستمرون في كتابة التقرير على أي حال. هذا يهدر الوقت (الرموز/Tokens) والطاقة، حتى لو كانت الإجابة بديهية. وهذا ما يسمى بـ "التفكير الاستعراضي" (performative reasoning) — أي التفكير لمجرد التفكير.

الطريقة الجديدة (CopT):
تقدم ورقة البحث CopT (التفكير التبايني أثناء التنفيذ - Contrastive On-Policy Thinking). وهي تقلب السيناريو؛ فبدلاً من التفكير قبل الإجابة، تعمل CopT مثل محقق يصرخ بـ إجابة مسودة فوراً.

  • الخطوة 1: فحص الحدس. يقول النموذج: "أعتقد أن الإجابة هي X".
  • الخطوة 2: المرآة السحرية. قبل قبول هذه الإجابة، تستخدم CopT "مرآة سحرية" خاصة (آلية تباينية) للتحقق مما إذا كانت الإجابة جديرة بالثقة.
    • تنظر إلى الإجابة من منظور قياسي (رموز منفصلة/discrete tokens).
    • تنظر إلى الإجابة من منظور "ضبابي وغير مؤكد" (تمثيلات مستمرة/continuous embeddings تحمل كل احتمالات الـ "ربما" التي فكر فيها النموذج).
    • إذا كان النموذج واثقاً، فإن المنظورين يتطابقان تماماً. أما إذا كان النموذج في حالة تخمين أو ارتباك، فإن المنظورين سيتصادمان.
  • الخطوة 3: القرار.
    • إذا قالت المرآة "يبدو جيداً": يقبل المحقق الإجابة فوراً. لا داعي لكتابة التقرير الطويل. النتيجة: توفير هائل في الوقت والمال.
    • إذا قالت المرآة "يبدو مهزوزاً": يقول المحقق: "حسناً، أحتاج للتفكير أكثر". ولكن الجزء الذكي هنا هو أنهم لا ينسون تخمينهم الأول فحسب؛ بل يستخدمون "مفتاح الرؤية". قد يخفون التخمين الأول المهزوز إذا كان يسبب لهم الارتباك، أو يبقونه مرئياً إذا كان بمثابة تلميح مفيد، بينما يقومون بالتفكير العميق لتصحيحه.

الاستعارة الجوهرية: "العدسة الضبابية" مقابل "العدسة الحادة"

لفهم "المرآة السحرية" (المتحقق التبايني)، تخيل النظر إلى لوحة فنية من خلال عدستين مختلفتين:

  1. العدسة الحادة (المدخل المنفصل/Discrete Input): ترى ضربات الفرشاة النهائية والواضحة التي قرر النموذج رسمها. هذه هي "إجابة المسودة".
  2. العدسة الضبابية (المدخل المستمر/Continuous Input): ترى كامل لوحة الألوان التي كان النموذج يفكر فيها قبل أن يختار الضربة النهائية. وهذا يشمل كل احتمالات الـ "ماذا لو" وعدم اليقين.

كيف تستخدم CopT هذا:
تسأل CopT: "هل تبدو العدسة الحادة مثل العدسة الضبابية؟"

  • نعم: كان النموذج متأكداً. الإجابة من المرجح أن تكون صحيحة. توقف عن التفكير، ووفر الرموز.
  • لا: العدسة الضبابية تظهر أن النموذج كان في الواقع مرتبكاً جداً أو كان يفكر في احتمالات عديدة مختلفة، رغم أنه اختار لوناً محدداً. الإجابة من المرجح أن تكون خاطئة. ابدأ التفكير (التفكير أثناء التنفيذ) لتصحيح ذلك.

لماذا يهم هذا (وفقاً لورقة البحث)

تدعي ورقة البحث أن هذه الطريقة تعد تغييراً جذرياً لأنها تمنع النموذج من "استعراض" التفكير غير الضروري.

  • السرعة والتكلفة: في المشكلات السهلة حيث يعرف النموذج الإجابة فوراً، تتخطى CopT عملية التفكير الطويلة تماماً. وتظهر الورقة أن هذا يقلل من "التكلفة" (عدد الكلمات/الرموز المولدة) بنسبة تقارب النصف في بعض الحالات.
  • تفكير أذكى: في المشكلات الصعبة حيث يكون التخمين الأول خاطئاً، لا تستسلم CopT فحسب. بل تستخدم "المرآة السحرية" لتدرك: "مهلاً، أنا مرتبك"، ومن ثم تشارك في تفكير عميق (أثناء التنفيذ) فقط عند الضرورة.
  • لا حاجة للتدريب: هذه ليست نموذجاً جديداً يحتاج لسنوات من التدريب. إنها طريقة جديدة لاستخدام النماذج الموجودة. الأمر يشبه إعطاء محقق ذكي قواعد جديدة ليتبعها، بدلاً من تعليمه لغة جديدة.

"مفتاح الرؤية" (The Visibility Switch)

عندما يدرك النموذج أنه بحاجة للتفكير أكثر، يجب عليه أن يقرر ما إذا كان سيستمر في النظر إلى تخمينه الأول (الذي قد يكون خاطئاً) أم لا.

  • إذا أصبح التفكير فوضوياً، يمكن لـ CopT إخفاء التخمين الأول حتى لا يرتبك النموذج بسبب خطئه.
  • إذا كان التخمين الأول يحتوي على تلميح جيد، فإن CopT تظهره للمساعدة في توجيه التصحيح.
    ويتم التحكم في ذلك من خلال فحص "مرآة سحرية" ثانية أثناء عملية التفكير.

الملخص

CopT هي طريقة أذكى لاستخدام استدلال الذكاء الاصطناعي. بدلاً من إجبار الذكاء الاصطناعي على التفكير لفترة طويلة قبل التحدث، تسمح له بالتحدث أولاً، ثم تتحقق مما إذا كان كلامه جديراً بالثقة باستخدام "كاشف عدم يقين" خاص، وتجبره فقط على التفكير بعمق إذا قال الكاشف: "مهلاً، هذا لا يبدو صحيحاً". هذا يجعل الذكاء الاصطناعي أسرع، وأرخص، وبنفس القدر من الذكاء (أو أكثر ذكاءً) في المشكلات الصعبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →