💬 NLP

OProver: A Unified Framework for Agentic Formal Theorem Proving

يُعد OProver إطار عمل موحداً لإثبات النظريات الصورية الوكيلية في لغة Lean 4، حيث يدمج المراجعة التكرارية للإثبات مع تغذية المترجم الراجعة والاسترجاع، محققاً أداءً هو الأفضل حالياً عبر عدة معايير من خلال مسار تدريب مبتكر يجمع بين التدريب المسبق المستمر، والضبط الدقيق الخاضع للإشراف على مسارات الإصلاح، والتعلم المعزز على الحالات الصعبة.

David Ma, Kaijing Ma, Shawn Guo, Yunfeng Shi, Enduo Zhao, Jiajun Shi, Zhaoxiang Zhang, Gavin Cheung, Jiaheng Liu, Zili W (…)2026-05-19
💻 computer science

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

تُعد DISA (الترسيخ عبر أخذ العينات بالأهمية المنفصلة) طريقة جديدة للتعلم المعزز غير المتصل القائمة على مطابقة التوزيع، حيث تقوم بحساب تقديرات دالة التجزئة مسبقاً وتجميدها عبر أخذ العينات بالأهمية للقضاء على أخطاء المعايرة، مما يمكن النماذج اللغوية الكبيرة من تعلم استراتيجيات حل متنوعة تتفوق على كل من النماذج المرجعية لتعظيم المكافأة ونهج مطابقة التوزيع المتصل عبر الإنترنت.

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xumin (…)2026-05-19
💬 NLP

Weak-to-Strong Elicitation via Mismatched Wrong Drafts

تُثبت هذه الورقة أن حقن مسودات غير صحيحة رياضياً من نموذج أصغر مُدرب على مجال محدد وغير متوافق مع المشكلة الحالية في سياق تدريب GRPO لنموذج متعلم أقوى، يتفوق بشكل كبير على الضبط الدقيق القياسي المعتمد على السياسة (on-policy fine-tuning) والمتغيرات الأخرى، محققاً نتيجة قياسية جديدة تبلغ 71.98% على MATH-500 لنموذج Mathstral-7B دون الحاجة إلى ضبط دقيق موجه (SFT)، أو نماذج مكافأة، أو بيانات مُخلّقة.

Wei Deng2026-05-19
💬 NLP

Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

تقدم هذه الورقة نموذج المكافأة الهجينة الدورية (HRC) وتحسين التفضيل باللعب الذاتي الديناميكي (DSPPO) لتفكيك التفضيلات البشرية صراحةً إلى مكونات متعدية ودورية متعامدة، مما يتغلب على القيود النظرية للطرق الحالية ويحقق أداء محاذاة فائق عبر معايير متعددة.

Yucong Huang, Xiucheng Li, Kaiqi Zhao, Jing Li2026-05-19
💬 NLP

Taming "Zombie'' Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution

يقدم البحث AgentRevive، وهو إطار عمل يعتمد على حالة ماركوف (Markov state-aware) يعمل على تعزيز مرونة وكفاءة الأنظمة متعددة الوكلاء القائمة على النماذج اللغوية الكبيرة (LLM) من خلال الإدارة الديناميكية لحالات الوكلاء عبر انتقالات ناعمة وسياسات مدركة للمخاطر، مما يمنع الاستبعاد المبكر للوكلاء "الزومبي" الذين قد يكونون قابلين للاسترداد مع تحسين استهلاك الرموز (tokens).

Taolin Zhang, Pukun Zhao, Qizhou Chen, Jiuheng Wan, Chen Chen, Xiaofeng He, Chengyu Wang, Richang Hong2026-05-19
💬 NLP

AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering

تقدم الورقة البحثية AMATA، وهو إطار عمل تكيفي متعدد الوكلاء يعزز الاتساق الواقعي وقابلية التفسير في الإجابة على الأسئلة كثيفة المعرفة من خلال صياغة تعاون الوكلاء كمسألة محاذاة تفضيلات المسار مع تقنيات مبتكرة لتعلم التبعية داخل المسار وبين الوكلاء.

Taolin Zhang, Dongyang Li, Chen Chen, Qizhou Chen, Jiuheng Wan, Xiaofeng He, Chengyu Wang, Richang Hong2026-05-19
💬 NLP

Learning Transferable Topology Priors for Multi-Agent LLM Collaboration Across Domains

تقترح الورقة البحثية TopoPrior، وهو إطار عمل يتعلم أولويات طوبولوجية قابلة للنقل من رسوم بيانية للتعاون متعدد المجالات غير متصلة بالإنترنت لإنشاء هياكل تعاون أولية مشروطة بالاستعلام بكفاءة لأنظمة النماذج اللغوية الكبيرة متعددة الوكلاء، مما يقلل من عبء البحث عبر الإنترنت واستهلاك الرموز (tokens) مع تحسين أداء الاستدلال عبر مجالات متنوعة.

Taolin Zhang, Zijie Zhou, Jiuheng Wan, Tingyuan Hu, Chengyu Wang, Xiaofeng He, Richang Hong2026-05-19
💬 NLP

NewsLens: A Multi-Agent Framework for Adversarial News Bias Navigation

تقدم NewsLens إطار عمل تنافسي مكون من خمسة وكلاء يتجاوز مجرد التصنيف السياسي البسيط لتفكيك المقالات الإخبارية إلى خرائط تأطير قابلة للتفسير، مما يحدد بفعالية الحذف الأيديولوجي، والتلاعب البلاغي، والتحيزات الهيكلية عبر مختلف الأحداث الجيوسياسية باستخدام نماذج لغوية كبيرة مفتوحة الأوزان.

Joy Bose2026-05-19
💬 NLP

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

تقدم هذه الورقة إطار عمل QQJ، وهو إطار تقييم قابل للتوسع ومتوافق مع المعايير البشرية يسد الفجوة بين التقييم الآلي والحكم البشري من خلال ترسيخ مقيمي النماذج اللغوية الكبيرة في نماذج معايير متعددة الأبعاد ومصممة من قبل خبراء، مما يحقق اتساقاً وقدرة تفسيرية وتشخيصية فائقة للأنظمة التوليدية للذكاء الاصطنا-عي مقارنة بالمقاييس التقليدية والمقيمين من النماذج اللغوية الكبيرة غير المقيدة.

Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri2026-05-19
💬 NLP

MiniGPT: Rebuilding GPT from First Principles

تقدم هذه الورقة MiniGPT، وهو تنفيذ مدمج وموحد لنموذج PyTorch في دفتر ملاحظات واحد، يعيد بناء خط معالجة GPT التوليدي (autoregressive) الأساسي من المبادئ الأولى لاستعراض قدرات التدريب والتوليد لنماذج اللغة القائمة على مستوى الحرف (character-level) باستخدام مجموعة بيانات Tiny Shakespeare دون تقديم ابتكارات هيكلية جديدة.

Jibin Joseph2026-05-19