💬 NLP

RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning

تقترح الورقة البحثية إطار عمل RIDE، وهو إطار تنافسي يستفيد من نظرية الاستجابة للمفردة والتعلم التعزيزي لتوليد مسائل رياضية جيدة الصياغة ومتدرجة الصعوبة بشكل منهجي، مما يكشف بفعالية عن محدودية متانة النماذج اللغوية الكبيرة في التفكير الحقيقي من خلال انخفاض ملحوظ في الأداء.

Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan2026-02-03
💬 NLP

IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling

تقدم IterResearch نموذج بحث عميق تكراري يعتمد على توسيع نطاق التفاعل وإعادة بناء مساحة العمل المستوحاة من عمليات ماركوف لاتخاذ القرار (MDP)، مما يتغلب على قيود السياق التي تواجهها الوكلاء الحاليين لتحقيق مكاسب كبيرة في الأداء في المهام طويلة الأمد، سواء كنموذج مُدرب أو كاستراتيجية توجيه للأنظمة الرائدة.

Guoxin Chen, Zile Qiao, Xuanzhong Chen, Donglei Yu, Haotian Xu, Wayne Xin Zhao, Ruihua Song, Wenbiao Yin, Huifeng Yin, L (…)2026-02-03
💬 NLP

PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization

تقدم هذه الورقة إطار عمل PSM، وهو إطار تحسين للصندوق الأسود يستفيد من نموذج لغوي كبير كأداة للتحسين لإلحاق طبقات حماية خفيفة الوزن ومحافظة على المنفعة (SHIELDs) بطلبات النظام، مما يقلل بفعالية من قابليتها للاستغلال في هجمات الاستخراج العدائية دون الحاجة إلى الوصول إلى النموذج.

Huseein Jawad, Nicolas Brunel2026-02-03
💬 NLP

Latent Debate: A Surrogate Framework for Interpreting LLM Thinking

تقدم هذه الورقة البحثية "الجدال الكامن" (latent debate)، وهو إطار عمل مبتكر يفسر تنبؤات النماذج اللغوية الكبيرة من خلال تحليل الحجج الداخلية الضمنية ضمن عملية استدلال واحدة، مما يثبت فعاليته كبديل أمين لفهم استدلال النموذج وكشف الهلوسة من خلال أنماط جدال محددة.

Lihu Chen, Xiang Yin, Francesca Toni2026-02-03
💬 NLP

MixLM: High-Throughput and Effective LLM Ranking via Text-Embedding Mix-Interaction

يُعد MixLM إطار عمل جديد لترتيب النماذج اللغوية الكبيرة يعزز إنتاجية النظام بشكل كبير عبر استبدال المدخلات النصية الطويلة برموز تضمين مدمجة من خلال آلية تفاعل مختلطة، مما يتيح نشر حركة المرور الكاملة بكفاءة في تطبيقات البحث الواقعية مع الحفاظ على مستوى عالٍ من الصلة.

Guoyao Li, Ran He, Shusen Jing, Kayhan Behdin, Yubo Wang, Sundara Raman Ramachandran, Chanh Nguyen, Jian Sheng, Xiaojing (…)2026-02-03
💬 NLP

Diffusion Language Model Inference with Monte Carlo Tree Search

تقدم الورقة البحثية MEDAL، وهو إطار عمل للتوسع أثناء الاستدلال يدمج بحث شجرة مونت كارلو لتحسين مسار إزالة القناع في نماذج لغة الانتشار، محققاً تحسينات كبيرة في الأداء مقارنة بالطرق الاستدلالية الحالية دون الحاجة إلى تدريب إضافي.

Zheng Huang, Kiran Ramnath, Yueyan Chen, Aosong Feng, Sangmin Woo, Balasubramaniam Srinivasan, Zhichao Xu, Kang Zhou, Sh (…)2026-02-03
💬 NLP

Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks

تقدم هذه الورقة تقييماً شاملاً لتخزين التلقين المؤقت (prompt caching) عبر ثلاثة من كبار مزودي النماذج اللغوية الكبيرة (LLM) للمهام الوكيلية طويلة الأمد، حيث تُظهر أن تقنيات التخزين الاستراتيجية — مثل استبعاد نتائج الأدوات الديناميكية وإدارة هيكل التلقين — يمكن أن تقلل تكاليف واجهة برمجة التطبيقات (API) بنسبة تتراوح بين 41 و80% وتحسن زمن الوصول لأول رمز (TTFT) بنسبة تتراوح بين 13 و31% مقارنة بالتخزين الساذج للسياق الكامل.

Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah2026-02-03
💬 NLP

MedTutor: A Retrieval-Augmented LLM System for Case-Based Medical Education

يُعد MedTutor نظاماً للتوليد المعزز بالاسترجاع يعمل على تعزيز تعليم الأطباء المقيمين من خلال التوليد التلقائي لمواد تعليمية وأسئلة قائمة على الأدلة من تقارير الحالات السريرية عبر مسار استرجاع هجين، مما يظهر قيمة تعليمية عالية في تقييمات الخبراء مع الكشف عن توافق متوسط بين التقييمات القائمة على النماذج اللغوية الكبيرة والتقييمات البشرية.

Dongsuk Jang, Ziyao Shangguan, Kyle Tegtmeyer, Anurag Gupta, Jan Czerminski, Sophie Chheang, Arman Cohan2026-02-03
💬 NLP

Identity, Cooperation and Framing Effects within Groups of Real and Simulated Humans

تُثبت هذه الورقة أن الربط العميق للنماذج اللغوية الكبيرة بهويات سردية غنية والتحقق من اتساقها يحسن بشكل كبير من محاكاة السلوك البشري في ألعاب المعضلات الاجتماعية، مما يتيح استكشاف العوامل السياقية الحرجة مثل الوقت، والتأطير، ومجموعات المشاركين التي غالبًا ما تعيق تكرار الدراسات البشرية.

Suhong Moon, Minwoo Kang, Joseph Suh, Mustafa Safdari, John Canny2026-02-03
💬 NLP

Zero-Shot Stance Detection in the Wild: Dynamic Target Generation and Multi-Target Adaptation

تقترح هذه الورقة مهمة جديدة للكشف عن الموقف من نوع "التعلم الصفري" تسمى DGTA، والتي تحدد أهدافاً ديناميكية متعددة ومواقفها دون معرفة مسبقة، مما يثبت أن النماذج اللغوية الكبيرة التي تم ضبطها بدقة، لا سيما من خلال استراتيجيات المرحلتين والاستراتيجية المتكاملة، تحقق أداءً فائقاً على مجموعة بيانات جديدة تم إنشاؤها من وسائل التواصل الاجتماعي الصينية.

Aohua Li, Yuanshuo Zhang, Ge Gao, Bo Chen, Xiaobing Zhao2026-02-03