💬 NLP

FrugalRAG: Less is More in RL Finetuning for Multi-Hop Question Answering

يُعد FrugalRAG إطار عمل للضبط الدقيق يتكون من مرحلتين، حيث يستفيد من التعلم المعزز لتقليم خطوات الاسترجاع بشكل تكيفي بناءً على صعوبة السؤال، محققاً بذلك كفاءة ودقة في أعلى المستويات في مهام الإجابة على الأسئلة متعددة الخطوات مع استخدام عدد أقل بكثير من أمثلة التدريب وخفض التكاليف الحسابية.

Abhinav Java, Srivathsan Koundinyan, Nagarajan Natarajan, Amit Sharma2026-03-03
💬 NLP

Diversity-Enhanced Reasoning for Subjective Questions

تقدم هذه الورقة MultiRole-R1، وهو إطار تدريب معزز بالتنوع يستفيد من توليف المنظور غير الخاضع للإشراف وتنوع مستوى الرمز ضمن إعداد التعلم التعزيزي لتحسين أداء نماذج الاستدلال الكبيرة في المهام الذاتية بشكل كبير، مع تعزيز قدراتها في الاستدلال الموضوعي أيضًا.

Yumeng Wang, Zhiyuan Fan, Jiayu Liu, Jen-tse Huang, Yi R. Fung2026-03-03
💬 NLP

Rote Learning Considered Useful: Generalizing over Memorized Data in LLMs

تتحدى هذه الورقة البحثية المفهوم القائل بأن التعلم بالتكرر يعيق التعميم، وذلك من خلال إثبات قدرة النماذج اللغوية الكبيرة على إعادة تفسير وتعميم البيانات المحفوظة عديمة المعنى دلالياً بفعالية عند ضبطها بدقة باستخدام مجموعة صغيرة من المطالبات ذات المعنى.

Qinyuan Wu, Soumi Das, Mahsa Amani, Bishwamittra Ghosh, Mohammad Aflah Khan, Krishna P. Gummadi, Muhammad Bilal Zafar2026-03-03
💬 NLP

DeepSieve: Information Sieving via LLM-as-a-Knowledge-Router

تقدم هذه الورقة DeepSieve، وهو إطار عمل توليدي معزز بالاسترجاع ذو طبيعة وكيلية يعمل على تعزيز عمق الاستدلال ودقة الاسترجاع من خلال تفكيك الاستعلامات المعقدة إلى أسئلة فرعية وتوظيف نموذج لغوي كبير كـ "موجه معرفة" (LLM-as-a-knowledge-router) لغربلة وتوجيه المعلومات ديناميكيًا عبر عملية تقطير متعددة المراحل.

Minghao Guo, Qingcheng Zeng, Xujiang Zhao, Yanchi Liu, Wenchao Yu, Mengnan Du, Haifeng Chen, Wei Cheng2026-03-03
💬 NLP

Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models

تقدم هذه الورقة TDBench، وهو معيار مرجعي قابل للتوسع يستفيد من قواعد البيانات الزمنية والتقنيات لتقييم الاستدلال الواقعي الحساس للوقت في النماذج اللغوية الكبيرة بشكل منهجي، مكملاً النهج الحالية بمقياس "دقة الوقت" المبتكر وبيانات خاصة بالتطبيقات.

Soyeon Kim, Jindong Wang, Xing Xie, Steven Euijong Whang2026-03-03
💬 NLP

Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

يقدم Uni-CoT إطار عمل موحداً لسلسلة الأفكار (Chain-of-Thought) يستفيد من نموذج استدلال ثنائي المستويات وتدريب مهيكل لتمكين الاستدلال متعدد الوسائط بكفاءة وتماسك عبر النصوص والرؤية، محققاً أداءً هو الأفضل في فئته على معايير توليد الصور وتحريرها بموارد حوسبية محدودة.

Luozheng Qin, Jia Gong, Yuqing Sun, Tianjiao Li, Mengping Yang, Xiaomeng Yang, Chao Qu, Zhiyu Tan, Hao Li2026-03-03
💬 NLP

Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks

تُثبت هذه الورقة أنه بالنسبة لنماذج لغة "خليط الخبراء" (Mixture-of-Experts)، لا يتم تحسين أداء الاستنتاج بمجرد تقليل خسارة ما قبل التدريب فحسب، بل من خلال الموازنة المشتركة بين العمليات الحسابية (FLOPs) النشطة وإجمالي الرموز لكل معلمة، مما يكشف أن مهام الاستنتاج تستهلك الكثير من البيانات وتستفيد من تكوينات ندرة محددة تختلف عن مهام الحفظ.

Taishi Nakamura, Satoki Ishikawa, Masaki Kawamura, Takumi Okamoto, Daisuke Nohara, Jun Suzuki, Rio Yokota2026-03-03
💬 NLP

Post-training Large Language Models for Diverse High-Quality Responses

تقدم هذه الورقة البحثية DQO، وهي طريقة مبتكرة لما بعد التدريب تستفيد من عمليات النقطة المحدد (determinantal point processes) لتحسين النماذج اللغوية الكبيرة بشكل مشترك لإنتاج استجابات عالية الجودة ومتنوعة دلالياً، مما يتغلب بفعالية على ميل التعلم المعزز لإنتاج مخرجات ضيقة ونمطية.

Yilei Chen, Souradip Chakraborty, Lorenz Wolf, Yannis Paschalidis, Aldo Pacchiano2026-03-03
💬 NLP

BinaryShield: Cross-Service Threat Intelligence in LLM Services using Privacy-Preserving Fingerprints

يُعد BinaryShield نظاماً مبتكراً لاستخبارات التهديدات الحفاظ على الخصوصية، يتيح المشاركة الآمنة لبصمات هجمات حقن الأوامر البرمجية عبر الخدمات من خلال مسار يتكون من تنقيح معلومات الهوية الشخصية، والتمثيل الدلالي، والتكميم الثنائي، والاستجابة العشوائية، محققاً دقة كشف عالية (0.94 F1-score) وتحسينات ملحوظة في الأداء مقارنة بالنماذج المرجعية الحالية مع الامتثال للحدود التنظيمية.

Waris Gill, Natalie Isak, Matthew Dressman2026-03-03
💬 NLP

Distribution-Aligned Decoding for Efficient LLM Task Adaptation

تقدم هذه الورقة البحثية طريقة فك التشفير بمتجه التوجيه (SVDecode)، وهي طريقة خفيفة الوزن وذات أساس نظري تعزز تكيف مهام النماذج اللغوية الكبيرة من خلال استخراج متجه توجيه من تدرج تباعد كولباك - ليبلر (KL-divergence) لنموذج تم البدء فيه مسبقاً (warm-started model) لمحاذاة توزيعات المخرجات مباشرة أثناء عملية فك التشفير، مما يحقق مكاسب كبيرة في الأداء عبر معايير قياس متعددة دون معاملات إضافية قابلة للتدريب.

Senkang Hu, Xudong Han, Jinqi Jiang, Yihang Tao, Zihan Fang, Yong Dai, Sam Tak Wu Kwong, Yuguang Fang2026-03-03