💻 computer science

Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards

تقدم هذه الورقة البحثية VIP، وهي استراتيجية تخصيص تنبؤي معلوماتي للتباين (Variance-Informed Predictive allocation) تعمل على تحسين توزيع عمليات التدحرج (rollout distribution) عبر مطالبات التدريب ديناميكيًا باستخدام تقدير التباين القائم على العمليات الغاوسية لتقليل تباين التدرج وتحسين كفاءة أخذ العينات بشكل كبير في التعلم التعزيزي عبر الإنترنت مع مكافآت قابلة للتحقق.

Hieu Trung Nguyen, Bao Nguyen, Wenao Ma, Yuzhi Zhao, Ruifeng She, Viet Anh Nguyen2026-03-06
💻 computer science

Assessing Risks of Large Language Models in Mental Health Support: A Framework for Automated Clinical AI Red Teaming

تقدم هذه الورقة إطار عمل لمحاكاة "الفريق الأحمر" السريري يجمع بين معالجين نفسيين يعملون بالذكاء الاصطناي وتجارب لمرضى افتراضيين ديناميكيين لتقييم أنظمة دعم الصحة النفسية، مما يكشف عن فجوات سلامة حرجة مثل تأكيد الأوهان والفشل في تهدئة مخاطر الانتحار لدى وكلاء الذكاء الاصطناعي الذين تم اختبارهم في سيناريوهات اضطراب استخدام الكحول.

Ian Steenstra, Paola Pedrelli, Weiyan Shi, Stacy Marsella, Timothy W. Bickmore2026-03-06
💻 computer science

Learn Hard Problems During RL with Reference Guided Fine-tuning

تقدم هذه الورقة طريقة الضبط الدقيق الموجه بالمرجع (ReGFT)، وهي طريقة تعمل على تخليق مسارات إيجابية متوافقة مع النموذج باستخدام حلول مرجعية بشرية جزئية للتغلب على ندرة المكافأة وتعزيز أداء وكفاءة تدريب التعلم المعزز للاستدلال الرياضي بشكل كبير.

Yangzhen Wu, Shanda Li, Zixin Wen, Xin Zhou, Ameet Talwalkar, Yiming Yang, Wenhao Huang, Tianle Cai2026-03-06
💻 computer science

VoxKnesset: A Large-Scale Longitudinal Hebrew Speech Dataset for Aging Speaker Modeling

تقدم هذه الورقة VoxKnesset، وهي مجموعة بيانات مفتوحة الوصول واسعة النطاق تضم 2,300 ساعة من الخطابات البرلمانية العبرية الطولية الممتدة من عام 2009 إلى 2025، والتي تُستخدم لتقييم وتوضيح تحديات التحقق من هوية المتحدث والتنبؤ بالعمر بمرور الوقت، مما يكشف عن تدهور كبير في أداء النماذج القياسية مع تقدم المتحدثين في العمر.

Yanir Marmor, Arad Zulti, David Krongauz, Adam Gabet, Yoad Snapir, Yair Lifshitz, Eran Segal2026-03-06
💻 computer science

Incremental Graph Construction Enables Robust Spectral Clustering of Texts

تقدم هذه الورقة طريقة بنائية تزايدية لإنشاء مخطط kk-NN تضمن الاتصال بالتصميم، مما يتيح تجميعاً طيفياً قوياً لتمثيلات النصوص (text embeddings) يتفوق على النهج القياسية في أنظمة kk-المنخفضة حيث تؤدي المكونات غير المتصلة عادةً إلى تدهور الأداء.

Marko Pranjić, Boshko Koloski, Nada Lavrač, Senja Pollak, Marko Robnik-Šikonja2026-03-06
💻 computer science

Bielik-Q2-Sharp: A Comparative Study of Extreme 2-bit Quantization Methods for a Polish 11B Language Model

تقدم هذه الورقة Bielik-Q2-Sharp، وهي تقييم منهجي لست طرق تكميم بـ 2 بت على نموذج لغوي بولندي بحجم 11 مليار معلمة، حيث تحدد QuIP# كمتغير عالي الأداء يضاهي خط الأساس IQ2_XXS، بينما تكشف عن انفصال حرج بين الحفاظ على احتمالية السجل (log-likelihood) والتوليد ذاتي الانحدار في الطرق القائمة على الدوران.

Jakub Prejzner2026-03-06
💻 computer science

AgentIR: Reasoning-Aware Retrieval for Deep Research Agents

تقدم الورقة البحثية AgentIR، وهو نموذج استرجاع مدرك للاستنتاج وطريقة مرتبطة بتخليق البيانات (DR-Synth) تستفيد من آثار التفكير الوسيطة الصريحة لوكلاء البحث العميق لتدريب نموذج التضمين AgentIR-4B، والذي يتفوق بشكل كبير على المسترجعات التقليدية في معيار BrowseComp-Plus.

Zijian Chen, Xueguang Ma, Shengyao Zhuang, Jimmy Lin, Akari Asai, Victor Zhong2026-03-06
💻 computer science

SearchGym: A Modular Infrastructure for Cross-Platform Benchmarking and Hybrid Search Orchestration

تقدم هذه الورقة البحثية SearchGym، وهي بنية تحتية نمطية تفصل بين مكونات البيانات والتضمين والاسترجاع لتمكين القياس المرجعي المتكرر عبر المنصات وتنسيق البحث الهجين، كاشفةً أن التسلسل الأمثل لمسار العمل يعتمد على قوة التصفية وتحقيق معدل استرجاع بنسبة 70% لأفضل 100 نتيجة في معيار LitSearch.

Jerome Tze-Hou Hsu2026-03-06
💻 computer science

FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents

تقدم هذه الورقة FinRetrieval، وهو معيار لتقييم قدرة الوكلاء الذكيين على استرجاع بيانات مالية محددة من قواعد بيانات مهيكلة، مما يكشف أن توفر الأدوات (لا سيما واجهات برمجة التطبيقات المهيكلة) هو المحرك الأساسي للأداء، مع تسليط الضوء على التأثيرات الدقيقة لأنماط الاستدلال واتفاقيات التسمية الجغرافية.

Eric Y. Kim, Jie Huang2026-03-06
💻 computer science

CTRL-RAG: Contrastive Likelihood Reward Based Reinforcement Learning for Context-Faithful RAG Models

تقترح الورقة البحثية CTRL-RAG، وهو إطار عمل جديد للتعلم التعزيزي يستخدم مكافأة احتمالية تباينية لتحسين فجوة الاحتمالية اللوغاريتمية بين الاستجابات بوجود أدلة داعمة ومن دونها، مما يعزز دقة السياق ويخفف من الهلوسة في نماذج التوليد المعزز بالاسترجاع.

Zhehao Tan, Yihan Jiao, Dan Yang, Junjie Wang, Duolin Sun, Jie Feng, Xidong Wang, Lei Liu, Yue Shen, Jian Wang, Jinjie G (…)2026-03-06