🤖 machine learning

Test-Time Scaling Makes Overtraining Compute-Optimal

تقدم هذه الورقة قوانين التوسع من التدريب إلى الاختبار (T2T^2) التي تُحسّن بشكل مشترك حجم النموذج، ورموز التدريب، وعينات الاستدلال في ظل ميزانيات ثابتة، مما يكشف أن مراعاة تكاليف وقت الاختبار تنقل استراتيجيات التدريب المسبق المثلى إلى نظام الإفراط في التدريب الذي يتفوق بشكل كبير على نهج التوسع القياسي.

Nicholas Roberts, Sungjun Cho, Zhiqi Gao, Tzu-Heng Huang, Albert Wu, Gabriel Orlanski, Avi Trost, Kelly Buchanan, Aws Al (…)2026-04-03
💻 computer science

Adaptive Stopping for Multi-Turn LLM Reasoning

تقدم هذه الورقة MiCP، وهو أول إطار عمل للتنبؤ المطابق للاستدلال متعدد الخطوات في النماذج اللغوية الكبيرة، والذي يقوم بتخصيص ميزانيات الخطأ عبر الخطوات لتوفير ضمانات تغطية رسمية مع تمكين التوقف المبكر التكيفي لتقليل التكلفة وزمن الاستجابة في التطبيقات عالية المخاطر.

Xiaofan Zhou, Huy Nguyen, Bo Yu, Chenxi Liu, Lu Cheng2026-04-03
💻 computer science

Cost-Efficient Estimation of General Abilities Across Benchmarks

تقدم هذه الورقة مجموعة بيانات العناصر واسعة النطاق (WILD)، وتثبت أن الجمع بين نموذج نظرية الاستجابة للمفردة متعدد الأبعاد المعدل واختيار العناصر التكيفي المراعي للتكلفة يمكنه التنبؤ بأداء النماذج اللغوية الكبيرة عبر مهام متنوعة غير مرئية بدقة عالية (أقل من 7% من متوسط الخطأ المطلق) باستخدام 16 عنصرًا فقط، مما يقلل تكاليف التقييم بنسبة 85%.

Michael Krumdick, Adam Wiemerslage, Seth Ebner, Charles Lovering, Chris Tanner2026-04-03
💻 computer science

The power of context: Random Forest classification of near synonyms. A case study in Modern Hindi

تُظهر هذه الدراسة أن مصنف "الغابة العشوائية" (Random Forest) المدرب على تضمينات الكلمات الهندية يمكنه بنجاح التمييز بين المترادفات السنسكريتية والفارسية العربية بناءً فقط على أنماط الاستخدام السياقي، مما يقدم دليلاً كمياً على أن الأصل الاشتقاقي يترك بصمة يمكن اكتشافها في اللغة حتى عندما تتشارك الكلمات في المعنى ذاته.

Jacek Bąkowski2026-04-03
💻 computer science

Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs

تقدم هذه الورقة تحليلاً ميكانيكياً على مستوى الدوائر يكشف أن الثقة اللفظية المتضخمة في النماذج اللغوية الكبيرة مدفوعة بمجموعة مدمجة من كتل الـ MLP ورؤوس الانتباه في الطبقات المتوسطة إلى المتأخرة، والتي يمكن تحديدها سببياً واستهدافها لإعادة المعايرة أثناء الاستدلال لتحسين المعايرة بشكل كبير.

Tianyi Zhao, Yinhan He, Wendy Zheng, Yujie Zhang, Chen Chen2026-04-03
💻 computer science

From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents

تقدم الورقة البحثية SWE-ZERO إلى SWE-HERO، وهو إطار عمل ضبط دقيق ثنائي المراحل يقوم بتقطير النماذج اللغوية الكبيرة ذات الأوزان المفتوحة والطلائعية إلى وكلاء هندسة برمجيات ذوي قدرات فائقة عبر الجمع بين التدريب الدلالي واسع النطاق الخالي من التنفيذ مع صقل مستهدف مدعوم بالتنفيذ، محققاً معدل حل يبلغ 62.2% على SWE-bench Verified ومظهراً قدرة قوية على الانتقال متعدد اللغات.

Nikolai Ludwig, Wasi Uddin Ahmad, Somshubra Majumdar, Boris Ginsburg2026-04-03
💻 computer science

Magic, Madness, Heaven, Sin: LLM Output Diversity is Everything, Everywhere, All at Once

تقدم هذه الورقة إطار عمل "السحر، الجنون، الجنة، الخطيئة" لتوحيد الأبحاث المجزأة حول تنوع مخرجات النماذج اللغوية الكبيرة من خلال نمذجة التباين على طول محور التجانس-عدم التجانس عبر أربعة سياقات معيارية (المعرفية، والتفاعلية، والمجتمعية، والسلامة)، وبذلك تجادل بأن التنوع يجب أن يُقيّم كخاصية تعتمد على المهمة بدلاً من كونه سمة جوهرية للنموذج.

Harnoor Dhingra2026-04-03
💻 computer science

Countering Catastrophic Forgetting of Large Language Models for Better Instruction Following via Weight-Space Model Merging

تقترح هذه الورقة إطار عمل لدمج النماذج في فضاء الأوزان، ينجح في تطويع النماذج اللغوية الكبيرة العامة لتناسب المجال الطبي عبر مواجهة النسيان الكارثي بفعالية، مما يحافظ على كل من الخبرة السريرية والقدرة على اتباع التعليمات مع تحقيق كفاءة تدريب تضاهي الضبط الدقيق الكامل.

Mengxian Lyu, Cheng Peng, Ziyi Chen, Mengyuan Zhang, Jieting Li Lu, Yonghui Wu2026-04-03
💻 computer science

Acoustic and perceptual differences between standard and accented Chinese speech and their voice clones

تكشف هذه الدراسة أنه بينما تُظهر استنساخات الأصوات للغة الماندارين القياسية والمُصابة بلكنة مسافات متشابهة قائمة على التضمين لأصولها، فإن التقييمات الإدراكية تُظهر أن اللكنة تؤثر بشكل كبير على كل من تطابق الهوية المُدرك وتحسينات الوضوح، مما يشير إلى ضرية تقييمهما كأبعاد متميزة في استنساخ الصوت.

Tianle Yang, Chengzhe Sun, Phil Rose, Siwei Lyu2026-04-03
💻 computer science

Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression

يُعد Swift-SVD إطار عمل للضغط منخفض الرتبة يعتمد على التنشيط ولا يتطلب تدريباً، وهو يحقق الأمثلية النظرية والاستقرار العددي من خلال تحليل القيم الذاتية ذي الصيغة المغلقة، مقدمًا في الوقت ذاته دقة فائقة وتسريعًا كبيرًا مقارنة بالطرق الحالية لنشر النماذج اللغوية الكبيرة.

Ruoling Qi, Yirui Liu, Xuaner Wu, Xiangyu Wang, Ming Li, Chen Chen, Jian Chen, Yin Chen, Qizhen Weng2026-04-03