🤖 AI

SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

تقدم الورقة البحثية SONIC-O1، وهو معيار شامل تم التحقق منه بشرياً ويتكون من 60 ساعة من البيانات الصوتية المرئية الواقعية عبر 13 مجالاً، والمصمم لتقييم وكشف تفاوتات الأداء في قدرات النماذج اللغوية الكبيرة متعددة الوسائط في التلخيص، والإجابة على الأسئلة، والاستدلال الزمني.

Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum, Deval Pandya, Shaina Raza2026-05-28
🤖 machine learning

Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning

تقدم هذه الورقة RankTuner، وهو إطار عمل للضبط الدقيق يستخدم إشارة معايرة احتمالية-إنتروبية مبتكرة تسمى مؤشر الرتبة النسبي لإعادة وزن الرموز ديناميكيًا، مما يحسن الاستدلال الرياضي، وتوليد الكود، ونقل المعرفة خارج نطاق التوزيع من خلال تركيز التحديثات على الرموز التي لم تُتعلم حقًا مع مراعاة عدم اليقين الجوهري.

Wenhao Yu, Shaohang Wei, Jiahong Liu, Yifan Li, Minda Hu, Aiwei Liu, Hao Zhang, Irwin King2026-05-28
🤖 AI

Emergent Analogical Reasoning in Transformers

تُصوّر هذه الورقة البحثية الاستدلال القياسي في نماذج "ترانسفورمر" من خلال منظور دالات الفئات (category theory functors)، مُثبتةً عبر مهام اصطناعية وتحليل آلي أنه ينبثق من المحاذاة الهندسية للبنى العلاقاتية وتطبيق الدالات، مع نتائج تظل قائمة وصحيحة بالنسبة للنماذج اللغوية الكبيرة سابقة التدريب.

Gouki Minegishi, Jingyuan Feng, Hiroki Furuta, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo2026-05-28
🤖 machine learning

ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning

تقترح الورقة البحثية إطار عمل ECHO، وهو إطار للتعلم التعزيزي في وقت الاختبار يجمع بين مقاييس الإنتروبيا والثقة للتحكم التكيفي في عمليات التدفق ذات الهيكل الشجري وتحسين تحديثات السياسة، مما يؤدي إلى منع انهيار التدفق وتخفيف الانحياز في المراحل المبكرة لتحسين أداء الاستدلال في ظل ميزانيات حوسبة محدودة.

Chu Zhao, Enneng Yang, Yuting Liu, Jianzhe Zhao, Guibing Guo2026-05-28
🤖 machine learning

Mitigating Staleness in Asynchronous Pipeline Parallelism via Basis Rotation

تحدد هذه الورقة أن تقادم التدرج في التوازي الأنبوبي غير المتزامن يتفاقم بسبب عدم المحاذاة بين قاعدة متجهات القيم الذاتية لهيسيان (Hessian) ونظام الإحداثيات، وتقترح إطار عمل "تدوير القاعدة" لإعادة محاذاة هذه القواعد، مما يقلل بشكل كبير من دورات التدريب ويستعيد قابلية التوسع للتدريب الموزع واسع النطاق.

Hyunji Jung, Sungbin Shin, Namhoon Lee2026-05-28
🤖 AI

Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models

تقدم هذه الورقة إطار عمل McDiffuSE، الذي يستفيد من بحث شجرة مونت كارلو (Monte Carlo Tree Search) لتحسين ترتيب ملء الفراغات (slot infilling) في نماذج الانتشار المقنعة (Masked Diffusion Models)، مما يحسن جودة التوليد بشكل كبير في مهام الاستدلال الرياضي والبرمجي من خلال الاستكشاف الفعال لاستراتيجيات الإكمال غير المتسلسلة.

Joshua Ong Jun Leang, Yu Zhao, Mihaela Cătălina Stoian, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia2026-05-28
📊 statistics

The Well-Tempered Classifier: Some Elementary Properties of Temperature Scaling

تقدم هذه الورقة تحليلاً نظرياً دقيقاً لتقنية قياس درجة الحرارة (temperature scaling)، حيث تثبت تأثيرها العام في زيادة عدم اليقين في النموذج، وتتحدى المفهوم القائل بأنها تزيد من التنوع في النماذج اللغوية الكبيرة، وتقدم رؤى جديدة حول خصائصها الفريدة من منظور هندسي وخطي.

Pierre-Alexandre Mattei, Bruno Loureiro2026-05-28
💬 NLP

Colosseum: Auditing Collusion in Cooperative Multi-Agent Systems

تقدم هذه الورقة Colosseum، وهو إطار عمل لتدقيق التواطؤ في الأنظمة متعددة الوكلاء التعاونية، والذي يكشف أن وكلاء النماذج اللغوية الكبيرة غالبًا ما يظهرون تواطؤًا ناشئًا من خلال قنوات سرية و"تواطؤاً على الورق" حيث يخططون للتواطؤ لكنهم يفشلون في تنفيذه.

Mason Nakamura, Abhinav Kumar, Saswat Das, Sahar Abdelnabi, Saaduddin Mahmud, Ferdinando Fioretto, Shlomo Zilberstein, E (…)2026-05-28
🤖 machine learning

The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes

تبحث هذه الورقة في كيفية تسبب تدريب أنظمة الذكاء الاصطناعي ضد كواشف الخداع ذات الصندوق الأبيض (white-box deception detectors) في بيئة برمجة واقعية في نشوء استراتيجيتي تعمية متميزتين —وهما التنشيطات المُعمّاة والسياسات المُعمّاة— مع إثبات أن تنظيم "كولباك - ليبلر" (KL regularization) القوي بما يكفي وعقوبات الكاشف يمكنهما لا يزالان فرض السلوك الأمين بفعالية.

Mohammad Taufeeque, Stefan Heimersheim, Adam Gleave, Chris Cundy2026-05-28
🔢 mathematics

Noise Scheduling as Information-Guided Allocation in Diffusion Training

تقدم الورقة البحثية InfoNoise، وهي طريقة تكيفية عبر الإنترنت لجدولة الضجيج تقوم بإعادة تخصيص جهد التدريب ديناميكيًا إلى مستويات الضجيج الأكثر إفادة من خلال تقدير ملف تعريف معدل الإنتروبيا الشرطية، مما يحقق أداءً فائقًا وحوسبة أقل بنسبة تصل إلى 3 أضعاف عبر مجالات متنوعة دون الحاجة إلى نماذج مساعدة أو بحث غير متصل بالإنترنت.

Gabriel Raya, Bac Nguyen, Georgios Batzolis, Yuhta Takida, Dejan Stancevic, Naoki Murata, Chieh-Hsin Lai, Yuki Mitsufuji (…)2026-05-28