💬 NLP

Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text

تحدد هذه الورقة أنه على الرغم من الأداء القوي في المهام اللاحقة، تعاني نماذج اللغة المنطوقة الحالية من ضعف المحاذاة بين التمثيلات الكلامية والنصية بسبب الاختلافات الهيكلية، وتقترح إطار عمل يفصل عدم تطابق الطول عن المحاذاة الدلالية لسد هذه الفجوة وتحسين اتباع التعليمات والتعميم.

Hyeonyu Kim, Hwayeon Kim, Youngwon Choi, Myeongkyun Cho, Huu-Kim Nguyen2026-08-25
🤖 machine learning

Safety Hacking in Constrained Best-of-NN Inference-time Scaling

تُثبت هذه الورقة أن التوسع في وقت الاستدلال عبر أسلوب "أفضل NN من NN" المقيد عرضة بطبيعتها لـ "اختراق السلامة"، حيث تلوث نماذج السلامة التقريبية غير المكتملة المجموعة الممكنة، ويؤدي تعظيم المكافأة إلى تضخيم المخرجات غير الآمنة المتبقية، مما يجعل إخفاقات السلامة مؤكدة تقاربيًا مع نمو عدد العينات ما لم تُستخدم آليات محددة للتحكم في التغطية.

Akifumi Wachi, Takumi Tanabe, Youhei Akimoto2026-08-25
🤖 AI

Beyond Observed Auxiliary Relations: Environment-Conditioned Modeling for Multi-Behavior Recommendation

تقترح الورقة البحثية إطار عمل BOAR، وهو إطار توصية متعدد السلوك مشروط بالبيئة يعالج بفعالية الإشارات المساعدة المفقودة وغير الموثوقة لتحسين التنبؤ بالسلوك المستهدف بشكل كبير، لا سيما بالنسبة للعناصر التي تفتقر إلى الملاحظات المساعدة.

Seunghan Lee, Hyunsik Yoo, Jian Kang, Susik Yoon, SeongKu Kang2026-08-25
🤖 AI

Concepts for Securing Agentic AI Coding and the Terok Environment

تتناول هذه الورقة مخاطر أمن تقنية المعلومات الجسيمة التي يفرضها الذكاء الاصطناعي الوكيل (Agentic AI) في تطوير البرمجيات، وذلك من خلال تقديم تقييم شامل لهذه التهديدات، واقتراح استراتيجية تخفيف تحافظ على فوائد هذه التقنية، وتفصيل تنفيذ لهذا المفهوم لتمكين الاعتماد الآمن والمسؤول.

Jiří Vyskočil, Franz Pöschel, Andreas Knüpfer2026-08-25
💬 NLP

What Proves You Wrong: Benchmarking Language Models on Falsifiable Research Ideation

تقدم هذه الورقة معيار Lit2Test، وهو إطار عمل مبتكر يقيم قدرات النماذج اللغوية في ابتكار الأفكال البحثية من خلال اشتراط تضمين المقترحات لنتائج قابلة للتفنيد، مما يتيح تصنيفاً موثوقاً ومعمى وصارماً للنماذج الرائدة بناءً على جودة الاختبارات المقترحة بدلاً من الطلاقة السطحية.

Ziyue Wang (State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University), A (…)2026-08-25
🤖 AI

WildHandBench: A Benchmark for Handwritten Text Understanding that Challenges MLLMs and Humans

تقدم الورقة البحثية WildHandBench، وهو معيار شامل لفهم النصوص المكتوبة بخط اليد، والذي يكشف أن النماذج اللغوية الكبيرة متعددة الوسائط الحالية تتخلف بشكل كبير عن الأداء البشري وتظهر اعتماداً منهجياً على الأولويات اللغوية بدلاً من الأدلة المرئية، وهو عيب لا يمكن كشفه بواسطة مقاييس الدقة التقليدية.

Jun Zhang, Qiao Zhao, Cheng Cui, Jianying Qu, Zhongkai Sun, Jianwen Yang, Changda Zhou, ZhuoXin Liu, Shubin Han2026-08-25
🤖 AI

What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels

تقدم هذه الورقة إطار قياس يميز بين مستويات الفعل، والمهمة، والخطوة لإثبات أن التقييمات الحالية لعمليات وكلاء البرمجة غالباً ما تخلط بين الصلة الدلالية والمساهمة السببية، مما يكشف أن سلوك الوكيل مدفوع بأصل التنفيذ وعدم اليقين على مستوى المهمة بدلاً من مجرد انتقالات الكود.

Jiawei He, Mengyu Shi, Jie jia, Xikai Yang, Dong Sun2026-08-25
🤖 AI

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

تقدم الورقة البحثية إطار عمل SPARE، وهو إطار عمل موجه بـ KL يعمل على تقليم النصوص الاستدلالية الزائدة بفعالية في وكلاء النماذج اللغوية الكبيرة متعددة الوسائط مع الحفاظ على الأدلة البصرية الجوهرية، مما يؤدي إلى تحسين دقة المهام والتخفيف من مشكلة "الدين النصي" في سيناريوهات استخدام الأدوات متعددة الوسائط طويلة المدى.

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung2026-08-25
🤖 AI

Toward Effective and Reliable LLM Agents via Dynamic Ontology

تقدم الورقة البحثية إطار عمل OaK، الذي يقوم ببناء وتطوير أنطولوجيات موجهة للمهام بشكل ديناميكي لتجسيد المعرفة والعلاقات صراحةً، مما يعزز من توظيف الأدلة وموثوقية الاستدلال متعدد الخطوات في وكلاء النماذج اللغوية الكبيرة.

Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yuanning Cui, Lingbing Guo, Wei Hu2026-08-25
🤖 AI

Budget-Constrained Embodied Perception: Four Resource Walls and a Pre-Registered Evaluation of Access-Structured Perception on Open Models at less than 31B

تقدم هذه الدراسة المسجلة مسبقاً ASP، وهو غلاف لا يتطلب تدريباً يعمل على تحسين دقة الاسترجاع العرضي بشكل كبير للوكلاء المجسدين ذوي الميزانية المحدودة من خلال آليات وصول مشروطة بالاستعلام، بينما تثبت أن الضغط عبر الإنترنت الموجه بالحث والتعقيد المعماري الكامل لا يعززان الأداء بالضرورة في النماذح ذات الأوزان المفتوحة تحت ميزانيات الرموز الثابتة.

Defu Lin, Wenhui Chen, Ziyao Lin, Jianlin Chen, Peiji Long, Chi Man Vong2026-08-25