💬 NLP

Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking

تقدم الورقة البحثية Region-R1، وهو إطار عمل جديد لإعادة الترتيب متعدد الوسائط يستخدم سياسة اتخاذ قرار تعتمد على تحسين السياسة النسبية للمجموعات المدركة للمناطق (r-GRPO) لقص صور جانب الاستعلام ديناميكيًا، مما يؤدي إلى تخفيف المشتتات البصرية وتحسين أداء الاسترجاع بشكل كبير في الاختبارات المعيارية الصعبة.

Chan-Wei Hu, Zhengzhong Tu2026-04-08
💬 NLP

Beneath the Surface: Investigating LLMs' Capabilities for Communicating with Subtext

تقدم هذه الورقة أربع مجموعات تقييم جديدة لتقييم قدرة النماذج اللغوية الكبيرة على استخدام وتفسير المعاني الضمنية بشكل منهجي، كاشفةً عن أنه في حين تعاني النماذج الرائدة عموماً من صعوبة في التواصل الدقيق والضمني بسبب الانحياز نحو التفسير الحرفي، إلا أنها يمكن أن تتحسن مع وجود أرضية مشتركة وظروف سياقية محددة، رغم استمرار وجود نقاط ضعف كبيرة.

Kabir Ahuja, Yuxuan Li, Andrew Kyle Lampinen2026-04-08
🤖 machine learning

LLMs Should Express Uncertainty Explicitly

تجادل هذه الورقة بوجوب تدريب النماذج اللغوية الكبيرة على التعبير صراحةً عن عدم اليقين من خلال واجهتين متكاملتين: الثقة اللفظية العالمية لمعايرة الإجابات النهائية، وإشارات وقت الاستدلال المحلية لتفعيل التدخلات، وذلك لتحسين عملية اتخاذ القرار في مهام مثل الاسترجاع والتحقق.

Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei2026-04-08
💬 NLP

ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving

تقدم هذه الورقة ICR-Drive، وهو إطار تشخيصي يقيم متانة وكلاء القيادة الذاتية المعتمدة على اللغة من الطرف إلى الطرف ضد اضطرابات التعليمات المتنوعة، كاشفاً أن التغيرات الطفيفة في الأوامر اللغوية الطبيعية يمكن أن تسبب تدهوراً كبيراً في الأداء وأنماط فشل متميزة في السيناريوهات الحرجة للسلامة.

Kaiser Hamid, Can Cui, Nade Liang2026-04-08
💬 NLP

Confidence Should Be Calibrated More Than One Turn Deep

تقدم هذه الورقة المعايرة متعددة الأدوار لمعالجة أوجه القصور في تقدير الثقة أحادي الدور في النماذج اللغوية الكبيرة، مقترحةً طريقة MTCal واستراتيجية فك التشفير ConfChat للحفاظ ديناميكياً على تفاعلات موثوقة وواقعية ومتسقة عبر أدوار المحادثة رغم مخاطر مثل إقناع المستخدم.

Zhaohan Zhang, Chengzhengxu Li, Xiaoming Liu, Chao Shen, Ziquan Liu, Ioannis Patras2026-04-08
💬 NLP

Multi-Drafter Speculative Decoding with Alignment Feedback

تقدم الورقة البحثية MetaSD، وهو إطار عمل موحد يسرع استنتاج النماذج اللغوية الكبيرة من خلال الاختيار والتخصيص الديناميكي لعدة مسودات غير متجانسة عبر نهج "المتعدد الأذرع" (multi-armed bandit) بناءً على تغذية راجعة للمحاذاة، مما يتفوق بذلك على طرق فك التشفير التخميني التقليدية ذات المسود الواحد.

Taehyeon Kim, Hojung Jung, Se-Young Yun2026-04-08
💬 NLP

Content Fuzzing for Escaping Information Cocoons on Digital Social Media

تقدم هذه الورقة "ContentFuzz"، وهو إطار عمل موجّه بالثقة يستفيد من النماذج اللغوية الكبيرة لإعادة كتابة منشورات وسائل التواصل الاجتماعي بطرق تحافظ على القصد البشري الأصلي مع تغيير تسميات الموقف المستنتجة آلياً، مما يساعد المحتوى على الهروب من الشرانق المعلوماتية والوصول إلى جماهير متنوعة.

Yifeng He, Ziye Tang, Hao Chen2026-04-08
🤖 AI

Can We Trust a Black-box LLM? LLM Untrustworthy Boundary Detection via Bias-Diffusion and Multi-Agent Reinforcement Learning

تقدم هذه الورقة البحثية GMRL-BD، وهو خوارزمية جديدة من نوع الصندوق الأسود تستفيد من رسم بياني للمعرفة مستمد من ويكيبيديا والتعلم المعزز متعدد الوكلاء للكشف بكفاءة عن الحدود غير الموثوقة للنماذج اللغوية الكبيرة من خلال تحديد المواضيع المعرضة للاستجابات المتحيزة، مصحوبة بإصدار مجموعة بيانات جديدة تغطي نماذج شهيرة مثل Llama2 وVicuna.

Xiaotian Zhou, Di Tang, Xiaofeng Wang, Xiaozhong Liu2026-04-08
💬 NLP

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

تحدد هذه الورقة البحثية الإحالة المرجعية عبر الأنماط كعنق زجاجة حرج في النماذج اللغوية الكبيرة الشاملة (Omni-LLMs)، وتقدم مجموعة بيانات CrossOmni لتقييم هذه القدرة، وتثبت أن الاستراتيجيات القائمة على التدريب وغير القائمة على التدريب تحسن بشكل كبير الاستدلال المتين متعدد الأنماط من خلال استحثاث أنماط تفكير مدركة للإحالة المرجعية.

Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang2026-04-08
💬 NLP

Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects

تقدم هذه الورقة تصنيفاً منهجياً لتقنيات الكفاءة من الطرف إلى الطرف لنماذج الرؤية واللغة الضخمة، معالجةً عقبة هيمنة الرموز المرئية عبر مراحل الترميز، والملء المسبق، وفك التشفير، مع تحديد الآفاق المستقبلية لموازنة الدقة المرئية مع أداء النظام.

Jun Zhang, Yicheng Ji, Feiyang Ren, Yihang Li, Bowen Zeng, Zonghao Chen, Ke Chen, Lidan Shou, Gang Chen, Huan Li2026-04-08