💬 NLP

Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models

تقترح الورقة البحثية إطار عمل "التخيل ثم التخطيط" (Imagine-then-Plan - ITP)، وهو إطار موحد يعزز تخطيط الوكيل من خلال دمج نموذج سياسة مع نموذج عالم عبر آلية استشراف تكيفي مبتكرة، مما يتيح توليد مسارات متخيلة متعددة الخطوات لتوجيه اتخاذ القرار في البيئات المعقدة ذات الإدراك الجزئي.

Youwei Liu, Jian Wang, Hanlin Wang, Beichen Guo, Wenjie Li2026-03-17
💬 NLP

Multi-Agent LLMs for Generating Research Limitations

تقترح هذه الورقة إطار عمل لنماذج لغوية كبيرة متعددة الوكلاء يقوم بتوليد تعليقات OpenReview، وإفصاحات المؤلفين، وسياقات الاستشهاد بشكل تركيبي لتوليد حدود بحثية جوهرية بشكل منهجي، مما يعالج السطحية في النماذج ذات الدفعة الصفرية ويقدم بروتوكول تقييم قائم على النماذج اللغوية الكبيرة لقياس التغطية بشكل أفضل.

Ibrahim Al Azher, Zhishuai Guo, Hamed Alhoori2026-03-17
💬 NLP

BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models

تقدم هذه الورقة BabyReasoningBench، وهو معيار مرجعي قائم على أسس نمائية يتكون من 19 مهمة استدلال مستوحاة من نماذج علم النفس الكلاسيكية، والذي يكشف أن النماذج اللغوية "الرضيعة" المدربة على الكلام الموجه للأطفال تظهر قدرات استدلال غير متكافئة تتحسن مع التوسع في المهام السببية والفيزيائية ولكنها تظل تواجه تحديات في عزو الاعتقاد والبراغماتية.

Kaustubh D. Dhole2026-03-17
💬 NLP

From Intuition to Calibrated Judgment: A Rubric-Based Expert-Panel Study of Human Detection of LLM-Generated Korean Text

تقدم هذه الورقة البحثية LREAD، وهو إطار عمل لمعايرة الخبراء قائم على معايير تقييم، يعمل بشكل كبير على تحسين قدرة المقيّمين البشريين على التمييز بين النصوص التي تولدها النماذج اللغوية الكبيرة باللغة الكورية والكتابة البشرية من خلال الانتقال من الأحكام الحدسية إلى التقييم المرتكز على المعايير، مما يرفع الدقة من 60% إلى 90% ويعزز الاتفاق بين المقيمين.

Shinwoo Park, Yo-Sub Han2026-03-17
💬 NLP

Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Study

تقدم هذه الورقة أول دراسة تجريبية واسعة النطاق لمهارات الوكلاء الخبيثين من الأطراف الثالثة، حيث تقدم مجموعة بيانات مصنفة تضم 157 تهديداً مؤكداً تكشف عن نظام بيئي منقسم من لصوص البيانات ومختطفي الوكلاء الذين يستغلون ثغرات سلاسل التوريد وخطافات المنصات، مع إثبات فعالية الإفصاح المسؤول في إزالة 93.6% من هذه المخاطر.

Yi Liu, Zhihao Chen, Yanjun Zhang, Gelei Deng, Yuekang Li, Jianting Ning, Ying Zhang, Leo Yu Zhang2026-03-17
⚡ electrical engineering

Covo-Audio Technical Report

تقدم هذه الورقة البحثية Covo-Audio، وهو نموذج لغوي صوتي ضخم متكامل (end-to-end) بـ 7 مليارات معلمة، يعمل على توحيد معالجة وتوليد الصوت المستمر لتحقيق أداء رائد عبر مختلف مهام الكلام والصوت، مع تقديم نسخ متخصصة للحوار المنطوق والتفاعل ثنائي الاتجاه (full-duplex) إلى جانب استراتيجية فعالة من حيث التكلفة لفصل ذكاء الحوار عن إخراج الصوت.

Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zik (…)2026-03-17
💬 NLP

When Tables Go Crazy: Evaluating Multimodal Models on French Financial Documents

تقدم هذه الورقة البحثية "Multimodal Finance Eval"، وهو أول معيار لتقييم فهم المستندات المالية باللغة الفرنسية، والذي يكشف أنه بينما تبرع النماذج اللغوية البصرية الحالية في استخراج النصوص والجداول، فإنها تعاني بشكل كبير في تفسير الرسوم البيانية وتعاني من انتشار الأخطاء في الاستدلال الحواري متعدد الأدوار.

Virginie Mouilleron, Théo Lasnier, Anna Mosolova, Djamé Seddah2026-03-17
💬 NLP

PolyFrame at MWE-2026 AdMIRe 2: When Words Are Not Enough: Multimodal Idiom Disambiguation

يعالج نظام PolyFrame تحدي فك التباس الاصطلاحات متعدد الوسائط في المهمة المشتركة MWE-2026 AdMIRe2 من خلال توظيف مسار موحد يعتمد على مشفرات CLIP وBGE M3 المجمدة والمعززة بوحدات خفيفة الوزن مثل إعادة الصياغة المدركة للاصطلاحات والتنبؤ بنوع الجملة، محققاً مكاسب كبيرة في الأداء ونقلاً قوياً متعدد اللغات في حالة التعلم الصفري دون الحاجة إلى ضبط النماذج الكبيرة.

Nina Hosseini-Kivanani2026-03-17
💬 NLP

Under the Influence: Quantifying Persuasion and Vigilance in Large Language Models

تتقصى هذه الورقة العلاقة بين الإقناع، واليقظة، وأداء المهام في النماذج اللغوية الكبيرة باستخدام لعبة "سوكوبان" (Sokoban) متعددة الأدوار، كاشفةً عن أن هذه القدرات قابلة للفصل، وأنه بينما قد تفشل النماذج في اكتشاف الخداع، فإنها تعدل باستمرار من جهدها الاستدلالي بناءً على القصد المتصور للنصيحة.

Sasha Robinson, Katherine M. Collins, Ilia Sucholutsky, Kelsey R. Allen2026-03-17