💬 NLP

Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion

تقترح الورقة البحثية DuPLeR، وهو إطار عمل للاستنتاج عبر نماذج اللغات الكبيرة ثنائي المسار يدمج الأوليات المستمدة من نماذج اللغات الكبيرة متعددة الوسائط مع هياكل الرسوم البيانية الواقعية لتحقيق إكمال قوي لرسوم المعرفة في سياق التعلم بلقطات قليلة، وذلك من خلال التخفيف من الضجيج وتعزيز تمثيلات الكيانات عبر رسوم بيانية علاقاتية معايرة واستدلال هيكلي ثنائي المستوى.

Jinlan Liu, Zhiying Tu, Yongchao Xing, Yicheng Liu, Bolin Zhang, Dianbo Sui, Dianhui Chu, Hongliang Sun2026-07-30
💬 NLP

Latent-IM: Latent Interaction Management for Speech LLMs

تقدم الورقة البحثية Latent-IM، وهو إطار عمل يستعيد إدارة الحوار الصريحة داخل النماذج اللغوية الكبيرة للخطاب من خلال فصل اختيار الحركة الحوارية وتحقيقها إلى تمثيلات كامنة داخلية، مما يحسن دقة الحركة بشكل كبير دون الحاجة إلى الضبط الدقيق الكامل.

Adar Avsian, Atahan Dokme, Tony Woo, Larry Heck2026-07-30
💬 NLP

Credit Cards, Confusion, Computation, and Consequences: What Can We Uncover About Language Model Reasoning?

تقدم هذه الورقة CreditCardQA، وهو معيار للثقافة المالية يعتمد على اتفاقيات بطاقات الائتمان الحقيقية، وتوضح أنه بينما يحسن أسلوب "البرمجة عبر التفكير" (Program-of-Thought) الأداء عبر النماذج اللغوية، فإن إخفاقاتها الأساسية تنبع من سوء تفسير القواعد التعاقدية والحالات الاستثنائية بدلاً من الأخطاء الحسابية، وهو ما يؤثر غالباً بشكل غير متناسب على الأفراد المستضعفين مالياً.

Arnav Hiray, Agam Shah, Caleb Lu, Meghaj Tarte, Harsit Mittal, Sudheer Chava2026-07-30
💬 NLP

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

تقدم هذه الورقة البحثية TREK، وهو معيار مرجعي صارم وقابل لإعادة الإنتاج بالكامل يتميز بمقيّم حتمي ومجموعة بيانات سفر اصطناعية واسعة النطاق لتقييم قدرة وكلاء النماذج اللغوية الكبيرة على إنشاء مسارات رحلات قابلة للتنفيذ ومتوافقة مع القيود، مما يكشف أن حتى النماذج الأكثر تطوراً تعاني بشكل كبير مع التخطيط متعدد القيود وتلبية احتياجات المستخدم غير المصرح بها.

Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King2026-07-30
💬 NLP

OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

تقدم الورقة البحثية OptimismBench، وهو إطار عمل مبتكر يستخدم أزواج النجاح/الفشل المعكوسة للكشف عن الانحياز الاتجاهي المنهجي في النماذج اللغوية الكبيرة، كاشفةً أن معظم النماذج تظهر "ميلًا نحو التفاؤل" مدفوعًا بمرحلة ضبط التوافق ما بعد التدريب بدلاً من بنية النموذج أو اللغة.

Seonglae Cho, Adriano Koshiyama2026-07-30
🤖 AI

Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

تقدم هذه الورقة "سيتوكا" (Setoka)، وهو معيار مرجعي مبتكر يستند إلى علم النفس المعرفي والشخصي لتقييم قدرة الوكلاء المخصصين على إجراء فهم هرمي للمستخدم — من الذاكرة الدلالية والمنعكسة إلى أنماط السلوك والسمات الشخصية — عبر بيانات غير متجانسة، كاشفةً عن أن الأنظمة الحالية تعاني بشكل كبير في المهام التي تتطلب دمج وتجريد المعلومات طويلة الأمد المجزأة بما يتجاوز مجرد استرجاع الحقائق البسيطة.

Lingyang Zeng, Guangze Chen, Kaichen Yu, Zhicheng Pan, Siyang Weng, Zirui Hu, Xiangyun Du, Hailin He, Rong Zhang, Chengc (…)2026-07-30
🤖 AI

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

تقدم هذه الورقة البحثية "التقطير القائم على التوجيه في السياسة الموحدة" (ROPD)، وهو إطار عمل مبتكر يعزز سلامة النماذج اللغوية الكبيرة من خلال نمذجة تباعد توزيع المخرجات بدلاً من قوالب المطالبات المحددة، مما يحقق دفاعاً قوياً ضد عدم تطابق القوالب وإعادة كسر الحماية مع الحفاظ على المهارات المتخصصة.

Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen2026-07-30
🤖 AI

Linguistic Monoculture in LLM-Assisted Language Use

تطور هذه الورقة إطاراً رياضياً يوضح أنه في حين يمكن للكتابة بمساعدة النماذج اللغوية الكبيرة أن تعزز الوضوح، فإن الاعتماد الواسع على النماذج المشتركة ينطوي على مخاطر خلق "أحادية ثقافية لغوية" من خلال تقليل التنوع اللغوي على مستوى السكان، وهي مشكلة يمكن التخفيف من حدتها من خلال النماذج الشخصية والموازنات الاستراتيجية بين الامتثال والتميز.

Suhas Thejaswi, Juhi Kulshreshta, Lutz Oettershagen2026-07-30
🤖 AI

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

تقدم هذه الورقة OmegaUse-OfficeVal، وهو معيار مرجعي جديد يتكون من 100 مهمة من مهام حزمة المكتب طويلة الأمد ذات أسس اقتصادية (وقت العمل البشري وسعر المهمة) لتقييم وكلاء النماذج اللغوية الكبيرة، كاشفةً أنه في حين أن النماذج الحالية أرخص وأسرع بكثير من البشر، إلا أنها لا تزال تقصر عن تحقيق مستوى الجودة البشرية في إنجاز المهام.

Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu (…)2026-07-30
💬 NLP

APEX-Accounting

يُعد APEX-Accounting معياراً مرجعياً جديداً طورته كل من Mercor وRamp لتقييم النماذج الرائدة في مهام المحاسبة الواقعية، كاشفاً أن النماذج الحالية ذات الأداء العالي تحقق معدلات نجاح متواضعة وتُظهر مفارقة سيمبسون حيث ترتبط ميزانيات الرموز (tokens) المتزايدة بارتفاع الدرجات الإجمالية ولكن بأداء أقل في مهام محددة عالية التكلفة.

Julien Benchek, Austin Bennett, Jasmin Kern, Ryan Stevens, Rene Sultan, Charis Ching, Hayley Popiel, Vaibhav Mittal, Fel (…)2026-07-30