🤖 AI

Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

تقدم هذه الورقة "سيتوكا" (Setoka)، وهو معيار مرجعي مبتكر يستند إلى علم النفس المعرفي والشخصي لتقييم قدرة الوكلاء المخصصين على إجراء فهم هرمي للمستخدم — من الذاكرة الدلالية والمنعكسة إلى أنماط السلوك والسمات الشخصية — عبر بيانات غير متجانسة، كاشفةً عن أن الأنظمة الحالية تعاني بشكل كبير في المهام التي تتطلب دمج وتجريد المعلومات طويلة الأمد المجزأة بما يتجاوز مجرد استرجاع الحقائق البسيطة.

Lingyang Zeng, Guangze Chen, Kaichen Yu, Zhicheng Pan, Siyang Weng, Zirui Hu, Xiangyun Du, Hailin He, Rong Zhang, Chengc (…)2026-07-30
🤖 AI

Visual Credit Audit for Multimodal Spatial Reasoning

تقدم هذه الورقة البحثية تدقيق الائتمان البصري (VCA)، وهو إطار عمل خالٍ من التدريب والملصقات، يعمل على تفكيك أداء الاستدلال المكاني متعدد الوسائط إلى الصحة، والدعم البصري، والاستجابة الخاصة بالعلاقة، مما يكشف أن جزءاً كبيياً من الإجابات الصحيحة في الاختبارات المعيارية هي في الواقع غير معتمدة على الدليل البصري.

Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng2026-07-30
🤖 AI

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

تقدم هذه الورقة البحثية "التقطير القائم على التوجيه في السياسة الموحدة" (ROPD)، وهو إطار عمل مبتكر يعزز سلامة النماذج اللغوية الكبيرة من خلال نمذجة تباعد توزيع المخرجات بدلاً من قوالب المطالبات المحددة، مما يحقق دفاعاً قوياً ضد عدم تطابق القوالب وإعادة كسر الحماية مع الحفاظ على المهارات المتخصصة.

Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen2026-07-30
🤖 AI

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

تقدم هذه الورقة SciFigQual-Bench، وهو معيار مرجعي سياقي جديد للنصوص الكاملة لتقييم جودة الأشكال العلمية يقيم الصور عبر خمسة أبعاد باستخدام بيانات مشروحة من قبل خبراء من أفضل مؤتمرات علوم الحاسوب، إلى جانب إطار عمل SFQ-Agent الذي يحقق أداءً رائدًا في التقييم الآلي.

Zihan Deng, Chuanzhi Xu, Huiqi Liang, Haoyang Li, Xiaozhen Zhong, Lequan Yu2026-07-30
🤖 AI

Linguistic Monoculture in LLM-Assisted Language Use

تطور هذه الورقة إطاراً رياضياً يوضح أنه في حين يمكن للكتابة بمساعدة النماذج اللغوية الكبيرة أن تعزز الوضوح، فإن الاعتماد الواسع على النماذج المشتركة ينطوي على مخاطر خلق "أحادية ثقافية لغوية" من خلال تقليل التنوع اللغوي على مستوى السكان، وهي مشكلة يمكن التخفيف من حدتها من خلال النماذج الشخصية والموازنات الاستراتيجية بين الامتثال والتميز.

Suhas Thejaswi, Juhi Kulshreshta, Lutz Oettershagen2026-07-30
🤖 machine learning

Cost-Sensitive Conformal Prediction and Human-in-the-Loop Abstention for Imbalanced High-Stakes Decision Support: A Multi-Domain Benchmark

تقدم هذه الورقة معياراً شاملاً متعدد المجالات يثبت أن الجمع بين التنبؤ التوافقي المشروط بالفئة (Mondrian) والامتناع المتحكم في التكلفة يحل بفعالية مشكلة نقص التغطية الشديد للفئات الأقلية النادرة ويقلل من تكاليف القرار المتوقعة في أنظمة دعم القرار عالية المخاطر وغير المتوازنة.

Manpreet Singh, Akshatha Srikantha, Shyamal Lakhanpal2026-07-30
🤖 AI

Anatomy Contextualized Adaption of CT Foundation Models

تقدم الورقة البحثية إطار عمل "التكيف السياقي التشريحي" (ACA)، وهو إطار عمل خفيف الوزن يعمل على تكييف نماذج التأسيس المعتمدة على التصوير المقطعي المحوسب (CT) المجمدة بكفاءة لتحقيق محاذاة بين الرؤية واللغة على مستوى التشريح مع الحفاظ على السياق العالمي، متفوقاً بذلك على الأساليب الحالية في مهام التعلم الصفري بأقل وقت تدريب ممكن.

Roshan Kenia, Stephanie L McNamara, William Lotter2026-07-30
🤖 AI

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

تقدم هذه الورقة OmegaUse-OfficeVal، وهو معيار مرجعي جديد يتكون من 100 مهمة من مهام حزمة المكتب طويلة الأمد ذات أسس اقتصادية (وقت العمل البشري وسعر المهمة) لتقييم وكلاء النماذج اللغوية الكبيرة، كاشفةً أنه في حين أن النماذج الحالية أرخص وأسرع بكثير من البشر، إلا أنها لا تزال تقصر عن تحقيق مستوى الجودة البشرية في إنجاز المهام.

Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu (…)2026-07-30
🤖 AI

Partner Capability Estimation for Task-Agnostic Adaptation in Ad-Hoc Teamwork

تقدم هذه الورقة البحثية نموذج CE-CM وامتداده القائم على التنوع CE-CM-Div، وهو إطار عمل بايزي تقريبي يمكّن الوكلاء المستقلين من تقدير قدرات الشريك الخفية والثابتة للمهمة بسرعة وتكييف تخطيطهم المشترك في سيناريوهات العمل الجماعي المرتجل دون الحاجة إلى تدريب مسبق أو معرفة سابقة بالمهمة.

Peter Tisnikar, Maja Swieczkowska, Benteng Ma, Gerard Canal, Matteo Leonetti2026-07-30
💬 NLP

APEX-Accounting

يُعد APEX-Accounting معياراً مرجعياً جديداً طورته كل من Mercor وRamp لتقييم النماذج الرائدة في مهام المحاسبة الواقعية، كاشفاً أن النماذج الحالية ذات الأداء العالي تحقق معدلات نجاح متواضعة وتُظهر مفارقة سيمبسون حيث ترتبط ميزانيات الرموز (tokens) المتزايدة بارتفاع الدرجات الإجمالية ولكن بأداء أقل في مهام محددة عالية التكلفة.

Julien Benchek, Austin Bennett, Jasmin Kern, Ryan Stevens, Rene Sultan, Charis Ching, Hayley Popiel, Vaibhav Mittal, Fel (…)2026-07-30