🤖 AI

Anchor: Mitigating Artifact Drift in Agent Benchmark Generation

تقدم هذه الورقة "Anchor"، وهو مسار لتوليد المهام يعمل على الحد من انحراف النواتج (artifact drift) عبر صياغة تدفقات العمل التجارية في برامج تحسين القيود لإنتاج بيئات تقييم قابلة للتدقيق والتحقق والتوسع، وهو ما تم إثباته من خلال إصدار "ERP-Bench"، وهو معيار يتكون من 300 مهمة طويلة المدى في نظام تخطيط موارد المؤسسات (ERP) بمستوى إنتاجي.

Maksim Ivanov, Abhijay Rana2026-05-27
🤖 AI

OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling

تقدم الورقة البحثية OmniToM، وهو معيار جديد يقيم قدرات "نظرية العقل" لدى النماذج اللغوية الكبيرة من خلال اشتراطه نمذجة صريحة ومتعددة الأبعاد لهياكل معتقدات الفاعلين بدلاً من الاعتماد فقط على أداء الإجابة على الأسئلة النهائية، مما يكشف أن النماذج الحالية تعاني في الاستدلال المحدد المطلوب لتحويل الحقائق السردية إلى تمثيلات دقيقة للحالات الذهنية.

Adam Bawatneh, Sagar Sapkota, Amrit Singh Bedi, Santu Karmaker, Mubarak Shah2026-05-27
🤖 AI

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

تقدم هذه الورقة البحثية BEAP، وهو هجوم تحفيز عدائي يعتمد على التضمين (embedding-aware) ويعمل كصندوق أسود، يستغل نموذجاً لغوياً كبيراً لتوليد مطالبات عالية الجودة وغير قابلة للكشف بشكل تكراري، مما ينجح في تجاوز دفاعات "إلغاء التعلم" (machine unlearning) في نماذج الانتشار من نص إلى صورة بمعدلات نجاح أعلى بكثير من الطرق السابقة.

Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban2026-05-27
🤖 AI

ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

تقدم الورقة البحثية "ScientistOne"، وهو نظام بحثي ذاتي التشغيل مبني على إطار عمل "سلسلة الأدلة" (Chain-of-Evidence) الذي يضمن القابلية للتحقق من خلال البناء، مما يلغي الاستشهادات المهلوسة ويحقق درجة تحقق مثالية ومواءمة فائقة بين المنهجية والبرمجية، مع مضاهاة أو تجاوز أداء الخبراء البشريين عبر مهام بحثية رائدة متنوعة.

Rui Meng, Bhavana Dalvi Mishra, Jiefeng Chen, Chun-Liang Li, Palash Goyal, Mihir Parmar, Yiwen Song, Yale Song, Rajarish (…)2026-05-27
🤖 machine learning

When Correct Demonstrations Hurt: Rethinking the Role of Exemplars in In-Context Learning

تتحدى هذه الورقة البحثية الافتراض القائل بأن الأمثلة التوضيحية الصحيحة تساعد دائمًا في التعلم داخل السياق، وذلك من خلال الكشف عن أن الاضطرابات التي تحافظ على طبيعة المهمة يمكن أن تؤدي إلى تدهور الأداء عبر "انزياح الدليل السياقي"، مما يثبت أن فائدة الأمثلة النموذجية تعتمد على كيفية تأثير هذه الأمثلة في الاستدلال السياقي بدلاً من مجرد صحتها.

Chenghao Qiu, Chunli Peng, Yufeng Yang, Kuan-Hao Huang, Yi Zhou2026-05-27
🤖 AI

Personalized Generative Models for Contextual Debiasing

تقدم هذه الورقة DecoupleGen، وهي طريقة تعمل على تخصيص نماذج الانتشار من النص إلى الصورة لتوليد صور ذات دلالات معنوية ذات أنماط سياقية نادرة لأغراض تعزيز التدريب، مما يقلل من انحياز مجموعة البيانات ويحسن التعرف على الأشياء في السيناريوهات غير الشائعة.

Xinran Liang, Esin Tureci, Prachi Sinha, Ye Zhu, Vikram V. Ramaswamy, Olga Russakovsky2026-05-27
🤖 AI

Automatic Layer Selection for Hallucination Detection

تتناول هذه الورقة تحدي الاختيار التلقائي للطبقات المتوسطة المثلى للكشف عن الهلوسة في النماذج اللغوية الكبيرة من خلال تقديم معيار "الذروة الفعالة الأولى للبعد الجوهري" (FEPoID) الخالي من التدريب، والذي يتفوق باستمرار على الأساليب الحالية ويتم تعزيزه بشكل أكبر من خلال استراتيجية بتر مبتكرة لتضخيم إشارات الكشف.

Xinpeng Wang, William Cao, Andrew Gordon Wilson, Zhe Zeng2026-05-27
🤖 AI

Unified Panoramic Geometry Estimation via Multi-View Foundation Models

تقدم هذه الورقة البحثية PaGeR، وهو إطار عمل موحد يعمل على تكييف النماذج التأسيسية ثلاثية الأبعاد القائمة على المنظور والمُدربة مسبقاً لتقدير العمق غير المعتمد على المقياس، والعمق المتري، والنواظم السطحية، وأقنعة السماء في آن واحد من كل من الصور المنظورية والبانورامية، محققاً أداءً هو الأفضل في فئته وأداءً صفري القدرة في إعادة بناء المشاهد بزاوية 360 درجة.

Vukasin Bozic, Isidora Slavkovic, Dominik Narnhofer, Nando Metzger, Denis Rozumny, Konrad Schindler, Nikolai Kalischek2026-05-27
🤖 AI

Exploiting Local Dynamics Regularity for Reusable Skills in Offline Hierarchical RL

تقدم هذه الورقة البحثية خوارزمية CARL، وهي خوارزمية تعلم تعزيزي هرمي تستغل انتظام الديناميكيات المحلية لمواءمة السياقات العالمية مع تسلسلات الأفعال المطلوبة، مما يؤدي إلى تعلم مهارات قابلة لإعادة الاستخدام تُحسن الأداء في المهام اللاحقة المعقدة.

Sarthak Dayal, Abhinav Peri, Carl Qi, Claas Voelcker, Alexander Levine, Caleb Chuck, Amy Zhang2026-05-27
🤖 AI

VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

تقدم الورقة البحثية VisualNeedle، وهو معيار اختبار تحدي للمشاهد كثيفة المعلومات يكشف عن قصور كبير في قدرات البحث البصري دقيق التفاصيل لدى النماذج اللغوية الكبيرة متعددة الوسائط الحالية، وتثبت، من خلال تجربة استئصال "القص-الأسود" (crop-black) المبتكرة، أن نجاحها يعتمد على أدلة بصرية وسيطة حقيقية بدلاً من الأولويات اللغوية أو الدلالات العامة.

Jingru Chen, Yiming Liu, Mingtao Chen, Sijie Chen, Richeng Xuan, Liang Yang, Zhichao Hu, Fanyang Lu2026-05-27