💻 computer science

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

تقدم AutoDesign إطار عمل لتحسين الحزام الميتا (meta-harness) يُمكّن وكيل البرمجة من تحسين قدراته التصميمية بشكل تكراري من خلال التغذية الراجعة طويلة الأمد، محققاً أداءً هو الأفضل في فئته في تحويل الأوراق الأكاديمية إلى ملصقات، ومتفوقاً بذلك على الأنظمة التجارية مثل Claude Design.

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao (…)2026-08-14
💬 NLP

ReXrank: A Public Leaderboard for AI-Powered Radiology Report Generation

تقدم الورقة البحثية ReXrank، وهو لوحة متصدر عامة وإطار تقييم معياري يتميز بمجموعة بيانات ReXGradient واسعة النطاق ومقاييس متعددة لتقييم ومقارنة نماذج الذكاء الاصطناعي موضوعياً لتوليد تقارير الأشعة السينية للصدر بشكل آلي.

Xiaoman Zhang, Hong-Yu Zhou, Xiaoli Yang, Oishi Banerjee, Julián N. Acosta, Mohammed Baharoon, Josh Miller, Ouwen Huang (…)2026-08-13
💬 NLP

Explainability in Practice: A Survey of Explainable NLP Across Various Domains

تقدم هذه الدراسة مراجعة شاملة لمعالجة اللغات الطبيعية القابلة للتفسير (XNLP) عبر سبعة مجالات حيوية، حيث تحلل المتطلبات الخاصة بكل مجال، وتقارن بين أساليب التفسير، وتقترح بروتوكول تقييم ثنائي المستويات لسد الفجوة بين المقاييس التقنية والقابلية للتطبيق في العالم الحقيقي.

Hadi Mohammadi, Robert A. Bagheri, Anastasia Giachanou, Daniel L. Oberski2026-08-13
💬 NLP

SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives

تقدم الورقة البحثية SteeringSafety، وهو معيار شامل لتقييم طرق توجيه التمثيلات عبر تسعة منظورات للسلامة و18 مجموعة بيانات، كاشفةً أنه في حين يمكن للتوجيه أن يستهدف سلوكيات محددة بفعالية، فإنه غالباً ما يتسبب في تدهور غير مقصود كبير في أبعاد سلامة أخرى مثل السلوك الاجتماعي والحكم المعياري بسبب التشابك الجوهري.

Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang2026-08-13
💬 NLP

Dialect Matters: Cross-Lingual ASR Transfer for Low-Resource Indic Language Varieties

تثبت هذه الورقة تجريبيًا أنه بالنسبة للهجات الهندية منخفضة الموارد، فإن الضبط الدقيق باستخدام كميات صغيرة من البيانات الخاصة باللهجة غالبًا ما يؤدي إلى أداء في التعرف التلقائي على الكلام يضاهي استخدام مجموعات بيانات أكبر من لغات عالية الموارد ذات صلة تطورية، مما يتحدى الافتراض بأن التقارب اللغوي وحده هو ما يحدد نجاح النقل.

Akriti Dhasmana, Aarohi Srivastava, David Chiang2026-08-13
💬 NLP

Superposition Without Interference? Towards Isolated Interventions via Almost Orthogonal Features in Language Models

تقترح هذه الورقة تقييد الميزات الداخلية في النماذج اللغوية لتكون متعامدة تقريبًا بناءً على مبدأ الآليات السببية المستقلة، مما يوضح أن تنظيم التعامد هذا يقلل من تداخل الميزات لتمكين تدخلات سببية أكثر عزلاً وموثوقية على مفاهيم مثل الاستدلال الرياضي دون المساس بأداء النموذج العام.

Moritz Miller, Florent Draye, Bernhard Schölkopf2026-08-13
💬 NLP

Investigating Learner-Aware Design of LLM-Generated Educational Feedback

تُثبت هذه الدراسة تجريبياً أنه في حين أن التغذية الراجعة الواضحة والشاملة المولدة بواسطة النماذج اللغوية الكبيرة تُحسن عالمياً أداء طلاب المدارس الثانوية في المراجعة، فإن التصميم الأمثل فيما يتعلق بالجدة المعلوماتية والتأطير العاطفي يتباين بشكل كبير عبر ملفات المتعلمين المختلفة، مما يسلط الضوء على الحاجة إلى استراتيجيات تغذية راجعة تراعي خصائص المتعلم.

Momoka Furuhashi, Kouta Nakayama, Noboru Kawai, Takashi Kodama, Saku Sugawara, Kyosuke Takami2026-08-13
💬 NLP

LLM-Powered Automatic Translation and Urgency in Crisis Scenarios

تقيم هذه الورقة أداء النماذج اللغوية الكبيرة وأنظمة الترجمة الآلية في سيناريوهات الأزمات، كاشفةً عن تدهور كبير في الجودة في اللغات ذات الموارد المنخفضة وعدم اتساق حرج في تصنيف الاستعجال القائم على النماذج اللغوية الكبيرة عبر اللغات المختلفة، مما يشكل مخاطر على فعالية فرز الأزمات.

Belu Ticona, Antonis Anastasopoulos2026-08-13
💬 NLP

RedditPersona: A Modular Framework for Community-Conditioned LLM Adaptation from Reddit

تقدم الورقة البحثية RedditPersona، وهو إطار عمل معياري يوحد عمليات جمع البيانات، وتوصيف المستخدمين، والتقييم من أجل تكييف النماذج اللغوية الكبيرة مع المجتمعات المشروطة، حيث أثبتت من خلال تجارب على 112 من مجتمعات "ريديت" (subreddits) المتعلقة بالرفاهية الحضرية أن قابلية تحديد الهوية السلوكية تتوافق مع الاتفاق بين الاستراتيجية والمجتمع، بينما تكشف عن مقايضة ثابتة بين قابلية تحديد الهوية والتشابه التوزيعي للنصوص.

Amirhossein Ghaffari, Ali Goodarzi, Huong Nguyen, Simo Hosio, Lauri Lovén, Ekaterina Gilman2026-08-13
🤖 AI

From Monolithic to Modular: Segment-level Automatic Prompt Optimization

تقدم هذه الورقة SAPO، وهي طريقة تحسين تلقائي للمطالبات على مستوى القطع تعمل على تفكيك المطالبات إلى مكونات متميزة لاستهداف نقاط ضعف محددة، وتتفوق على النهج الموحدة الحالية عبر مختلف المعايير.

Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova2026-08-13