🤖 AI

A survey detection channel overrides the pixels in an astronomical foundation model, and biases tomographic mean redshifts

تُثبت هذه الورقة أن النماذج التأسيسية لعلم الفلك، مثل AION-1، ترث تحيزات منهجية من قنوات الكشف غير المكتملة للمسوحات، مما يجعلها تعطي الأولوية لأقنعة التجزئة على بيانات الصور الفعلية وتتسبب في تشويه كبير في القياسات الضوئية وقياسات الانزياح نحو الأحمر، لا سيما في التحليلات التوموجرافية.

Ihor Kendiukhov2026-08-26
🤖 AI

TRACE: Transition-Aware Residual Control for Multi-Objective Materials Discovery

تقدم الورقة البحثية إطار TRACE، وهو إطار تحكم متبقي مدرك للانتقالات يعزز اكتشاف المواد متعدد الأهداف بواسطة وكلاء النماذج اللغوية الكبيرة (LLM) من خلال تتبع انتقالات محددة بين التعديل والخاصية لتحقيق توازن أفضل بين الأهداف المتنافسة، مما يؤدي إلى تحسين معدلات النجاح بشكل كبير مقارنة بالنماذج المرجعية الحالية.

Kang Zhou, Yujia Tong, Yong Tao, Jingling Yuan2026-08-26
🤖 AI

Function-Level Execution Feedback for Code Preference Optimization

تقدم الورقة البحثية إطار عمل STEP-KTODER، وهو إطار لتحسين تفضيل الكود البرمجي يعرّف الخطوات كدوال على مستوى الوحدة (module-level) مع تسميات صحة ثنائية مستمدة من اختبارات الوحدة، مما يثبت أن عملية الإشراف القائمة على التنفيذ هذه تتفوق بشكل كبير على الأساليب القائمة على النتيجة فقط، مع تجنب فساد التسميات الناتج عن تعليقات النماذج اللغوية الكبيرة المستخدمة كحكم.

Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee2026-08-26
🤖 AI

Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes

تقدم هذه الورقة أول تدقيق كمي على مستوى المشهد لسيرة ذاتية من إنتاج النماذج اللغوية الكبيرة مقابل سجل حقيقي، كاشفةً عن معدل فشل في التحقق بنسبة 96.7% يهيمن عليه "الانجراف المرتكز" (مشاهد مخترعة تستخدم أشخاصاً وأماكن حقيقيين)، ومثبتةً أنه بينما يؤدي ترسيخ التوليد في المتن الفعلي للموضوع إلى تحسين الدقة، إلا أن الهلوسة الجوهرية لا تزال قائمة.

Heather Renze2026-08-26✓ Author reviewed
🤖 AI

How much of a measured AI preference is the model, and how much is the instrument?

تُظهر هذه الدراسة أن الأداة المحددة المستخدمة لاستقاء تفضيلات الذكاء الاصطناعي هي مصدر مهيمن للتباين، مما يعني أن التفضيل الذي يتم قياسه بواسطة صيغة مطالبة واحدة لا يوفر معلومات موثوقة تذكر حول كيفية إبلاغ أداة مختلفة عن موقف النموذج نفسه تجاه نتائج الرفاهية.

Jason Hung2026-08-26
🤖 AI

AI Agents Push Humans Out of the Loop

تجادل هذه الورقة الموقعة بأن التصميمات الحالية لوكلاء الذكاء الاصطناعي تقوض الإشراف البشري الفعال من خلال إعاقته وتدهور المهارات المعرفية اللازمة، وتحث المطورين على إعطاء الأولوية للاحتياجات المعرفية للمشرفين البشريين من خلال إمكانيات تصميمية محددة وبروتوكولات تنظيمية لمنع ضمور المهارات.

Margaret Mitchell, Avijit Ghosh, Samir Passi2026-08-26
🤖 AI

MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models

تقدم الورقة البحثية MolEmb، وهو إطار عمل خفيف الوزن يعمل على تكييف النماذج اللغوية الكبيرة متعددة الوسائط لتعمل كنماذج تضمين جزيئي عامة ومدركة للسياق، مما يثبت قابليتها للتطبيق في التنبؤ بالخصائص والاسترجاع عبر الوسائط من خلال محاذاة تباينية ثنائية الاتجاه بين الملامح الجزيئية والأوصاف النصية.

Xinjian Zhao, Xiangru Jian, Yaoyao Xu, Xiaozhuang Song, Wei Pang, Lei Bai, Tianshu Yu2026-08-26
💻 computer science

Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail

تكشف هذه الورقة أن وكلاء نماذج اللغة الصغيرة هم أكثر عرضة بشكل كبير لتكرار استدعاءات الأدوات الفاشلة عندما يتم تسجيل الفشل حرفياً في السجل، وهو تأثير عكسي للنتائج مدفوع أساساً بالشكل السطحي للإجراء الفاشل بدلاً من رسالة الخطأ، وهو ما يمكن التخفيف منه بفعالية عن طريق استبدال الاستدعاء الخام بوصف ناتج عن وقت التشغيل للفشل.

Esmail Gumaan2026-08-26
💻 computer science

Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling

تقدم هذه الورقة البحثية Pufibara، وهو نظام تحكم للوكيل (agent harness) مصمم للحفاظ على حالة هندسية مستمرة وربط أدلة المحاكاة بمرشحين محددين لنمذجة الأنظمة الفيزيائية في Modelica، مما يظهر معدلات نجاح أعلى في المهام واستهلاكاً أقل بكثير للموارد مقارنة بـ Claude Code عبر معيار مرجعي جديد يتكون من 232 مهمة.

Zizhe Wang2026-08-26
💻 computer science

Elastic KV Cache for LLM Serving:A Working Reclamation Mechanism, and Why Chunked Prefill Already Closes the Gap

تقدم هذه الورقة وتقيم آلية مرنة لذاكرة التخزين المؤقت للمفاتيح والقيم (KV cache) تعمل على استعادة الذاكرة المحجوزة ديناميكياً خلال مراحل فك التشفير دون تعديلات في برامج التشغيل، لتخلص في النهاية إلى أن هذا النهج يقدم مكاسب طفيفة في الأداء مقارنة باستراتيجيات التعبئة المسبقة المجزأة الحالية لأن زمن انتقال التعبئة المسبقة غير حساس إلى حد كبير لحجم الجزء، ولأن الاحتياطي الذاكر يتضاءل طبيعياً في ظل التوازي التنسوري.

Sathishkumar Sivashanmugam2026-08-26