🤖 AI

ReproAgent: Contract-Guided Paper-to-Code Reproduction

يُعد ReproAgent خط إنتاج مكونًا من أربع مراحل موجهًا بالعقود، يعمل على تعزيز عملية إعادة إنتاج الكود من الأوراق البحثية عبر الحفاظ على عقود تنفيذ مستمرة مع قنوات المتطلبات والأدلة لسد الفجوة بفعالية بين مواصفات الورقة الصريحة والاصطلاحات البرمجية الضمنية، محققًا بذلك أداءً رائدًا في معيار PaperBench Code-Dev.

Xue Hu, Zewei Pan, Zhongyuan Wang, Zhou Liu, Zeli Su, Wentao Zhang2026-08-26
🤖 AI

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

تقدم الورقة البحثية VideoHarness-RSI، وهو إطار عمل للتحسين الذاتي المتكرر يعمل على تحسين برامج بناء السياق القابلة للتنفيذ لفهم الفيديوهات الطويلة حول نموذج لغوي بصري مجمد، مما يثبت أن تحسين "الحزام" (harness) وحده يحقق مكاسب كبيرة في الأداء وينتقل بفعالية عبر المعايير المرجعية.

Guoyang Xu, Hao Chen2026-08-26
🤖 AI

OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning

يُعد OPDSearch+ إطار عمل جديداً ذا مرحلتين يُمكّن النماذج اللغوية الصغيرة من التفوق في الاستدلال المعزز بالبحث، وذلك عبر استخلاص المهارات أولاً من معلم جاهز ومجمد من خلال التعلم أثناء السياسة، ثم صقل الطالب باستخدام التعلم التعزيزي، مما يؤدي إلى التغلب على تكاليف جمع البيانات وسقوف الأداء التي واجهتها الطرق السابقة.

Qinglin Ye, Zhiyuan Gu, Jingjie Xia, Yiheng Zhang, Kaiyan Zhao, Shunchao Zheng, Yuhang Mu, Wenchao Du, Yiming Wang2026-08-26
🤖 AI

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

تتقصى هذه الورقة موثوقية ومعايرة الحكام القائمين على النماذج اللغوية الكبيرة (GPT-4.1 وGPT-5) لتقييم الوكلاء الصوتيين مقابل المعايير البشرية، مبرهنةً على أنه في حين أن التقييم الآلي فعال للمهام القابلة للتوسع والمحددة بمقاييس معينة، فإن دقته تعتمد بشكل كبير على تهيئة التقييم والمقاييس المحددة، مما يدعم نهجاً هجيناً يجمع بين النماذج اللغوية الكبيرة من أجل التوسع وبين الإشراف البشري للأحكام الحساسة للسياق.

Anupam Purwar, Shashank Singh, Kritika Srivastava2026-08-26
⚡ electrical engineering

Can a Dynamic Internal Field Govern a Transformer's Cognition? Certifiability, not Superiority, in Homeostatic Compute Control

تُثبت هذه الورقة أنه في حين أن المجال الداخلي الديناميكي المحكوم بمعادلات تفاضلية جزئية لا يعزز بطبيعته القدرات الإدراكية للمحول، إلا أنه يعمل كآلية قابلة للتطبيق وفريدة من نوعها وقابلة للتحقق لضبط موارد الحوسبة من خلال فحوصات دقيقة لاستقرار وقت التشغيل.

Francisco M. Arrabal-Campos, Ignacio Fernandez, Francisco G. Montoya, Alfredo Alcayde2026-08-26
💬 NLP

FARCA: Fact-Aligned Reliability-Aware Credit Assignment for Reinforcement Learning with Factual Supervision

إنَّ FARCA هو إطار عمل لتحسين السياسات يعمل على التخفيف من الهلوسة في التعلم التعزيزي باستخدام الإشراف الواقعي، وذلك عبر تفكيك تعيين الائتمان الضوضائي إلى غموض في التحديد وغموض في الموثوقية، مما يولد إشارات تدريبية دقيقة المستوى وموزونة بالموثوقية تعمل على تحسين واقعية النموذج دون المساس بقدرات الاستدلال العام.

Qiming Xie, Wenjie Zheng, Xiangqing Shen, Rui Xia2026-08-26
🤖 AI

Markerless Pose Estimation for Resistance Training Technique Assessment

تقدم هذه الورقة إطار عمل لتقدير الوضعية بدون علامات باستخدام BlazePose لتقييم تقنيات تدريبات المقاومة، مثل القرفصاء والرفعة المميتة، كمياً من خلال مقارنة مسارات زوايا المفاصل مقابل مرجع، مما يثبت إمكاناته للتحليل الميكانيكي الحيوي الميسر رغم القيود المتعلقة باتجاه الكاميرا والانسداد البصري.

Joseph Turner, Jeff Clark, Nawid Keshtmand2026-08-26
🤖 machine learning

Equivariant Covariance Tensors: Guaranteed SPD Uncertainty for Tensor-Valued Geometric Learning

تقدم هذه الورقة إطار عمل متماثل مع مجموعة E(3) للتعلم الهندسي ذي القيم الموترة، والذي يضمن تقديرات عدم يقين موجبة محددة ومتماثلة من خلال تفكيك التباين إلى تمثيلات غير قابلة للاختزال، واستخدام الأس المجمّع للمصفوفات لضمان الاتساق في المتشعب، وتوظيف هدف تسجيل لوغاريتمي-إقليدي للتحسين القوي.

Ruihan Liu, Yu Ji, Jianbo Yu, Shifu Yan, Qingchao Jiang2026-08-26
🤖 AI

A Judge Should Know What Changed:Construct Validity for LLM-as-a-Judge Evaluation

تقدم هذه الورقة إطاراً ثنائي الأبعاد لصلاحية البناء يتألف من الثبات والحساسية لإثبات أن تقييمات "النموذج اللغوي الكبير كحكم" الحالية غالباً ما تُظهر توافقاً عالياً مع حساسية منخفضة تجاه التغييرات الجوهرية في المحتوى، مما يكشف أن الموثوقية العالية لا تضمن التقييم الصالح للبناء الأساسي.

Jianlin Chen, Wenhui Chen, Ziyao Lin, Chi Man Vong2026-08-26
🤖 AI

Partial Identification under Causal Orders by Linear Programming

تقترح هذه الورقة إطار عمل للبرمجة الخطية للتعريف الجزئي لاستعلامات التوقعات المضادة والاستعلامات المتداخلة من التوقعات المضادة عبر الاستفادة من الترتيبات الهيكلية المتأصلة في الاستعلامات نفسها، مما يلغي الحاجة إلى رسم بياني سببي محدد بالكامل مع توفير حدود وثيقة ومتوافقة مع البيانات.

Eric Rossetto, Alessandro Antonucci2026-08-26