🤖 AI

Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking

تُثبت هذه الورقة أن طريقة تسجيل الطاقة القائمة على اللوجيت (logit)، والتي تستفيد من الثقة الجوهرية للنموذج اللغوي الكبير، تتفوق بشكل كبير على نهج "النموذج اللغوي الكبير كحكم" (LLM-as-judge) القائم على التلقين في ترتيب الفرضيات العلمية عبر تخصصات متعددة.

Swati Rajwal, Sanjay Das, Tirthankar Ghosal2026-08-19
🤖 AI

ASI-Bench: At the Dawn of Artificial Superintelligence

تقدم الورقة البحثية ASI-Bench، وهو معيار مرجعي شامل يتكون من 60 مهمة بحثية على مستوى المشاريع عبر 11 مجالاً علمياً، صُمم لتقييم قدرة الذكاء الاصطناوي على إجراء أبحاث علمية ذاتية وابتكارية من خلال التقليل التدريجي من التوجيه البشري، مما يكشف أن الأنظمة الحالية المتطورة لا تزال تعتمد بشكل كبير على المدخلات البشرية وهي بعيدة كل البعد عن تحقيق ذكاء اصطناعي فائق حقيقي.

Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao (…)2026-08-19
🤖 AI

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs

تُعد PlanPO طريقة مبتكرة لتحسين السياسات النسبية للمجموعات، حيث تُقدم إشارات ميزة من الخشن إلى الناعم للتمييز بين المسارات الناجحة بناءً على كفاءة التفاعل، مما يُمكّن النماذج اللغوية الكبيرة الوكيل ذات المهام متعددة الخطوات من تعلم سلوكيات تخطيط قابلة للتعميم والتفوق بشكل كبير على النماذج المرجعية الحالية في الاختبارات المعيارية الصعبة.

Dayang Liang, Liyuan He, Xuan Feng, Shuxin Li, Bo An, Yunlong Liu2026-08-19
🤖 AI

LiveHouse-TS: An Open-world Living Benchmark for Time Series Foundation Models

تقدم هذه الورقة LiveHouse-TS، وهو أول معيار حي مفتوح العالم يقيم نماذج التأسيس للسلاسل الزمنية من خلال الاختبار التتابعي المستمر على بيانات مستقبلية حقيقية، مما يكشف أن التصنيفات الثابتة غالبًا ما تفشل في عكس المتانة والأداء على المدى الطويل في ظل تغير توزيعات البيانات المتطورة.

Haomin Wen, Ziyu Zhou, Qingxiang Liu, Siru Zhong, Yuxuan Liang2026-08-19
🤖 AI

SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning

تبحث هذه الورقة في استراتيجيات الضبط الدقيق بالتعزيز، بما في ذلك GRPO وGSPO وGMPO، لتكييف نموذج Qwen2.5 بحجم 3B مع مسائل معالجة الإشارات بمستوى الدراسات العليا، مظهرةً أن الجمع بين الضبط الدقيق الخاضع للإشراف لسلسلة الأفكار المتخصصة في المجال وبين التعلم بالتعزيز يحقق تحسناً في الدقة بمقدار ثلاثة أضعاف مقارنة بالنموذج الأساسي.

Guozheng Sun2026-08-19
🤖 AI

NeuroAbs: A Neuro-Symbolic RTL Abstraction Framework for Property Checking Acceleration

تقدم هذه الورقة NeuroAbs، وهو إطار عمل عصبي-رمزي يستفيد من النماذج اللغوية الكبيرة (LLMs) لتحديد إشارات RTL والتمثيل الرمزي القائم على أشجار الإعراب المجردة (AST)، مدمجاً مع التحقق من السلامة القائم على حل المشكلات الموجه بالمنطق (SMT) وصقل آلية التحقق من الخطأ عبر التكرار (CEGAR)، وذلك لأتمتة تجريد RTL وتسريع عملية التحقق من خصائص الأجهزة بشكل كبير.

Zhiyuan Yan, Xiaofeng Zhou, Ziyue Zheng, Ziyi Yang, Wenbin Che, Wei Zhang, Yangdi Lyu, Hongce Zhang2026-08-19
🤖 AI

ORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human Feedback

تقدم هذه الورقة ORPA، وهو إطار عمل يعزز سياسات التحكم الروبوتية المسبقة التدريب عبر إضافة وحدة خفيفة الوزن مشروطة بالتغذية الراجعة للتنبؤ بتعديلات المتبقي في فضاء المفاصل في الوقت الفعلي، مما يتيح التصحيح الفوري للأخطاء والتكيف مع تغيرات التوزيع دون الحاجة إلى إعادة تدريب السياسة بالكامل.

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae2026-08-19
🤖 AI

LLMs for Medical Consultation Are Evaluated Too Late: The Preformulation Gap

تجادل هذه الورقة بأن تقييم النماذج اللغوية الكبيرة المخصصة للاستشارات الطبية يتم حالياً في مرحلة متأخرة جداً من العملية، حيث تُظهر أن التعليمات الصريحة يمكن أن تحسن التوثيق المنظم ولكنها تفشل في منع تقديم نصائح الرعاية الذاتية المبكرة بشكل موثوق أو ضمان استقاء الحقائق الجوهرية خلال مرحلة "ما قبل الصياغة" الأولية لشكوى مريض غامضة.

Yining Hua, Cyrus Ayubcha, Hongbin Na, Levi Lian, Alon Gorenshtein, Yiftach Barash, Eyal Klang2026-08-19
📊 statistics

SPACE: Sample-cloud Predictive Adaptive Conformal Ellipsoids for Multivariate Time-Series Forecasting

تقترح الورقة البحثية SPACE، وهو غلاف تطابقي (conformal wrapper) لمقدرات السلاسل الزمنية متعددة المتغيرات يقوم ببناء مناطق تنبؤ إهليلجية عبر تقدير التباين الموضعي للزمن من عينات التنبؤ الحالية واختيار نافذة معايرة ديناميكية، محققاً بذلك توازنات فائقة بين التغطية والكفاءة مقارنة بالطرق القائمة.

Baishi Li, Kelvin J. L. Koa, Ke-Wei Huang2026-08-19
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

تُعد TileMix نواةً مختلطة الدقة تعتمد على البلاطات (tiles) ولا تتطلب تدريباً، حيث تعمل على تسريع استنتاج النماذج اللغوية الكبيرة ذات السياق الطويل من خلال توجيه بلاطات درجات الانتباه المتوافقة مع الأجهزة ديناميكياً بين مساري FP16 وINT8 ضمن عملية انتباه كثيفة مدمجة، مما يؤدي إلى استعادة الدقة التي تفقدها طرق الدقة المنخفضة الموحدة مع تحسين معدل الإنتاجية.

Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng2026-08-19