🤖 AI

Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form

تتحدى هذه الورقة فرضية "بوابة القبول" للوصول إلى المتغيرات الكامنة في النماذج اللغوية، مبرهنةً بدلاً من ذلك على أن آليات الانتباه القائمة على الطلب تجمع المعلومات ضمن نافذة محددة في العمق المتوسط لجعل المتغيرات قابلة للتقرير لفظياً، وهي عملية تختلف عن المنفعة الفعلية للمتغير بالنسبة للإجابة النهائية.

Parsa Mazaheri2026-08-18
💻 computer science

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

يُعد Handoff-H1 نظام وكيل رؤية مُنسق يدمج نماذج رؤية حاسوبية متخصصة، ووكلاء مستخدمين للأدوات، وقاعدة معرفية إنشائية لتحقيق استخراج متطور لحجم كميات المواد من المخططات المعمارية الخام، متفوقاً بذلك على كل من النماذج الذكية الرائدة والمقدرين المهنيين المستقلين من حيث التغطية والدقة.

Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla2026-08-18
🤖 AI

TAHB: A Comprehensive Benchmark for Text-Attributed Hypergraph Learning

تقدم هذه الورقة البحثية TAHB، وهو أول معيار مرجعي عام يدمج هياكل الهايبرغراف (الرسم البياني الفائق) مع السمات النصية الخام عبر أربعة مجالات واقعية، لتسهيل وتقييم التقاطع بين تعلم الهايبرغراف والنماذج اللغوية.

David Yoon Suk Kang, JungHyun Kim, Juhyun Jeon, Sang-Wook Kim2026-08-18
🤖 AI

LongDocBench: Benchmarking TOC Hierarchy and Contextual Relationship Recovery in Long Documents

تقدم هذه الورقة LongDocBench، وهو معيار مرجعي جديد يضم 85 وثيقة واقعية طويلة مع تعليقات توضيحية تم التحقق منها بشرياً لتسلسل جدول المحتويات واستعادة العلاقات السياقية، وذلك لمعالجة أوجه القصور في المعايير المرجعية الحالية في تقييم بنية الوثائق على مستوى المستند ولإثبات أن استعادة هذه البنى يحسن بشكل كبير أداء الإجابة على الأسئلة المتعلقة بالوثائق الطويلة.

Yuefeng Zou, Yichen Lu, Jingxiao Yang, Bingtao Fu, Gaoyang Zhang, Xiongfei Bai, Tian Chen, Xiang Qi2026-08-18
🤖 AI

Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning

تقدم الورقة البحثية "قمع الأفكار" (Funnel of Thoughts - FoT)، وهي طريقة استنتاج لا تتطلب تدريباً تقلل بشكل كبير من التكاليف الحسابية وزمن الاستجابة لنماذج الاستدلال الكبيرة عبر تقليم مسارات الاستدلال غير المثمرة مبكراً بناءً على علامات التردد اللفظي، مع الحفاظ على دقة التصويت الكامل متعدد العينات.

Chanhee Park, Sungbin Han, Jeongho Yoon, Seongtae Hong, Heuiseok Lim2026-08-18
🤖 AI

Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents

يقدم Evo-Harness إطار عمل لوكيل ذاتي التطور يعالج تحدي التعلم من التفاعلات الصاخبة وذات المحاولة الواحدة في المهام الواقعية الجديدة عبر توظيف تجميع المهارات من السياق إلى "الحزام" (harness) لتقطير التجارب إلى أحزمة مهارات مهيكلة وقابلة لإعادة الاستخدام من أجل تحسين مستمر عبر المجالات المختلفة.

Tianxin Wei, Zhan Shi, Minhua Lin, Bing He, Zewen Liu, Yisi Sang, Yuanchen Bei, Xuying Ning, Jiaru Zou, Ting-Wei Li, Xia (…)2026-08-18
🤖 AI

Beyond Thresholds: A Quality-Aware Decision Intelligence Framework for Cold Chain IoT Systems

تقدم هذه الورقة إطار عمل ذكاء القرار المدرك للجودة (QADI)، الذي يدمج تمثيل حالة الجودة المهيكل، والنمذجة الهجينة بين الفيزياء والبيانات، والاستنتاج القائم على النماذج اللغوية الكبيرة (LLM) لتحويل أنظمة إنترنت الأشياء لسلسلة التبريد من مجرد مراقبات تفاعلية إلى وكلاء اتخاذ قرار استباقيين يقللون بشكل كبير من أخطاء تقدير مدة الصلاحية ومعدلات التلف مقارنة بالنماذج المرجعية التقليدية.

Aashna Sofat, Balwinder Sodhi2026-08-18
🤖 machine learning

GATTA: Graph Active Learning with Test-Time Augmentation

تقدم الورقة البحثية GATTA، وهو إطار عمل للتعلم النشط على الرسوم البيانية يستفيد من تعزيز وقت الاختبار مع التصفية القائمة على الاتساق لتوليد تقديرات موثوقة لعدم اليقين، مما يثبت أن هذا النهج يعزز بشكل كبير استراتيجيات الاستحواذ البسيطة ليتفوق على طرق التجميع المعقدة مع تكلفة حوسبية أقل.

Zsombor Bánfi, András Gézsi, András Formanek2026-08-18
🤖 AI

Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning

تقدم هذه الورقة البحثية طريقة "Max-Q Selective Imitation"، وهي طريقة تعلم تعزيزي عبر الإنترنت تعتمد على تدخل بشري في الحلقة، تجمع بين نقاد "MC Q-chunk" وتحديث ممثل (actor) يعتمد مبدأ "الفائز يستحوذ على الكل" (winner-take-all) بشكل صارم لدمج التدخلات البشرية بسرعة مع تسريع التحسين الذاتي المستقل، مما يحقق تقارباً أسرع بكثير ومعدلات نجاح أعلى في المهام الروبوتية الواقعية والمحاكية مقارنة بالنماذج المرجعية الحالية.

Zihang Wang, Yishan Wang2026-08-18
🤖 AI

StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

تقدم الورقة البحثية StateM، وهو بيئة تشغيل أصلية للوكلاء تستفيد من توسيع نطاق الهيكل (harness scaling) عبر حالات مستدامة، وانتقالات مُحققة، وكتيبات تشغيل مُصنفة إصدارياً لتعزيز دقة الوكلاء في المهام طويلة المدى على Terminal-Bench 2.1 لتصل إلى 95.3% مع خفض تكاليف الاستدلال بشكل جذري مقارنة بالنماذج المرجعية.

Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang2026-08-18