📊 statistics

Beyond Accuracy: Are Time Series Foundation Models Well-Calibrated?

تقيم هذه الورقة بشكل منهجي معايرة خمسة نماذج تأسيسية حديثة للسلاسل الزمنية، وتجد أنها معايرة بشكل أفضل باستمرار وأقل عرضة للثقة المفرطة المنهجية مقارنة بالنماذج المرجعية عبر سيناريوهات تنبؤ مختلفة.

Coen Adler, Yuxin Chang, Felix Draxler, Samar Abdi, Padhraic Smyth2026-05-29
🔬 materials science

MiAD: Mirage Atom Diffusion for De Novo Crystal Generation

تقدم هذه الورقة البحثية MiAD، وهو نموذج انتشار مشترك متماثل (equivariant) يستخدم تقنية "حقن السراب" (mirage infusion) المبتكرة لتغيير عدد الذرات ديناميكيًا أثناء عملية التوليد، مما يحسن بشكل كبير من اكتشاف المواد البلورية المستقرة والفريدة والجديدة مقارنة بالنهج الحالية المتطورة.

Andrey Okhotin, Maksim Nakhodnov, Nikita Kazeev, Mikhail Lazarev, Andrey E Ustyuzhanin, Dmitry Vetrov2026-05-29
🤖 AI

ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing

يُعد ReflexGrad بنية ثنائية العمليات تُمكّن وكلاء النماذج اللغوية الكبيرة من التعافي من الإخفاقات داخل الحلقة دون الحاجة إلى نماذج توضيحية، وذلك عبر التوجيه الديناميكي بين التحسين المستمر السريع والتشخيص السببي البطيء، محققاً مكاسب كبيرة في أداء مهام ALFWorld عبر مختلف مقاييس النماذج.

Ankush Kadu, Aswanth Krishnan2026-05-29
🤖 AI

Evaluating Dataset Watermarking for Fine-tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach

تضع هذه الورقة إطار تقييم شاملاً لعلامات البيانات المائية في عملية الضبط الدقيق لنماذج الانتشار، حيث تثبت أنه على الرغم من أن الأساليب الحالية توفر بعض المتانة، إلا أنها تظل عرضة لتقنية إزالة عملية مقترحة حديثاً تقضي تماماً على العلامات المائية دون المساس بأداء النموذج.

Xincheng Wang, Hanchi Sun, Wenjun Sun, Kejun Xue, Wangqiu Zhou, Jianbo Zhang, Wei Sun, Dandan Zhu, Xiongkuo Min, Jun Jia (…)2026-05-29
🔬 mesoscale physics

Topological Order in Neural Wavefunctions

تثبت هذه الورقة أن الشبكات العصبية العميقة القائمة على آلية الانتباه يمكنها اكتشاف حالات الأرض لعوازل شيرن الكسرية بفعالية واستخراج تدهورها الطوبولوجي من خلال تقليل الطاقة، مما يرسخ مونت كارلو المتغير للشبكات العصبية كأداة قوية لدراسة الأطوار الطوبولوجية شديدة الارتباط دون معرفة مسبقة.

Ahmed Abouelkomsan, Max Geier, Liang Fu2026-05-29
📊 statistics

E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing

تقدم الورقة البحثية E-valuator، وهو إطار عمل خفيف الوزن ومستقل عن النموذج يحول درجات الموثق (verifier) ذات الصندوق الأسود إلى قواعد قرار صالحة إحصائياً باستخدام اختبار الفرضيات المتسلسلة وعمليات e (e-processes) لمراقبة مسارات الذكاء الاصطنا�ي الوكيل بشكل موثوق، والتحكم في معدلات الإنذار الكاذب، وتمكين الإنهاء المبكر للتسلسلات الفاشلة.

Shuvom Sadhuka, Drew Prinster, Clara Fannjiang, Gabriele Scalia, Bonnie Berger, Aviv Regev, Hanchen Wang2026-05-29
🤖 AI

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

تقدم الورقة البحثية "Rulers"، وهو إطار عمل ثلاثي المراحل أثناء الاستنتاج يعمل على تحويل المعايير البشرية إلى مواصفات مغلقة، ويفرض استناداً هيكلياً للأدلة، ويطبق معايرة لاحقة للتغلب على أوضاع الفشل الشائعة وتحقيق تقييم أكثر موثوقية ومواءمة للبشر من قبل النماذج اللغوية الكبيرة عبر مهام تقييم النصوص المتنوعة.

Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong2026-05-29
🤖 AI

Steering Language Models Before They Speak: Logit-Level Interventions

تقدم الورقة البحثية SWAI، وهي طريقة خالية من التدريب تُستخدم أثناء الاستنتاج لتوجيه مخرجات النماذج اللغوية نحو خصائص محددة مثل اللباقة أو سهولة القراءة عبر تطبيق انحيازات إحصائية مستمدة من المتون مباشرة على أفضل (K) من مرشحي اللوغاريتم (top-K logit candidates)، مما يحقق تحكماً فائقاً دون تعديل معلمات النموذج أو الحاجة إلى نماذج مساعدة.

Hyeseon An, Shinwoo Park, Hyundong Jin, Yo-Sub Han2026-05-29
🤖 AI

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning

تقترح هذه الورقة إطار عمل للتدريب اللاحق متوافقاً معرفياً يسمى "سلسلة التفكير الميتافيزيقي" (CoMT) و"التعلم المعزز المعاير للثقة" (CCRL)، والذي يفصل بين اكتساب الاستراتيجية المجردة والتنفيذ المحدد لتحسين قابلية التعميم والموثوقية في استدلال النماذج اللغوية الكبيرة، محققاً مكاسب أداء كبيرة مقارنة بالطرق القياسية.

Shaojie Wang, Liang Zhang2026-05-29
🤖 AI

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers

تقدم هذه الورقة البحثية "الاستنتاج التفاعلي الاستباقي" (PIR)، وهو نموذج جديد يحول نماذج اللغات الكبيرة الاستنتاجية من مجرد حلال للمشكلات بشكل سلبي إلى مستقصٍ استباقي عبر دمج الاستنتاج الداخلي مع استيضاحات المستخدم لمعالجة عدم اليقين في المقدمات والقصد، مما يؤدي إلى تحسين الدقة والكفاءة بشكل كبير مع تقليل التكاليف الحسابية.

Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang2026-05-29