💬 NLP

Semantic Centroids and Hierarchical Density-Based Clustering for Cross-Document Software Coreference Resolution

تقدم هذه الورقة إطار عمل هجين لحل مرجع البرمجيات عبر المستندات يدمج التضمينات الدلالية، والبحث في قواعد المعرفة عبر FAISS، وتجميع HDBSCAN لتحقيق درجات F1 عالية عبر مهام فرعية متعددة للمهمة المشتركة.

Julia Matela, Frank Krüger2026-03-26
⚛️ quantum physics

SpinGQE: A Generative Quantum Eigensolver for Spin Hamiltonians

تقدم هذه الورقة SpinGQE، وهو حل طيفي كمي توليدي يستخدم فك تشفير قائم على المحولات لتعلم التوزيعات عبر الدوائر الكمية لإيجاد الحالات الأرضية لهاملتونيات السبين، مما يظهر تقارباً ناجحاً في نموذج هيزنبرج رباعي الكيوبت كبديل قابل للتوسع للطرق التباينية التقليدية.

Alexander Holden, Moinul Hossain Rahat, Nii Osae Osae Dade2026-03-26
💬 NLP

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

تقدم الورقة البحثية GameplayQA، وهو إطار عمل مرجعي مبتكر يقيم قدرة النماذج اللغوية الكبيرة متعددة الوسائط على فهم واستنتاج أسلوب اللعب ثلاثي الأبعاد كثيف المنظور الأول ومتعدد الوكلاء من خلال تعليقات توضيحية ثلاثية عالية التردد، مما يكشف عن فجوات كبيرة في قدرات النماذج الحالية في الربط الزمني، وعزو الوكلاء، واتخاذ القرار مقارنة بالأداء البشري.

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun2026-03-26
💬 NLP

Improving Lean4 Autoformalization via Cycle Consistency Fine-tuning

تُثبت هذه الورقة أن الضبط الدقيق لنموذج Qwen3.5-2B باستخدام التعلم التعزيزي مع مكافأة اتساق الدورة يتفوق بشكل كبير على متغيرات الضبط الدقيق الخاضع للإشراف في عملية الصياغة الرسمية التلقائية للغة Lean4 على كل من FineLeanCorpus وPutnamBench، بينما لا يوفر التعلم المنهجي أي فائدة ملموسة.

Arsen Shebzukhov2026-03-26
💬 NLP

Towards Reward Modeling for AI Tutors in Math Mistake Remediation

تتناول هذه الورقة البحثية تحدي تقييم معلمي الرياضيات القائمين على الذكاء الاصطناعي من خلال اشتقاق تسلسل هرمي تربوي من التفضيلات البشرية، وتوليف أزواج استجابة تباينية، وتدريب نموذج مكافأة "برادلي-تيري" مدمج بحجم 0.5 مليار معلمة يحقق دقة زوجية تبلغ 0.74 في اختبارات التفضيل البشري، متفوقاً بذلك على النماذج الأكبر ذات الأغراض العامة.

Kseniia Petukhova, Ekaterina Kochmar2026-03-26
💬 NLP

OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework

تقدم الورقة البحثية OneSearch-V2، وهو إطار عمل للبحث التوليدي يعتمد على التقطير الذاتي المعزز بالاستدلال الكامن، والذي يعمل على تحسين فهم الاستعلام، وكشف نوايا المستخدم الدقيقة، والمواءمة مع التفضيلات الشخصية من خلال ثلاثة ابتكارات رئيسية، مما أدى إلى مكاسب كبيرة في الأداء الفعلي والافتراضي في البحث الخاص بالتجارة الإلكترونية دون زيادة تكاليف الاستدلال.

Ben Chen, Siyuan Wang, Yufei Ma, Zihan Liang, Xuxin Zhang, Yue Lv, Ying Yang, Huangyu Dai, Lingtao Mao, Tong Zhao, Zhipe (…)2026-03-26
💬 NLP

Mechanic: Sorrifier-Driven Formal Decomposition Workflow for Automated Theorem Proving

تقدم الورقة البحثية "Mechanic"، وهو نظام وكيل مبتكر يستخدم عنصر "sorry" الناقص في لغة "Lean" لعزل وحل الأهداف الفرعية الفاشلة بشكل مستقل داخل برهان رسمي، وذلك لتجنب عدم الكفاءة الناتج عن إعادة التوليد الكامل وتدهور السياق المرتبط بالإصلاحات التكرارية، مما يؤدي إلى تحسين إثبات النظريات آلياً بشكل كبير في الاختبارات المرجعية الرياضية الصعبة.

Ruichen Qiu, Yichuan Cao, Junqi Liu, Dakai Guo, Xiao-Shan Gao, Lihong Zhi, Ruyong Feng2026-03-26
💬 NLP

Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA

تقدم هذه الورقة إطار عمل متعدد الوكلاء يجمع بين المتخصصين في مجالات محددة وبين التحقق من الاتساق على مرحلتين والدمج الموزون بمعامل S-score، مما يحسن بشكل كبير من معايرة عدم اليقين والتمييز في الإجابة على الأسئلة الطبية متعددة الخيارات، ويقدم إشارة ثقة عملية للنشر الآمن للذكاء الاصطناستي السريري.

John Ray B. Martinez2026-03-26
💬 NLP

Analysing the Safety Pitfalls of Steering Vectors

تُثبت هذه الورقة بشكل منهجي أن نواقل توجيه التنشيط، ولا سيما تلك المستمدة من إضافة التنشيط التبايني، يمكن أن تغير بشكل جذري من قابلية النموذج اللغوي لهجمات كسر الحماية (jailbreak) من خلال تداخلها مع اتجاهات الرفض الكامنة، مما يكشف عن مقايضة حرجة بين القدرة على التحكم والسلامة.

Yuxiao Li, Alina Fastowski, Efstratios Zaradoukas, Bardh Prenkaj, Gjergji Kasneci2026-03-26
💬 NLP

Comparing Developer and LLM Biases in Code Evaluation

تقدم هذه الورقة إطار عمل TRACE، الذي يكشف عن عدم توافق كبير بين أحكام النماذج اللغوية الكبيرة والمطورين البشريين في تقييم الأكواد عبر ثلاثة أنماط، مما يظهر أن أفضل النماذج حتى الآن يقل أداؤها عن البشر بنسبة تتراوح بين 12 و23% وتُظهر تحيزات منهجية، مثل تفضيل التفسيرات الطويلة، في معظم أبعاد جودة الأكواد الحالية.

Aditya Mittal, Ryan Shar, Zichu Wu, Shyam Agarwal, Tongshuang Wu, Chris Donahue, Ameet Talwalkar, Wayne Chi, Valerie Che (…)2026-03-26