🤖 AI

What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code

यह शोध पत्र इस धारणा को चुनौती देता है कि निष्पादन योग्य कोड (executable code) स्वाभाविक रूप से सामान्य तर्क क्षमता को बढ़ाता है, बल्कि यह प्रदर्शित करता है कि मिश्रित कोड-पाठ (code-text) और गणित-पाठ (math-text) डेटा के भीतर संरचित तर्क संकेत (structured reasoning signals), न कि केवल कोड, गणितीय तर्क में सुधार लाते हैं और साथ ही क्रॉस-डोमेन ट्रेड-ऑफ को कम करने की एक रणनीति भी प्रदान करते हैं।

Yuze Zhao, Junpeng Fang, Lu Yu, Zhenya Huang, Kai Zhang, Qing Cui, Qi Liu, Jun Zhou, Enhong Chen2026-05-20
🤖 AI

GroupAffect-4: A Multimodal Dataset of Four-Person Collaborative Interaction

यह शोधपत्र GroupAffect-4 को प्रस्तुत करता है, जो दस चार-सदस्यीय समूहों के 40 प्रतिभागियों का एक व्यापक मल्टीमॉडल डेटासेट है जो विविध सहयोगात्मक कार्यों को निष्पादित करते हैं, और यह व्यक्तिगत, अंतर-वैयक्तिक और समूह स्तरों पर प्रभाव (affect) के विश्लेषण को सक्षम करने के लिए सिंक्रनाइज़्ड शारीरिक (physiological), आई-ट्रैकिंग, ऑडियो और स्व-रिपोर्ट डेटा को एकीकृत करता है।

Meisam Jamshidi Seikavandi, Alice Modica, Anna Obara, Shan Ahmed Shaffi, Fabricio Batista Narcizo, Tanya Ignatenko, Ted (…)2026-05-20
🤖 machine learning

AR1-ZO: Topology-Aware Rank-1 Zeroth-Order Queries for High-Rank LoRA Fine-Tuning

यह शोध पत्र AR1-ZO को प्रस्तुत करता है, जो एक टोपोलॉजी-जागरूक ज़ीरो-ऑर्डर ऑप्टिमाइज़ेशन विधि है जो एक सुधारात्मक स्केलिंग फैक्टर के साथ व्यक्तिगत रैंक-1 परमाणुओं (atoms) को क्वेरी करके उच्च-रैंक LoRA फाइन-ट्यूनिंग में रैंक विरोधाभास (rank paradox) को हल करता है, जिससे सिग्नल की शक्ति बहाल होती है और सहायक आधारों (auxiliary bases) या अतिरिक्त फॉरवर्ड पास के बिना प्रभावी मेमोरी-कुशल प्रशिक्षण सक्षम होता है।

Ziye Chen, Hongbin Lin, Chenyu Zhang, Xiangda Yan, Yongjie Yang, Yao Shu2026-05-20
🤖 AI

OpenComputer: Verifiable Software Worlds for Computer-Use Agents

यह शोधपत्र OpenComputer प्रस्तुत करता है, जो एक सत्यापनकर्ता-आधारित (verifier-grounded) ढांचा है जो कंप्यूटर-उपयोग करने वाले एजेंटों के लिए सत्यापन योग्य सॉफ्टवेयर जगत का निर्माण करता है, जिसमें एप्लिकेशन-विशिष्ट अवस्था सत्यापनकर्ताओं (application-specific state verifiers), एक स्व-विकसित होने वाले सत्यापन परत (self-evolving verification layer), एक कार्य-जनरेशन पाइपलाइन और एक मूल्यांकन हारनेस को एकीकृत किया गया है ताकि वर्तमान सीमावर्ती (frontier) और ओपन-सोर्स एजेंटों की आंशिक प्रगति के बावजूद उनकी मजबूती में महत्वपूर्ण अंतराल को उजागर किया जा सके।

Jinbiao Wei, Qianran Ma, Yilun Zhao, Xiao Zhou, Kangqi Ni, Guo Gan, Arman Cohan2026-05-20
🤖 AI

Distribution-Free Uncertainty Quantification for Continuous AI Agent Evaluation

यह शोध पत्र निरंतर एआई एजेंट मूल्यांकन के लिए एक वितरण-मुक्त (distribution-free) ढांचे को प्रस्तुत करता है जो कैलिब्रेटेड अनिश्चितता अंतराल (calibrated uncertainty intervals), मल्टी-एजेंट पाइपलाइनों के लिए संरचनात्मक सीमाएं (compositional bounds), और रैंकिंग के लिए नियंत्रित अपवर्जन नियम (controlled abstention rules) प्रदान करने के लिए कॉन्फॉर्मल प्रेडिक्शन और एडेप्टिव कॉन्फॉर्मल इन्फरेंस को अनुकूलित करता है, जो 50 एजेंटों और 18 रियल-टाइम सिग्नलों पर मजबूत प्रदर्शन प्रदर्शित करता है।

Yuxuan Gao, Megan Wang, Yi Ling Yu2026-05-20
🤖 AI

Prior Knowledge or Search? A Study of LLM Agents in Hardware-Aware Code Optimization

यह अध्ययन प्रदर्शित करता है कि हार्डवेयर-जागरूक कोड अनुकूलन (hardware-aware code optimization) में एलएलएम (LLM) एजेंट मुख्य रूप से प्रीट्रेंड प्रायर्स (pretrained priors) पर निर्भर करते हैं न कि पुनरावृत्ति फीडबैक (iterative feedback) या एजेंटिक संरचनाओं पर, जैसा कि ब्लैक-बॉक्स सेटिंग्स में उनके ग्रीडी व्यवहार (greedy behavior), अनदेखे कर्नेल आकारों के प्रति अनुकूलन करने में अक्षमता, और लो-डेंसिटी इंटरमीडिएट रिप्रेजेंटेशन (low-density intermediate representations) के साथ काम करने पर प्रदर्शन में गिरावट से सिद्ध होता है।

Dmitry Redko (Applied AI Institute), Albert Fazlyev (AI Talent Hub, ITMO University), Konstantin Sozykin (Applied AI Ins (…)2026-05-20
🤖 AI

AffectAI-Capture: A Reproducible Multimodal Protocol for Small-Group Meeting Research

यह शोध पत्र AffectAI-Capture को प्रस्तुत करता है, जो एक पुनरुत्पादनीय बहुविध (multimodal) प्रोटोकॉल है जिसे आई ट्रैकिंग और वियरेबल्स जैसे विविध सेंसरों का उपयोग करके चार व्यक्तियों की बैठकों से सिंक्रोनाइज़्ड डेटा एकत्र करने के लिए डिज़ाइन किया गया है, जिसे भावनात्मक और व्यवहारिक अनुसंधान के समर्थन के लिए एक एकीकृत इवेंट टाइमलाइन के इर्द-गिर्द व्यवस्थित किया गया है।

Meisam Jamshidi Seikavandi, Alice Modica, Anna Obara, Fabricio Batista Narcizo, Tanya Ignatenko, Ted Vucurevich, Jesper (…)2026-05-20
🤖 AI

Stitched Value Model for Diffusion Alignment

यह शोध पत्र StitchVM को प्रस्तुत करता है, जो एक हल्का मॉडल स्टिचिंग फ्रेमवर्क है जो एक फ्रोजन डिफ्यूजन बैकबोन को संलग्न करके प्रीट्रेन पिक्सेल-स्पेस रिवॉर्ड मॉडल्स को नॉइज़ी लेटेंट स्पेस में कुशलतापूर्वक स्थानांतरित करता है, जिससे टवीडी अनुमानों (Tweedie estimates) के पूर्वाग्रह या मोंटे कार्लो रोलआउट्स की उच्च लागत के बिना डिफ्यूजन मॉडल्स का सटीक और गणनात्मक रूप से कुशल संरेखण सक्षम होता है।

Hyojun Go, Hyungjin Chung, Prune Truong, Goutam Bhat, Li Mi, Zhaochong An, Zixiang Zhao, Dominik Narnhofer, Serge Belong (…)2026-05-20
💬 NLP

Chunking German Legal Code

यह शोधपत्र यह प्रदर्शित करता है कि जर्मन वैधानिक कानून पर रिट्रीवल-ऑगमेंटेड जनरेशन के लिए, दस्तावेज़ की अंतर्निहित संरचनात्मक इकाइयों (जैसे कि अनुभागों और उप-अनुभागों) के अनुरूप चंकिंग रणनीतियाँ, अधिक जटिल सिमेंटिक या पदानुक्रमित विधियों की तुलना में उच्च रिकॉल और अधिक कम्प्यूटेशनल दक्षता प्राप्त करके बेहतर प्रदर्शन करती हैं।

Max Prior, Natalia Milanova, Andreas Schultz2026-05-20
📊 statistics

FLUXtrapolation: A benchmark on extrapolating ecosystem fluxes

यह शोध पत्र FLUXtrapolation को प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे बढ़ते हुए कठिन वितरण परिवर्तनों (distribution shifts) के तहत पारिस्थितिकी तंत्र के प्रवाह (ecosystem fluxes) का अनुमान लगाने की मशीन लर्निंग मॉडलों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिससे विरल टावर मापों (sparse tower measurements) को वैश्विक स्तरों तक सटीक रूप से अपस्केल करने की महत्वपूर्ण चुनौती का समाधान किया जा सके।

Anya Fries, Jacob A Nelson, Martin Jung, Markus Reichstein, Jonas Peters2026-05-20