⚛️ lattice

PRBench: End-to-end Paper Reproduction in Physics Research

यह शोध पत्र PRBench प्रस्तुत करता है, जो AI एजेंटों की एंड-टू-एंड पुनरुत्पादन क्षमताओं के मूल्यांकन के लिए विशेषज्ञों द्वारा क्यूरेट किए गए 30 भौतिकी कार्यों वाला एक कठोर बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल अपनी उन्नत तर्क क्षमताओं के बावजूद कोड की शुद्धता, डेटा सटीकता और सफल पुनरुत्पादन प्राप्त करने में काफी संघर्ष करते हैं।

Shi Qiu, Junyi Deng, Yiwei Deng, Haoran Dong, Jieyu Fu, Mao Li, Zeyu Li, Zhaolong Zhang, Huiwen Zheng, Leidong Bao, Anqi (…)2026-03-31
💬 NLP

Budget-Xfer: Budget-Constrained Source Language Selection for Cross-Lingual Transfer to African Languages

यह शोध पत्र Budget-Xfer को प्रस्तुत करता है, जो एक निश्चित एनोटेशन बजट के तहत स्रोत भाषा चयन और डेटा आवंटन को अनुकूलित करने वाला एक ढांचा है, जो यह प्रकट करता है कि मल्टी-सोर्स ट्रांसफर अफ्रीकी भाषाओं के लिए सिंगल-सोर्स ट्रांसफर की तुलना में काफी बेहतर प्रदर्शन करता है और यह भी दर्शाता है कि एम्बेडिंग समानता (embedding similarity) चयन के लिए सार्वभौमिक रूप से विश्वसनीय प्रॉक्सी नहीं है।

Tewodros Kederalah Idris, Roald Eiselen, Prasenjit Mitra2026-03-31
💬 NLP

Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?

यह शोध पत्र 217 एआई (AI) शोधकर्ताओं के अनुदैर्ध्य प्रकाशन प्रक्षेपवक्र (longitudinal publication trajectories) पर आधारित एक नवीन बेंचमार्क प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि क्या बड़े भाषा मॉडल वास्तव में व्यक्तिगत मानव संज्ञानात्मक पैटर्न का अनुकरण करते हैं या केवल सतही व्यवहारों की नकल करते हैं, जिसमें वर्तमान मॉडलों और संवर्धन तकनीकों का आकलन करने के लिए एक क्रॉस-डोमेन टेम्पोरल-शिफ्ट सेटिंग और एक बहुआयामी संरेखण मीट्रिक का उपयोग किया गया है।

Yuxuan Gu, Lunjun Liu, Xiaocheng Feng, Kun Zhu, Weihong Zhong, Lei Huang, Bing Qin2026-03-31
💬 NLP

KAT-Coder-V2 Technical Report

KAT-Coder-V2 कुआईशौ (Kuaishou) द्वारा विकसित एक एजेंटिक कोडिंग मॉडल है जो पांच विशेषज्ञ डोमेन को प्रशिक्षित करने के लिए "स्पेशलाइज-देन-यूनिफाई" (Specialize-then-Unify) प्रतिमान का उपयोग करता है और फिर उन्हें एक एकल मॉडल में समेकित करता है, जिससे KwaiEnv इंफ्रास्ट्रक्चर और MCLA स्थिरीकरण जैसे नवाचारों के माध्यम से SWE-bench Verified और PinchBench जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Fengxiang Li, Han Zhang, Haoyang Huang, Jinghui Wang, Jinhua Hao, Kun Yuan, Mengtong Li, Minglei Zhang, Pengcheng Xu, We (…)2026-03-31
💬 NLP

Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG

यह शोध पत्र RT4CHART प्रस्तुत करता है, जो एक रेट्रोमॉर्फिक परीक्षण ढांचा है जो रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम में अत्याधुनिक सूक्ष्म-स्तरीय मतिभ्रम (hallucination) का पता लगाने के लिए पदानुक्रमित, दावा-स्तर के सत्यापन का उपयोग करता है और यह प्रकट करता है कि मौजूदा बेंचमार्क मतिभ्रम की व्यापकता को काफी कम करके आंकते हैं।

Boxi Yu, Yuzhong Zhang, Liting Lin, Lionel Briand, Emir Muñoz2026-03-31
💬 NLP

TailNLG: A Multilingual Benchmark Addressing Verbalization of Long-Tail Entities

यह शोध पत्र TailNLG को प्रस्तुत करता है, जो एक नया बहुभाषी बेंचमार्क है जो डेटा-टू-टेक्स्ट जनरेशन के दौरान लॉन्ग-टेल संस्थाओं (long-tail entities) के विरुद्ध बड़े भाषा मॉडलों में एक निरंतर प्रदर्शन पूर्वाग्रह को प्रकट करता है, जो इस अंतर को दूर करने के लिए अधिक विश्वसनीय मूल्यांकन ढांचों की आवश्यकता पर प्रकाश डालता है।

Lia Draetta, Michael Oliverio, Virginia Ramón-Ferrer, Pier Felice Balestrucci, Flaviana Corallo, Carlos Badenes-Olmedo (…)2026-03-31
💬 NLP

Conversational Agents and the Understanding of Human Language: Reflections on AI, LLMs, and Cognitive Science

यह शोध पत्र मानव भाषा क्षमता के सिद्धांतों के संबंध में प्राकृतिक भाषा प्रसंस्करण के प्रतिमानों के विकास की समीक्षा करता है, और यह निष्कर्ष निकालता है कि आधुनिक विशाल भाषा मॉडलों की प्रभावशाली क्षमताओं के बावजूद, उनके विकास ने इस बारे में हमारी समझ को महत्वपूर्ण रूप से आगे नहीं बढ़ाया है कि मानव मस्तिष्क प्राकृतिक भाषा को कैसे संसाधित करता है।

Andrei Popescu-Belis2026-03-31
🤖 machine learning

KVSculpt: KV Cache Compression as Distillation

KVSculpt एक नवीन KV कैश संपीड़न विधि प्रस्तुत करता है जो निरंतर एम्बेडिंग स्पेस में अनियंत्रित KV युग्मों को अनुकूलित करने के लिए अनुकूली बजट आवंटन द्वारा संवर्धित, बारी-बारी से L-BFGS और लीस्ट-स्क्वायर समाधानों के माध्यम से अनुकूलित करता है, ताकि मौजूदा चयन या विलय दृष्टिकोणों की तुलना में KL डाइवर्जेंस को काफी कम किया जा सके और अटेंशन व्यवहार को संरक्षित किया जा सके।

Bo Jiang, Sian Jin2026-03-31
💬 NLP

Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning

यह शोध पत्र एक काउंटरफैक्चुअल मल्टी-एजेंट फ्रेमवर्क प्रस्तावित करता है जो साक्ष्य संशोधन के माध्यम से परिकल्पनाओं का स्पष्ट रूप से परीक्षण करके और आत्मविश्वास के बदलावों को परिमाणित करके नैदानिक निदान को बढ़ाता है, जिससे विभिन्न बेंचमार्क और लार्ज लैंग्वेज मॉडल्स में नैदानिक सटीकता और तर्क व्याख्यात्मकता में सुधार होता है।

Zhiwen You, Xi Chen, Aniket Vashishtha, Simo Du, Gabriel Erion-Barner, Hongyuan Mei, Hao Peng, Yue Guo2026-03-31
💬 NLP

Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3

AIMO 3 प्रतियोगिता में, प्रयोगों से यह प्रदर्शित होता है कि मॉडल क्षमता (model capability), इन्फरेंस-टाइम ऑप्टिमाइज़ेशन रणनीतियों पर भारी रूप से हावी रहती है, क्योंकि विविध प्रॉम्प्टिंग या एरर डिकोरिलेशन के माध्यम से प्रदर्शन में सुधार करने के प्रयास लगातार एक अधिक सक्षम मॉडल का उपयोग करने मात्र से पीछे रह गए।

Natapong Nitarach2026-03-31