💬 NLP

Evaluating Agentic Optimization on Large Codebases

यह शोधपत्र FormulaCode को प्रस्तुत करता है, जो एक बेंचमार्क है जिसमें विशेषज्ञ पैच और सामुदायिक वर्कलोड के साथ 957 वास्तविक दुनिया के प्रदर्शन संबंधी बाधाएं (bottlenecks) शामिल हैं, ताकि बड़े कोडबेस पर एलएलएम (LLM) एजेंटों की समग्र, बहु-उद्देश्यीय अनुकूलन क्षमताओं का मूल्यांकन किया जा सके, जो यह प्रकट करता है कि यह फ्रंटियर मॉडल्स के लिए अभी भी एक महत्वपूर्ण चुनौती बना हुआ है।

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue2026-03-18
💬 NLP

Resource Consumption Threats in Large Language Models

यह सर्वेक्षण बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में संसाधन उपभोग के खतरों की व्यवस्थित रूप से समीक्षा करता है, जो कम्प्यूटेशनल दक्षता और आर्थिक स्थिरता की चुनौतियों से निपटने के लिए खतरे के प्रेरण (थ्रेट इंडक्शन) और तंत्र की समझ से लेकर शमन रणनीतियों तक फैला हुआ एक एकीकृत ढांचा प्रदान करता है।

Yuanhe Zhang, Xinyue Wang, Zhican Chen, Weiliu Wang, Zilu Zhang, Zhengshuo Gong, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su2026-03-18
💬 NLP

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

यह शोध पत्र MyScholarQA प्रस्तुत करता है, जो एक व्यक्तिगत डीप रिसर्च टूल है जो सिंथेटिक बेंचमार्क पर बेसलाइन से बेहतर प्रदर्शन करता है लेकिन वास्तविक उपयोगकर्ता साक्षात्कार के माध्यम से महत्वपूर्ण, अप्राप्य सीमाओं को प्रकट करता है, यह तर्क देते हुए कि वैयक्तिकरण में वास्तविक प्रगति के लिए केवल LLM जजों पर निर्भर रहने के बजाय वास्तविक उपयोगकर्ताओं के साथ मूल्यांकन की आवश्यकता है।

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eu (…)2026-03-18
💬 NLP

SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding

यह शोध पत्र SWE-QA-Pro प्रस्तुत करता है, जो विविध, लॉन्ग-टेल डेटा और कठिनाई अंशांकन के माध्यम से LLM मेमोराइजेशन को रोकने के लिए डिज़ाइन किया गया रिपॉजिटरी-स्तरीय कोड समझ के लिए एक कठोर बेंचमार्क है, साथ ही एक स्केलेबल दो-चरणीय प्रशिक्षण रेसिपी (SFT और RLAIF) भी प्रदान करता है जो छोटे ओपन मॉडल्स को एजेंटिक कोडबेस एक्सप्लोरेशन में GPT-4o से आगे निकलने में सक्षम बनाता है।

Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benj (…)2026-03-18
💬 NLP

Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning

यह शोध पत्र यह प्रदर्शित करता है कि बड़े पैमाने पर प्री-ट्रेनिंग के दौरान डिके (decay) के बिना वॉर्मअप-स्टेबल-ओनली (WOS) लर्निंग रेट शेड्यूलर का उपयोग करने से डाउनस्ट्रीम सुपरवाइज्ड फाइन-ट्यूनिंग प्रदर्शन में वृद्धि होती है, क्योंकि यह फ्लैटर लॉस मिनिमा (flatter loss minima) को संरक्षित करता है, भले ही डिके-आधारित शेड्यूलर कम प्री-ट्रेनिंग लॉस प्रदान कर सकते हों।

Kazuki Yano, Shun Kiyono, Sosuke Kobayashi, Sho Takase, Jun Suzuki2026-03-18
💬 NLP

Social Simulacra in the Wild: AI Agent Communities on Moltbook

यह शोध पत्र मोल्टबुक (Moltbook) और रेडिट (Reddit) पर एआई-एजेंट (AI-agent) और मानव समुदायों का पहला बड़े पैमाने पर अनुभवजन्य तुलना प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ साझा लेखकत्व के संरचनात्मक प्रभावों के कारण एआई-जनित सामग्री समरूप दिखाई देती है, वहीं व्यक्तिगत एजेंट वास्तव में मनुष्यों की तुलना में अधिक पहचानने योग्य हैं क्योंकि उनकी विशिष्ट, उच्च-मात्रा वाली शैलीगत प्रोफाइल होती है, जिसके परिणामस्वरूप भावनात्मक रूप से सपाट और सामाजिक रूप से विलग चर्चा होती है।

Agam Goyal, Olivia Pal, Hari Sundaram, Eshwar Chandrasekharan, Koustuv Saha2026-03-18
💬 NLP

SIA: A Synthesize-Inject-Align Framework for Knowledge-Grounded and Secure E-commerce Search LLMs with Industrial Deployment

यह शोध पत्र SIA फ्रेमवर्क का प्रस्ताव करता है, जो ज्ञान-समृद्ध और सुरक्षा-जागरूक डेटा को संश्लेषित करता है, कुशल ज्ञान इंजेक्शन के लिए डेप्थ अप-स्केलिंगिंग (Depth Up-Scaling) का उपयोग करता है, और सुरक्षित, ज्ञान-आधारित ई-कॉमर्स सर्च LLMs बनाने के लिए डुअल-पाथ अलाइनमेंट का उपयोग करता है, जिन्हें JD.com में महत्वपूर्ण व्यावसायिक मेट्रिक्स सुधारों के साथ सफलतापूर्वक तैनात किया गया है।

Zhouwei Zhai, Mengxiang Chen, Anmeng Zhang2026-03-18
💬 NLP

Answer Bubbles: Information Exposure in AI-Mediated Search

यह अध्ययन चार प्रणालियों में 11,000 खोज प्रश्नों (सर्च क्वेरीज़) का विश्लेषण करता है जिससे यह पता चलता है कि एआई-मध्यस्थ खोज (AI-mediated search) महत्वपूर्ण स्रोत-चयन पूर्वाग्रह प्रदर्शित करके, ज्ञान संबंधी अनिश्चितता (epistemic hedging) को कम करके और विकिपीडिया जैसे कुछ विशिष्ट प्रकार की सामग्री को अत्यधिक प्राथमिकता देकर तथा अन्य को कम प्रतिनिधित्व देकर "उत्तर बुलबुले" (answer bubbles) बनाता है, जिससे समान प्रश्नों के लिए संरचनात्मक रूप से भिन्न सूचना वास्तविकताएं उत्पन्न होती हैं।

Michelle Huang, Agam Goyal, Koustuv Saha, Eshwar Chandrasekharan2026-03-18
💬 NLP

Open-Source Reproduction and Explainability Analysis of Corrective Retrieval Augmented Generation

यह शोध पत्र विकिपीडिया और Phi-3-mini का उपयोग करके करेक्टिव रिट्रीवल ऑगमेंटेड जनरेशन (CRAG) प्रणाली के एक पूर्णतः ओपन-सोर्स पुनरुत्पादन को प्रस्तुत करता है, जो मूल के समान प्रदर्शन प्रदर्शित करते हुए पहला SHAP-आधारित व्याख्यात्मकता विश्लेषण प्रदान करता है जो मूल्यांकनकर्ता की नामित इकाई संरेखण (named entity alignment) पर निर्भरता को प्रकट करता है और प्रमुख विफलता मोडों की पहचान करता है।

Surya Vardhan Yalavarthi2026-03-18
💬 NLP

Polyglot-Lion: Efficient Multilingual ASR for Singapore via Balanced Fine-Tuning of Qwen3-ASR

यह शोध पत्र पॉलीग्लॉट-लियोन (Polyglot-Lion) का परिचय देता है, जो सिंगापुर की चार आधिकारिक भाषाओं के लिए कॉम्पैक्ट और लागत प्रभावी बहुभाषी एएसआर (ASR) मॉडलों का एक परिवार है, जो बिना किसी स्पष्ट भाषा कंडीशनिंग के क्यूवेन3-एएसआर (Qwen3-ASR) पर संतुलित फाइन-ट्यूनिंग का उपयोग करके काफी बड़े सिस्टम के साथ प्रतिस्पर्धी सटीकता प्राप्त करते हैं।

Quy-Anh Dang, Chris Ngo2026-03-18