💬 NLP

The Reasoning Lingua Franca: A Double-Edged Sword for Multilingual AI

यह शोध पत्र लार्ज रीजनिंग मॉडल्स (LRMs) की बहुभाषी तर्क क्षमताओं की जांच करता है, जिसमें यह पाया गया है कि हालांकि अंग्रेजी में तर्क करने से अक्सर सटीकता और संज्ञानात्मक गहराई में सुधार होता है, लेकिन यह साथ ही एक "लॉस्ट इन ट्रांसलेशन" (अनुवाद में खो जाना) विफलता मोड भी पेश करता है जहाँ भाषाई परिवर्तन त्रुटियों का कारण बन सकते हैं।

Alan Saji, Raj Dabre, Anoop Kunchukuttan, Ratish Puduppully2026-02-10
💬 NLP

Predicting the Emergence of Induction Heads in Language Model Pretraining

यह अध्ययन भाषा मॉडल प्रीट्रेनिंग के दौरान इंडक्शन हेड्स (induction heads) के उद्भव की जांच करता है, जो यह प्रदर्शित करता है कि उनका निर्माण बैच और कॉन्टेक्स्ट साइज के संयोजन के माध्यम से अनुमानित है, यह सतह वाले बिग्रैम दोहराव (surface bigram repetitions) की आवृत्ति और विश्वसनीयता द्वारा संचालित होता है, और उन विशेषताओं से प्रभावित होता है जब वे दोहराव दुर्लभ होते हैं।

Tatsuya Aoyama, Ethan Gotlieb Wilcox, Nathan Schneider2026-02-10
💬 NLP

ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?

ShoppingComp एक नया वास्तविक-विश्व बेंचमार्क है जिसे उत्पाद पुनर्प्राप्ति (product retrieval), रिपोर्ट जनरेशन और सुरक्षा-महत्वपूर्ण निर्णय लेने के माध्यम से LLM-संचालित शॉपिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी वर्तमान में प्रामाणिक ई-कॉमर्स कार्यों की जटिल, बहु-प्रतिबंधों वाली आवश्यकताओं के साथ संघर्ष कर रहे हैं।

Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia2026-02-10
💻 computer science

Towards Active Synthetic Data Generation for Finetuning Language Models

यह शोध पत्र लैंग्वेज मॉडल्स को फाइनट्यून करने के लिए सिंथेटिक डेटा जनरेशन के एक इटरेटिव, क्लोज्ड-लूप दृष्टिकोण का समर्थन और सत्यापन करता है, यह प्रदर्शित करते हुए कि स्टूडेंट की वर्तमान स्थिति के आधार पर टीचर-जेनरेटेड सैंपल्स को क्यूरेट करने के लिए सरल एक्टिव लर्निंग मानदंडों का उपयोग करना स्टेटिक जनरेशन विधियों की तुलना में बेहतर प्रदर्शन प्रदान करता है।

Samuel Kessler, Menglin Xia, Daniel Madrigal Diaz, Dongge Han, Helia Heshemi, Saravan Rajmohan, Victor Ruehle, Jordan T. (…)2026-02-10
💬 NLP

Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis

यह शोध पत्र "लेखांकन तर्क" (अकाउंटिंग रीजनिंग) की अवधारणा प्रस्तुत करता है, मॉडल प्रशिक्षण डेटा की विशेषताओं पर आधारित एक नया मूल्यांकन ढांचा प्रस्तावित करता है, और अनुभवजन्य परीक्षणों के माध्यम से यह प्रदर्शित करता है कि हालांकि GPT-4 वर्तमान प्रदर्शन में अग्रणी है, मौजूदा बड़े भाषा मॉडलों को पेशेवर उद्यम लेखांकन परिदृश्यों में विश्वसनीय रूप से तैनात करने से पहले महत्वपूर्ण अनुकूलन की आवश्यकता है।

Jie Zhou, Xin Chen, Jie Zhang, Zhe Li2026-02-10
💬 NLP

Compressed code: the hidden effects of quantization and distillation on programming tokens

यह शोध पत्र इस बात की जांच करता है कि कैसे मॉडल अनुकूलन तकनीकें—जैसे कि क्वांटाइजेशन, डिस्टिलेशन और स्केलिंग—एक नवीन कोल्ड-स्टार्ट प्रोबेबिलिटी विश्लेषण और व्यवस्थित शब्दावली मूल्यांकन के माध्यम से लार्ज लैंग्वेज मॉडल्स के टोकन-लेवल रिप्रेजेंटेशन और कोड जनरेशन की गुणवत्ता को प्रभावित करती हैं।

Viacheslav Siniaev, Iaroslav Chelombitko, Aleksey Komissarov2026-02-10
💬 NLP

VotIE: Information Extraction from Meeting Minutes

यह शोध पत्र VotIE को प्रस्तुत करता है, जो विषम नगर पालिका बैठक कार्यवृत्त (meeting minutes) में संरचित मतदान घटनाओं की पहचान करने के लिए एक नया सूचना निष्कर्षण कार्य और बेंचमार्क है, जिसमें यह पाया गया है कि जबकि फाइन-ट्यून्ड एनकोडर इन-डोमेन कार्यों के लिए अधिक कुशल हैं, अनदेखे नगर पालिकाओं में सामान्यीकरण करने के संदर्भ में फ्यू-शॉट LLMs बेहतर सुदृढ़ता प्रदर्शित करते हैं।

José Pedro Evans, Luís Filipe Cunha, Purificação Silvano, Alípio Jorge, Nuno Guimarães, Sérgio Nunes, Ricardo Campos2026-02-10
💬 NLP

Evaluating Semantic and Syntactic Understanding in Large Language Models for Payroll Systems

यह शोध पत्र विभिन्न लार्ज लैंग्वेज मॉडल्स की जटिल पेरोल स्कीमा और गणनाओं को सटीक रूप से संसाधित करने की क्षमता का मूल्यांकन करता है, जो एक ऐसा ढांचा प्रदान करता है जिससे यह निर्धारित किया जा सके कि उच्च-जोखिम वाली सटीकता के लिए प्रॉम्प्टिंग कब पर्याप्त है बनाम कब स्पष्ट कम्प्यूटेशनल उपकरणों की आवश्यकता होती है।

Hendrika Maclean, Mert Can Cakmak, Muzakkiruddin Ahmed Mohammed, Shames Al Mandalawi, John Talburt2026-02-10
💬 NLP

Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority

यह शोध पत्र "टोकन प्रायोरिटी" (Token Priority) को सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) में ग्रैनुलैरिटी अंतराल को पाटने के लिए एक ढांचे के रूप में प्रस्तावित करता है, जो इसे सरल डेटा फिटिंग से बदलकर एक सटीक वितरण पुनर्गठन प्रक्रिया में परिवर्तित करता है जो लक्षित टोकन-स्तरीय अनुकूलन के माध्यम से मॉडल जनरेशन को मानवीय उपयोगिता के साथ संरेखित करती है।

Zhanming Shen, Zeyu Qin, Jiaqi Hu, Wentao Ye, Hao Chen, Xiaomeng Hu, Haokai Xu, Gang Chen, Yi R. Fung, Haobo Wang2026-02-10
💬 NLP

EvoMU: Evolutionary Machine Unlearning

EvoMU एक विकासवादी खोज प्रक्रिया (evolutionary search procedure) पेश करता है जो स्वचालित रूप से कार्य-विशिष्ट अनलर्निंग लॉस फंक्शन (task-specific unlearning loss functions) की खोज करता है, जो कई बेंचमार्क पर मौजूदा तरीकों से बेहतर प्रदर्शन करता है और यह प्रदर्शित करता है कि एक एआई सह-वैज्ञानिक (AI co-scientist) अपेक्षाकृत छोटे पैमाने के मॉडल का उपयोग करके अत्याधुनिक परिणाम प्राप्त कर सकता है।

Pawel Batorski, Paul Swoboda2026-02-10