💬 NLP

Recursive numeral systems are highly regular and easy to process

यह शोधपत्र तर्क देता है कि न्यूनतम विवरण लंबाई (MDL) ढांचे के माध्यम से नियमितता और प्रसंस्करण जटिलता को शामिल करना पुनरावर्ती संख्या प्रणालियों की संरचना की बेहतर व्याख्या करता है और स्वाभाविक रूप से उन बाधाओं का लेखा-जोखा प्रस्तुत करता जिन्हें पिछले दक्षता-आधारित मॉडलों को अधोमुखी (ad-hoc) रूप से लागू करने की आवश्यकता थी।

Ponrawee Prasertsom, Andrea Silvi, Jennifer Culbertson, Moa Johansson, Devdatt Dubhashi, Kenny Smith2026-02-03
💬 NLP

RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning

यह शोध पत्र RIDE का प्रस्ताव करता है, जो एक प्रतिकूल ढांचा (adversarial framework) है जो व्यवस्थित रूप से सुव्यवस्थित, प्रगतिशील रूप से चुनौतीपूर्ण गणितीय समस्याओं को उत्पन्न करने के लिए आइटम रिस्पांस थ्योरी और सुदृढीकरण शिक्षण (reinforcement learning) का लाभ उठाता है, जो प्रदर्शन में महत्वपूर्ण गिरावट के माध्यम से वास्तविक तर्क के माध्यम से बड़े भाषा मॉडलों की सीमित मजबूती को प्रभावी ढंग से उजागर करता है।

Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan2026-02-03
💬 NLP

IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling

IterResearch इंटरैक्शन स्केलिंग और MDP-प्रेरित वर्कस्पेस पुनर्निर्माण पर आधारित एक पुनरावृत्ति गहन-अनुसंधान प्रतिमान (iterative deep-research paradigm) प्रस्तुत करता है, जो एक प्रशिक्षित मॉडल और फ्रंटियर सिस्टम के लिए एक प्रॉम्प्टिंग रणनीति, दोनों के रूप में लंबी अवधि के कार्यों (long-horizon tasks) पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करने के लिए मौजूदा एजेंटों की संदर्भ सीमाओं को दूर करता है।

Guoxin Chen, Zile Qiao, Xuanzhong Chen, Donglei Yu, Haotian Xu, Wayne Xin Zhao, Ruihua Song, Wenbiao Yin, Huifeng Yin, L (…)2026-02-03
💬 NLP

PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization

यह शोध पत्र PSM प्रस्तुत करता है, जो एक नवीन ब्लैक-बॉक्स ऑप्टिमाइज़ेशन फ्रेमवर्क है जो सिस्टम प्रॉम्प्ट्स के साथ हल्के, उपयोगिता-संरक्षण वाले सुरक्षात्मक परतों (SHIELDs) को जोड़ने के लिए LLM-as-optimizer का लाभ उठाता है, जो मॉडल एक्सेस की आवश्यकता के बिना, उन्हें एडवर्सरियल एक्सट्रैक्शन हमलों के प्रति प्रभावी रूप से कम संवेदनशील बनाता है।

Huseein Jawad, Nicolas Brunel2026-02-03
💬 NLP

Latent Debate: A Surrogate Framework for Interpreting LLM Thinking

यह शोधपत्र "लेटेंट डिबेट" (latent debate) प्रस्तुत करता है, जो एक नवीन ढांचा है जो एक ही अनुमान (inference) के भीतर निहित आंतरिक तर्कों का विश्लेषण करके लार्ज लैंग्वेज मॉडल (Large Language Model) के भविष्यवाणियों की व्याख्या करता है, और मॉडल की तर्क प्रक्रिया को समझने तथा विशिष्ट डिबेट पैटर्न के माध्यम से मतिभ्रम (hallucinations) का पता लगाने के लिए एक निष्ठावान सरोगेट (faithful surrogate) के रूप में इसकी प्रभावशीलता को प्रदर्शित करता है।

Lihu Chen, Xiang Yin, Francesca Toni2026-02-03
💬 NLP

MixLM: High-Throughput and Effective LLM Ranking via Text-Embedding Mix-Interaction

MixLM एक नवीन LLM रैंकिंग फ्रेमवर्क है जो एक मिक्स-इंटरैक्शन तंत्र के माध्यम से लंबे टेक्स्ट इनपुट्स को संक्षिप्त एम्बेडिंग टोकन से बदलकर सिस्टम थ्रूपुट को महत्वपूर्ण रूप से बढ़ाता है, जिससे उच्च प्रासंगिकता बनाए रखते हुए वास्तविक दुनिया के सर्च अनुप्रयोगों में कुशल फुल-ट्रैफिक परिनियोजन सक्षम होता है।

Guoyao Li, Ran He, Shusen Jing, Kayhan Behdin, Yubo Wang, Sundara Raman Ramachandran, Chanh Nguyen, Jian Sheng, Xiaojing (…)2026-02-03
💬 NLP

Diffusion Language Model Inference with Monte Carlo Tree Search

यह शोध पत्र MEDAL को प्रस्तुत करता है, जो एक इन्फरेंस-टाइम स्केलिंग फ्रेमवर्क है जो डिफ्यूजन लैंग्वेज मॉडल्स में अनमास्किंग प्रक्षेपवक्र (unmasking trajectory) को अनुकूलित करने के लिए मोंटे कार्लो ट्री सर्च को एकीकृत करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के मौजूदा ह्यूरिस्टिक विधियों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

Zheng Huang, Kiran Ramnath, Yueyan Chen, Aosong Feng, Sangmin Woo, Balasubramaniam Srinivasan, Zhichao Xu, Kang Zhou, Sh (…)2026-02-03
💬 NLP

Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks

यह शोध पत्र लंबे समय तक चलने वाले एजेंटिक कार्यों (long-horizon agentic tasks) के लिए तीन प्रमुख LLM प्रदाताओं में प्रॉम्प्ट कैशिंग का एक व्यापक मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि रणनीतिक कैशिंग तकनीकें—जैसे कि गतिशील टूल परिणामों (dynamic tool results) को बाहर रखना और प्रॉम्प्ट संरचना का प्रबंधन करना—ने नैव (naive) पूर्ण-संदर्भ कैशिंग की तुलना में API लागत को 41-80% तक कम किया है और पहले टोकन के समय (time to first token) को 13-31% तक सुधारा है।

Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah2026-02-03
💬 NLP

MedTutor: A Retrieval-Augmented LLM System for Case-Based Medical Education

मेडट्यूटर (MedTutor) एक रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) प्रणाली है जो एक हाइब्रिड रिट्रीवल पाइपलाइन के माध्यम से क्लिनिकल केस रिपोर्ट्स से साक्ष्य-आधारित शिक्षण सामग्री और प्रश्न स्वचालित रूप से उत्पन्न करके मेडिकल रेजिडेंट्स की शिक्षा को उन्नत करती है, जो विशेषज्ञ मूल्यांकन में उच्च शैक्षिक मूल्य प्रदर्शित करते हुए एलएलएम-आधारित (LLM-based) और मानव आकलन के बीच मध्यम संरेखण को प्रकट करती है।

Dongsuk Jang, Ziyao Shangguan, Kyle Tegtmeyer, Anurag Gupta, Jan Czerminski, Sophie Chheang, Arman Cohan2026-02-03
💬 NLP

Identity, Cooperation and Framing Effects within Groups of Real and Simulated Humans

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) को समृद्ध कथात्मक पहचानों के साथ गहराई से बांधना और उनकी निरंतरता को सत्यापित करना सामाजिक दुविधा वाले खेलों में मानव व्यवहार के अनुकरण को महत्वपूर्ण रूप से सुधारता है, जिससे समय, फ्रेमिंग और प्रतिभागी समूहों जैसे महत्वपूर्ण प्रासंगिक कारकों का अन्वेषण संभव हो पाता है जो अक्सर मानव अध्ययनों के अनुकरण में बाधा डालते हैं।

Suhong Moon, Minwoo Kang, Joseph Suh, Mustafa Safdari, John Canny2026-02-03