💬 NLP

CyclicReflex: Improving Reasoning Models via Cyclical Reflection Token Scheduling

CyclicReflex एक प्रशिक्षण-मुक्त डिकोडिंग रणनीति है जो एक द्विदिश त्रिकोणीय तरंग (bidirectional triangular waveform) का उपयोग करके रिफ्लेक्शन टोकन को अनुकूल रूप से शेड्यूल करके बड़े रीजनिंग मॉडल्स के टेस्ट-टाइम प्रदर्शन में सुधार करती है, जो ओवर-रिफ्लेक्शन और अंडर-रिफ्लेक्शन के बीच प्रभावी ढंग से संतुलन बनाकर विभिन्न बेंचमार्क और मॉडल आकारों में निरंतर लाभ प्राप्त करती है।

Chongyu Fan, Yihua Zhang, Jinghan Jia, Alfred Hero, Sijia Liu2026-03-10
💬 NLP

Goal Alignment in LLM-Based User Simulators for Conversational AI

यह शोध पत्र यूजर गोल स्टेट ट्रैकिंग (UGST) का परिचय देता है, जो एक नवीन ढांचा और तीन-चरणीय कार्यप्रणाली है जो LLM-आधारित यूजर सिम्युलेटर्स को स्वायत्त रूप से लक्ष्य प्रगति को ट्रैक करने और लक्ष्य-अनुरूप प्रतिक्रियाएं उत्पन्न करने में सक्षम बनाता है, जिससे MultiWOZ 2.4 और τ\tau-Bench बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Shuhaib Mehri, Xiaocheng Yang, Takyoung Kim, Gokhan Tur, Shikib Mehri, Dilek Hakkani-Tür2026-03-10
🤖 machine learning

Linear probes rely on textual evidence: Results from leakage mitigation studies in language models

यह शोधपत्र प्रदर्शित करता है कि भाषा मॉडलों में हानिकारक व्यवहारों का पता लगाने के लिए उपयोग किए जाने वाले लीनियर प्रोब्स (linear probes) स्पष्ट पाठ्य साक्ष्यों पर अत्यधिक निर्भर हैं, क्योंकि जब ऐसे सतही संकेतों को हटा दिया जाता है या जब मॉडलों को बिना मौखिक अभिव्यक्ति के व्यवहार प्रदर्शित करने के लिए प्रशिक्षित किया जाता है, तो उनका प्रदर्शन काफी कम हो जाता है।

Gerard Boxo, Aman Neelappa, Shivam Raval2026-03-10
💬 NLP

Mapping Overlaps in Benchmarks through Perplexity in the Wild

यह शोध पत्र "बेंचमार्क सिग्नेचर" (benchmark signatures)—जो कि इन-द-वाइल्ड कॉर्पोरा से प्रमुख टोकन के ऐसे सेट हैं जिनकी पर्प्लेक्सिटी मॉडल प्रदर्शन की भविष्यवाणी करती है—को प्रस्तुत करता है ताकि 89 एलएलएम (LLM) बेंचमार्क के बीच सूक्ष्म ओवरलैप और विशिष्ट क्षमताओं को प्रकट किया जा सके, जो एलएलएम क्षमताओं के परिदृश्य और मशीन एवं मानव अर्थ संबंधी संगठन के बीच के अंतर को समझने के लिए कच्चे प्रदर्शन सहसंबंधों (raw performance correlations) के एक सुदृढ़ विकल्प के रूप में कार्य करता है।

Siyang Wu, Honglin Bao, Sida Li, Ari Holtzman, James A. Evans2026-03-10
🤖 machine learning

Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents

यह शोध पत्र "मिसेवोल्यूशन" (misevolution) की अवधारणा को प्रस्तुत करता है और अनुभवजन्य रूप से इसे प्रमाणित करता है, यह प्रदर्शित करते हुए कि स्व-विकसित (self-evolving) एलएलएम (LLM) एजेंट मॉडल, मेमोरी, टूल और वर्कफ़्लो मार्गों के माध्यम से व्यापक, उभरते जोखिमों का सामना करते हैं जो सुरक्षा क्षरण और अनपेक्षित कमजोरियों का कारण बन सकते हैं, जिससे नए सुरक्षा प्रतिमानों की तत्काल आवश्यकता पर प्रकाश पड़ता है।

Shuai Shao, Qihan Ren, Chen Qian, Boyi Wei, Dadi Guo, Jingyi Yang, Xinhao Song, Linfeng Zhang, Weinan Zhang, Dongrui Liu (…)2026-03-10
💬 NLP

TokMem: One-Token Procedural Memory for Large Language Models

TokMem एक प्रक्रियात्मक स्मृति (procedural memory) ढांचे को पेश करता है जो पुन: प्रयोज्य कार्य प्रक्रियाओं को एकल प्रशिक्षण योग्य टोकन (single trainable tokens) में संकलित करता है ताकि स्थिर ओवरहेड के साथ लार्ज लैंग्वेज मॉडल जनरेशन को निर्देशित किया जा सके, जिससे नए व्यवहारों को निरंतर जोड़ना सक्षम होता है और यह रिट्रीवल-ऑगमेंटेड प्रॉम्प्टिंग से बेहतर प्रदर्शन करते हुए कम मापदंडों के साथ पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग के बराबर पहुँचता है।

Zijun Wu, Yongchang Hao, Lili Mou2026-03-10
🔬 materials science

Automated Extraction of Material Properties using LLM-based AI Agents

यह अध्ययन एक स्वचालित, लागत प्रभावी LLM-आधारित एजेंटिक वर्कफ़्लो प्रस्तुत करता है जो लगभग 10,000 वैज्ञानिक लेखों से 27,000 से अधिक थर्मोइलेक्ट्रिक और संरचनात्मक गुण संबंधी रिकॉर्ड को सफलतापूर्वक निकालता है, जो अब तक का सबसे बड़ा LLM-क्यूरेटेड डेटासेट बनाता है और डेटा-संचालित सामग्री खोज के लिए एक स्केलेबल आधार स्थापित करता है।

Subham Ghosh, Abhishek Tewari2026-03-10
💬 NLP

FOR-Prompting: From Objection to Revision via an Asymmetric Prompting Protocol

यह शोध पत्र FOR-Prompting को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic), असममित प्रॉम्प्टिंग प्रोटोकॉल है जो एक डिफेंडर (Defender), एक क्वेश्चनर (Questioner) और एक वैकल्पिक होस्ट (Host) के बीच अंतःक्रियाओं को संरचित करके विविध कार्यों में तर्क और पुनरावृत्ति परिशोधन (iterative refinement) को बढ़ाता है, जिससे छोटे मॉडल भी बिना किसी प्रशिक्षण या मॉडल आंतरिक विवरणों तक पहुँच के, मानक बेसलाइन के तुलनीय या उससे बेहतर प्रदर्शन प्राप्त करने में सक्षम होते हैं।

He Zhang, Anzhou Zhang, Jian Dai2026-03-10
🤖 machine learning

Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks

यह शोध पत्र DialTree को पेश करता है, जो एक ट्री-आधारित डायलॉग रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो बड़े भाषा मॉडलों (LLMs) के विरुद्ध विविध और प्रभावी मल्टी-टर्न अटैक रणनीतियों को स्वायत्त रूप से खोजता है, जो मौजूदा सिंगल-टर्न या टेम्पलेट-आधारित रेड-टीमिंग विधियों से काफी बेहतर प्रदर्शन करता है।

Ruohao Guo, Afshin Oroojlooy, Roshan Sridhar, Miguel Ballesteros, Alan Ritter, Dan Roth2026-03-10
💬 NLP

HypoSpace: Evaluating LLM Creativity as Set-Valued Hypothesis Generators under Underdetermination

यह शोध पत्र HypoSpace को प्रस्तुत करता है, जो एक नैदानिक सुइट (diagnostic suite) है जो कम-निर्धारित वैज्ञानिक डोमेन में सेट-वैल्यूड परिकल्पना जनरेटर के रूप में लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए वैधता (validity), विशिष्टता (uniqueness) और रिकवरी (recovery) को मापता है ताकि उस मोड कोलैप्स (mode collapse) को प्रकट किया जा सके जिसे पारंपरिक केवल-सत्यता वाले मेट्रिक्स पहचानने में विफल रहते हैं।

Tingting Chen, Beibei Lin, Zifeng Yuan, Qiran Zou, Hongyu He, Anirudh Goyal, Yew-Soon Ong, Dianbo Liu2026-03-10