💬 NLP

Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space

यह शोधपत्र थॉटबबल्स (Thoughtbubbles) को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड ट्रांसफॉर्मर वेरिएंट है जो प्रीट्रेनिंग के दौरान रेसिडुअल स्ट्रीम्स को गतिशील रूप से फोर्क करके लेटेंट स्पेस में समानांतर अनुकूली गणना (parallel adaptive computation) करने के लिए सीखता है, जिससे यह मानक और मौजूदा समानांतर विधियों की तुलना में कम कंप्यूटेशनल बजट के साथ बेहतर परप्लेक्सिटी और रीजनिंग प्रदर्शन प्राप्त करता है।

Houjun Liu, Shikhar Murty, Christopher D. Manning, Róbert Csordás2026-02-02
💬 NLP

GraphGhost: Tracing Structures Behind Large Language Models

यह शोध पत्र GraphGhost को प्रस्तुत करता है, जो एक नवीन ग्राफ-आधारित ढांचा है जो लार्ज लैंग्वेज मॉडल्स (LLMs) में आंतरिक टोकन इंटरैक्शन और न्यूरॉन एक्टिवेशन को मॉडल करता है ताकि उनकी मल्टी-स्टेप रीजनिंग क्षमताओं के अंतर्निहित वैश्विक सूचना प्रवाह और संरचनात्मक पैटर्न को प्रकट किया जा सके।

Xinnan Dai, Xianxuan Long, Chung-Hsiang Lo, Kai Guo, Shenglai Zeng, Dongsheng Luo, Jiliang Tang2026-02-02
💬 NLP

Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स भावनाओं को एक स्थिर, निम्न-आयामी और सार्वभौमिक रूप से सामान्यीकरण योग्य लेटेंट स्पेस के भीतर एनकोड करते हैं जिसे अर्थ को सुरक्षित रखते हुए आंतरिक भावनात्मक धारणा को नियंत्रित करने के लिए प्रभावी ढंग से निर्देशित किया जा सकता है।

Benjamin Reichman, Adar Avsian, Larry Heck2026-02-02
💬 NLP

Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

यह शोध पत्र SPECS का प्रस्ताव करता है, जो एक स्व-निर्मित (self-distilled), प्राथमिकता-आधारित कोल्ड स्टार्ट फ्रेमवर्क है जो आउटपुट स्वरूपों और संरचनाओं में महारत हासिल करने के लिए आत्मनिरीक्षण संबंधी प्राथमिकता डेटा (introspective preference data) पर प्रशिक्षण देकर मल्टीमॉडल लर्निंग को विखंडित करता है, जिससे पारंपरिक सुपरवाइज्ड फाइन-ट्यूनिंग की सामान्यीकरण सीमाओं को दूर किया जा सके और डाउनस्ट्रीम सुदृढीकरण शिक्षण (reinforcement learning) प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।

Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma2026-02-02
💬 NLP

CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments

यह शोध पत्र CATArena प्रस्तुत करता है, जो एक नवीन ढांचा है जो पुनरावृत्ति टूर्नामेंटों और एक दोहरी-मापन प्रणाली के माध्यम से LLM कोड एजेंटों की विकासवादी क्षमताओं का मूल्यांकन करता है, जिससे यह पता चलता है कि प्रारंभिक दक्षता विकासवादी क्षमता की गारंटी नहीं देती है और सहकर्मी-सीखने (peer-learning) तथा आत्म-चिंतन (self-reflection) को एक साथ उपयोग करने में वर्तमान सीमाओं को उजागर करता है।

Lingyue Fu, Xin Ding, Linyue Pan, Yaoming Zhu, Shao Zhang, Lin Qiu, Weiwen Liu, Weinan Zhang, Xuezhi Cao, Xunliang Cai (…)2026-02-02
💬 NLP

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

यह शोध पत्र \textsc{Squid Game} को प्रस्तुत करता है, जो एक गतिशील और प्रतिकूल मूल्यांकन वातावरण है जिसमें छह एलिमिनेशन-शैली के स्तर शामिल हैं जो संसाधन-सीमित और विषम सूचना सेटिंग्स के तहत 50 से अधिक लार्ज लैंग्वेज मॉडल्स का परीक्षण करते हैं, जो पीढ़ीगत प्रदर्शन परिवर्तनों और स्थिर बेंचमार्क की सीमाओं को प्रकट करता है।

Zijian Chen, Wenjun Zhang, Guangtao Zhai2026-02-02
💬 NLP

What Helps Language Models Predict Human Beliefs: Demographics or Prior Stances?

यह अध्ययन इस बात का मूल्यांकन करता है कि कैसे लार्ज लैंग्वेज मॉडल्स जनसांख्यिकीय डेटा और पूर्व दृष्टिकोणों का उपयोग करके मानव विश्वासों की भविष्यवाणी करते हैं, यह पाते हुए कि हालांकि दोनों प्रकार की जानकारी को संयोजित करने से सर्वोत्तम परिणाम प्राप्त होते हैं, लेकिन उनका सापेक्ष भविष्य कहने वाला मूल्य विभिन्न विश्वास डोमेन में महत्वपूर्ण रूप से भिन्न होता है।

Joseph Malone, Rachith Aiyappa, Byunghwee Lee, Haewoon Kwak, Jisun An, Yong-Yeol Ahn2026-02-02
💬 NLP

TALES: A Taxonomy and Analysis of Cultural Representations in LLM-generated Stories

यह शोध पत्र TALES को प्रस्तुत करता है, जो सांस्कृतिक गलत प्रस्तुतियों के एक वर्गीकरण और 6 LLMs के एक बड़े पैमाने के मूल्यांकन वाला एक व्यापक ढांचा है, जो यह प्रकट करता है कि भारतीय संस्कृतियों के बारे में AI-जनित 88% कहानियों में त्रुटियां हैं, जो विशेष रूप से मध्यम और निम्न-संसाधन वाली भाषाओं तथा अर्ध-शहरी आख्यानों को प्रभावित करती हैं।

Kirti Bhagat, Shaily Bhatt, Athul Velagapudi, Aditya Vashistha, Shachi Dave, Danish Pruthi2026-02-02
💬 NLP

ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems

यह शोध पत्र ATOD प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और सिंथेटिक संवाद पीढ़ी पाइपलाइन है जिसे टास्क-ओरिएंटेड डायलॉग सिस्टम में उन्नत एजेंटिक व्यवहारों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, साथ ही इसमें ATOD-Eval फ्रेमवर्क और एक नवीन मेमोरी-आधारित इवैल्यूएटर भी शामिल है जो मल्टी-गोल कोआर्डिनेशन, लॉन्ग-टर्म रीजनिंग और प्रोएक्टिव क्षमताओं के समग्र एवं पुनरुत्पादक मूल्यांकन को सक्षम बनाता है।

Yifei Zhang, Hooshang Nayyeri, Rinat Khaziev, Emine Yilmaz, Gokhan Tur, Dilek Hakkani-Tür, Hari Thadakamalla2026-02-02
💬 NLP

AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios

यह शोध पत्र AgentIF-OneDay को प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसमें ओपन वर्कफ़्लो निष्पादन, लेटेंट इंस्ट्रक्शन इन्फरेंस और इटरेटिव रिफाइनमेंट केAcross 104 विविध दैनिक कार्य शामिल हैं, जिसे सामान्य एआई एजेंटों की प्राकृतिक भाषा निर्देशों का पालन करने और मूर्त फ़ाइल-आधारित परिणाम उत्पन्न करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान में API-आधारित और RL-उन्नत दोनों एजेंट क्षेत्र का नेतृत्व कर रहे हैं।

Kaiyuan Chen, Qimin Wu, Taiyu Hou, Tianhao Tang, Xueyu Hu, Yuchen Hou, Bikun Li, Chengming Qian, Guoyin Wang, Haolin Che (…)2026-02-02