💬 NLP

Entropy Sentinel: Continuous LLM Accuracy Monitoring from Decoding Entropy Traces in STEM

यह शोध पत्र यह प्रदर्शित करता है कि LLM डिकोडिंग ट्रेसेस से प्राप्त आउटपुट-एन्ट्रॉपी प्रोफाइल, डोमेन शिफ्ट के तहत स्लाइस-स्तरीय सटीकता का अनुमान लगाने के लिए एक प्रभावी इन्फरेंस-टाइम सिग्नल के रूप में कार्य कर सकते हैं, जिससे विविध STEM रीजनिंग कार्यों में स्केलेबल मॉनिटरिंग और लक्षित डेटा अधिग्रहण सक्षम होता है।

Pedro Memoli Buffa, Luciano Del Corro2026-03-04
💬 NLP

Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs

यह शोध पत्र एक ऐसे ढांचे का प्रस्ताव करता है जो उपयोगकर्ता की प्राथमिकताओं को फ़िल्टर और संरेखित करने के लिए स्थिर व्यक्तित्व लक्षणों (stable personality traits) को गुप्त संकेतों (latent signals) के रूप में उपयोग करता है, यह प्रदर्शित करते हुए कि व्यक्तित्व-संगत प्राथमिकताओं पर LLMs को कंडीशन करने से व्यक्तिगत प्रश्न-उत्तर सटीकता में महत्वपूर्ण सुधार होता है और PACIFIC का परिचय देता है, जो व्यक्तित्व-लेबल वाले प्राथमिकता कथनों का एक नया डेटासेट है।

Tianyu Zhao, Siqi Li, Yasser Shoukry, Salma Elmalaki2026-03-04
💬 NLP

Super Research: Answering Highly Complex Questions with Large Language Models through Super Deep and Super Wide Research

यह शोध पत्र "सुपर रिसर्च" (Super Research) प्रस्तुत करता है, जो एक नवीन कार्य और बेंचमार्क है जिसे संरचित योजना (structured planning), सुपर-वाइड रिट्रीवल (super-wide retrieval) और सुपर-डीप इटरेटिव इन्वेस्टिगेशन (super-deep iterative investigation) को एकीकृत करके अत्यधिक जटिल प्रश्नों को हल करने की लार्ज लैंग्वेज मॉडेल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसे पांच महत्वपूर्ण आयामों में प्रदर्शन का आकलन करने के लिए एक ग्राफ-एंकर ऑडिटिंग प्रोटोकॉल द्वारा समर्थित किया गया है।

Yubo Dong, Nianhao You, Yuxuan Hou, Zixun Sun, Yue Zhang, Liang Zhang, Siyuan Zhao, Hehe Fan2026-03-04
💬 NLP

ClinConsensus: A Consensus-Based Benchmark for Evaluating Chinese Medical LLMs across Difficulty Levels

यह शोध पत्र ClinConsons को प्रस्तुत करता है, जो एक व्यापक चीनी चिकित्सा बेंचमार्क है जिसमें देखभाल के पूर्ण सातत्य (कंटीन्यूम) में विशेषज्ञ-क्यूरेटेड, ओपन-एंडेड 2,500 मामले शामिल हैं, जो वर्तमान लार्ज लैंग्वेज मॉडल्स में महत्वपूर्ण प्रदर्शन विषमता और तर्क संबंधी अंतराल को उजागर करने के लिए एक नवीन निरंतरता स्कोरिंग मीट्रिक और एक दोहरी-जज मूल्यांकन ढांचे का उपयोग करता है।

Xiang Zheng, Han Li, Wenjie Luo, Weiqi Zhai, Yiyuan Li, Chuanmiao Yan, Tianyi Tang, Yubo Ma, Kexin Yang, Dayiheng Liu, H (…)2026-03-04
🧬 biology

A Zipf-preserving, long-range correlated surrogate for written language and other symbolic sequences

यह शोध पत्र एक नवीन सरोगेट मॉडल प्रस्तुत करता है जो फ्रैक्शनल गॉसियन नॉइज़ को मूल हिस्टोग्राम पर मैप करके भाषा और डीएनए जैसे प्रतीकात्मक अनुक्रमों के अनुभवजन्य प्रतीक आवृत्ति वितरण (जैसे जिप का नियम) और दीर्घ-रेंज सहसंबंध संरचनाओं को एक साथ संरक्षित करता है, जिससे संरचनात्मक विशेषताओं के पृथक्करण और स्केलिंग लॉ के उद्गम के परीक्षण को सक्षम बनाया जा सके।

Marcelo A. Montemurro, Mirko Degli Esposti2026-03-04
💬 NLP

Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain

यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स में सतत आत्म-विकास के लिए एक स्व-संश्लेषित डेटा पाइपलाइन की आवश्यकता होती है जो बढ़ती हुई सीखने योग्य सूचना प्राप्ति (learnable information gain) को सुनिश्चित करे, जिसे भंगुर सेल्फ-प्ले (brittle self-play) की सीमाओं को दूर करने के लिए विषम सह-विकास (asymmetric co-evolution), क्षमता वृद्धि और सक्रिय सूचना अन्वेषण द्वारा संवर्धित त्रयी प्रस्तावक-समाधानकर्ता-सत्यापनकर्ता (Proposer-Solver-Verifier) ढांचे के माध्यम से प्राप्त किया जा सके।

Wei Liu, Siya Qi, Yali Du, Yulan He2026-03-04
💬 NLP

Routing Absorption in Sparse Attention: Why Random Gates Are Hard to Beat

यह शोध पत्र प्रदर्शित करता है कि एंड-टू-एंड स्पार्स अटेंशन ट्रेनिंग "रूटिंग एब्जॉर्प्शन" (routing absorption) से ग्रस्त होती है, जहाँ मॉडल के Q/K/V प्रोजेक्शन किसी भी आरोपित मास्क के साथ सह-अनुकूलित (co-adapt) हो जाते हैं, जिससे सीखे गए गेटिंग मैकेनिज्म रैंडम गेट्स की तुलना में अप्रभावी हो जाते हैं और यह सुझाव मिलता है कि पोस्ट-हॉक स्पर्सिफिकेशन (post-hoc sparsification) एक बेहतर विकल्प है।

Keston Aquino-Michaels2026-03-04
💬 NLP

HELIOS: Harmonizing Early Fusion, Late Fusion, and LLM Reasoning for Multi-Granular Table-Text Retrieval

HELIOS एक बहु-स्तरीय (multi-granular) टेबल-टेक्स्ट रिट्रीवल के लिए एक नवीन फ्रेमवर्क है जो मौजूदा अर्ली और लेट फ्यूजन विधियों की सीमाओं को दूर करने के लिए एज-आधारित बाइपार्टाइट सबग्राफ रिट्रीवल, क्वेरी-संबंधित नोड एक्सपेंशन और स्टार-आधारित LLM रिफाइनमेंट को सामंजस्यपूर्ण बनाता है, जिससे ओपन-डोमेन प्रश्नोत्तर बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Sungho Park, Joohyung Yun, Jongwuk Lee, Wook-Shin Han2026-03-04
💬 NLP

Universal Conceptual Structure in Neural Translation: Probing NLLB-200's Multilingual Geometry

यह शोध पत्र यह प्रदर्शित करता है कि मेटा के NLLB-200 अनुवाद मॉडल ने मानव भाषाओं की वंशावली संरचना और सार्वभौमिक वैचारिक संघों, दोनों को अंतर्निहित रूप से सीखा है, जो बहुभाषी शाब्दिक संगठन के संज्ञानात्मक सिद्धांतों के अनुरूप एक भाषा-तटस्थ वैचारिक भंडार के लिए ज्यामितीय साक्ष्य प्रदान करता है।

Kyle Elliott Mathewson2026-03-04
💬 NLP

Characterizing Memorization in Diffusion Language Models: Generalized Extraction and Sampling Effects

यह शोध पत्र एक सैद्धांतिक और अनुभवजन्य ढांचा प्रस्तुत करता है जो यह प्रदर्शित करता है कि जबकि डिफ्यूजन लैंग्वेज मॉडल्स (DLMs) सैंपलिंग रेजोल्यूशन के साथ बढ़ती संभावना के साथ प्रशिक्षण डेटा को याद रख सकते हैं, वे अलाइन्ड प्रीफिक्स-कंडीशन्ड मूल्यांकन के तहत ऑटोरेग्रेसिव मॉडल्स की तुलना में व्यक्तिगत रूप से पहचान योग्य जानकारी (PII) का काफी कम रिसाव प्रदर्शित करते हैं।

Xiaoyu Luo, Wenrui Yu, Qiongxiu Li, Johannes Bjerva2026-03-04