💬 NLP

LUMI: Unsupervised Intent Clustering with Multiple Pseudo-Labels

यह शोध पत्र LUMI का प्रस्ताव करता है, जो संवादात्मक खोज (conversational search) में अनसुपरवाइज्ड इंटेंट क्लस्टरिंग के लिए एक ट्रेनिंग-फ्री और लेबल-फ्री विधि है, जो कई साझा स्यूडो-लेबल्स (pseudo-labels) का लाभ उठाकर टेक्स्ट के बीच समानता के निरंतर स्तरों को पकड़ने के माध्यम से मौजूदा दृष्टिकोणों में सुधार करता है, जिससे क्लस्टर संख्या के अनुमान की आवश्यकता के बिना अत्याधुनिक प्रदर्शन प्राप्त होता है।

I-Fan Lin, Faegheh Hasibi, Suzan Verberne2026-02-26
💬 NLP

A Multi-faceted Analysis of Cognitive Abilities: Evaluating Prompt Methods with Large Language Models on the CONSORT Checklist

यह अध्ययन क्लिनिकल ट्रायल रिपोर्टिंग का CONSORT मानकों के विरुद्ध मूल्यांकन करने में सामान्य और डोमेन-विशिष्ट लार्ज लैंग्वेज मॉडल्स की संज्ञानात्मक क्षमताओं और अनिश्चितता अंशांकन (uncertainity calibration) का मूल्यांकन करता है, जो महत्वपूर्ण अति-आत्मविश्वास और मिसकैलिब्रेशन को प्रकट करता है जो चिकित्सा एआई में बेहतर अंशांकन, पारदर्शिता और प्रॉम्प्ट इंजीनियरिंग की तत्काल आवश्यकता को रेखांकित करता है।

Sohyeon Jeon, Hyung-Chul Lee2026-02-26
💬 NLP

Robust Preference Alignment via Directional Neighborhood Consensus

यह शोध पत्र रोबस्ट प्रेफरेंस सिलेक्शन (RPS) को प्रस्तुत करता है, जो एक ट्रेनिंग-फ्री पोस्ट-हॉक विधि है जो श्रेष्ठ प्रतिक्रियाओं को नमूना बनाने और चुनने के लिए दिशात्मक पड़ोस सहमति (directional neighborhood consensus) का लाभ उठाती है, जिससे बिना पुन: प्रशिक्षण के विविध मानवीय आवश्यकताओं के across मॉडल की मजबूती को बढ़ाने और प्राथमिकता कवरेज अंतराल को प्रभावी ढंग से पाटने में मदद मिलती है।

Ruochen Mao, Yuling Shi, Xiaodong Gu, Jiaheng Wei2026-02-26
📊 statistics

A Proof of Learning Rate Transfer under μμP

यह शोधपत्र पहला सैद्धांतिक प्रमाण प्रदान करता है कि μ\muP यह सुनिश्चित करके अनंत-चौड़ाई वाले लीनियर MLPs के लिए लर्निंग रेट ट्रांसफर को सक्षम बनाता है कि इष्टतम लर्निंग रेट एक गैर-शून्य स्थिरांक (non-zero constant) की ओर अभिसरित होता है, जो एक ऐसा गुण है जो मानक और न्यूरल टेंगेंट पैरामीट्रिज़ेशन के तहत विफल हो जाता है।

Soufiane Hayou2026-02-26
💬 NLP

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

यह शोध पत्र रीजनिंग प्रोसेस ट्री स्कोर (RPTS) को प्रस्तुत करता है, जो मल्टीमॉडल रीजनिंग स्टेप्स की निष्ठा (faithfulness) का मूल्यांकन करने के लिए एक ट्री-स्ट्रक्चर्ड मेट्रिक है, और इसे एक नए बेंचमार्क (RPTS-Eval) के माध्यम से मान्य करता है जो इंटरमॉडल संबंधों और सही उत्तरों द्वारा छिपे हुए रीजनिंग दोषों के संबंध में वर्तमान लार्ज विजन-लैंग्वेज मॉडल्स की सीमाओं को उजागर करता है।

Haofeng Wang, Yu Zhang2026-02-26
💬 NLP

Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization

यह शोध पत्र SORL का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो लॉन्ग-होरिज़न (long-horizon) LLM एजेंटों के लिए ऑफ-पॉलिसी सुदृढीकरण शिक्षण (reinforcement learning) को स्थिर करने के लिए टर्न-लेवल इम्पॉर्टेंस सैंपलिंग और क्लिपिंग-ट्रिगर्ड नॉर्मलाइजेशन पेश करता है, जो अपने SO-PPO और SO-GRPO एल्गोरिदम के माध्यम से प्रशिक्षण पतन (training collapse) को प्रभावी ढंग से रोकता है और मल्टी-टर्न कार्यों पर प्रदर्शन में सुधार करता है।

Chenliang Li, Adel Elmahdy, Alex Boyd, Zhongruo Wang, Siliang Zeng, Alfredo Garcia, Parminder Bhatia, Taha Kass-Hout, Ca (…)2026-02-26
💬 NLP

Cross-Cultural Expert-Level Art Critique Evaluation with Vision-Language Models

यह शोध पत्र एक नवीन त्रि-स्तरीय मूल्यांकन ढांचे को प्रस्तुत करता है जो कला-सैद्धांतिक अवधारणाओं को पांच स्तरों और छह परंपराओं में क्रियान्वित करके विजन-लैंग्वेज मॉडल्स की सांस्कृतिक सक्षमता के आकलन में व्याप्त अंतराल को पाटता है, जिससे यह पता चलता है कि वर्तमान मॉडल दृश्य विवरण में तो उत्कृष्ट हैं लेकिन सांस्कृतिक व्याख्या में काफी कमज़ोर हो जाते हैं और साथ ही पश्चिमी पूर्वाग्रह प्रदर्शित करते हैं।

Haorui Yu, Xuehang Wen, Fengrui Zhang, Qiufeng Yi2026-02-26
💬 NLP

VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding

यह शोधपत्र VULCA-Bench को प्रस्तुत करता है, जो एक बहुसांस्कृतिक विजन-लैंग्वेज बेंचमार्क है जिसमें आठ सांस्कृतिक परंपराओं के बीच 7,410 द्विभाषी छवि-आलोचना युग्म और एक पांच-स्तरीय मूल्यांकन ढांचा शामिल है, जिसका उद्देश्य बुनियादी दृश्य धारणा से परे उच्च-स्तरीय सांस्कृतिक समझ में वर्तमान मॉडलों की सीमाओं का आकलन और प्रदर्शन करना है।

Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi2026-02-26
💬 NLP

FigEx2: Visual-Conditioned Panel Detection and Captioning for Scientific Compound Figures

यह शोधपत्र FigEx2 प्रस्तुत करता है, जो एक विज़ुअल-कंडीशन्ड फ्रेमवर्क है जो एक नॉइज़-अवेयर गेटेड फ्यूजन मॉड्यूल और सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) के साथ एक स्टेज्ड ऑप्टिमाइज़ेशन स्ट्रैटेजी का उपयोग करके वैज्ञानिक कंपाउंड आकृतियों में व्यक्तिगत पैनलों को स्थानीयकृत और कैप्शन करता है, जिससे विविध वैज्ञानिक डोमेन में उत्कृष्ट प्रदर्शन और ज़ीरो-शॉट ट्रांसफ़रेबिलिटी हासिल होती है।

Jifeng Song, Arun Das, Pan Wang, Hui Ji, Kun Zhao, Yufei Huang2026-02-26
💬 NLP

HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue

यह शोध पत्र HEART को प्रस्तुत करता है, जो एक एकीकृत बेंचमार्क है जो विज्ञान-आधारित मापदंडों का उपयोग करके भावनात्मक समर्थन संवादों में मनुष्यों और बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की सीधे तुलना करता है, जिससे यह पता चलता है कि हालांकि अत्याधुनिक मॉडल सहानुभूति और निरंतरता में मानव स्तरों के करीब पहुँच रहे हैं, फिर भी मनुष्य अनुकूलन योग्य रिफ्रेमिंग और सूक्ष्म टोन बदलावों में उत्कृष्ट प्रदर्शन करते हैं, और यह सब मानव और स्वचालित मूल्यांकन मानदंडों के बीच मजबूत संरेखण प्रदर्शित करते हुए होता है।

Laya Iyer, Kriti Aggarwal, Sanmi Koyejo, Gail Heyman, Desmond C. Ong, Subhabrata Mukherjee2026-02-26