🤖 machine learning

The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation

यह शोध पत्र "रिस्पॉन्स होमोजेनाइजेशन" (प्रतिक्रिया समरूपीकरण) को RLHF-प्रशिक्षित भाषा मॉडलों में एक महत्वपूर्ण अलाइनमेंट टैक्स के रूप में पहचानता है जो सैंपलिंग-आधारित अनिश्चितता अनुमान को अप्रभावी बनाता है, यह प्रदर्शित करता है कि टोकन एंट्रॉपी एक मजबूत संकेत बनी रहती है और चयनात्मक भविष्यवाणी सटीकता में सुधार करने के लिए एक लागत-कुशल कैस्केड रणनीति का प्रस्ताव करता है।

Mingyi Liu2026-03-26
💬 NLP

A visual observation on the geometry of UMAP projections of the difference vectors of antonym and synonym word pair embeddings

यह शोध पत्र विभिन्न ट्रांसफॉर्मर मॉडलों में विलोम (antonym) और समानार्थी (synonym) शब्द युग्म एम्बेडिंग के बीच अंतर वेक्टरों के ज्यामितीय प्रक्षेपों में देखे गए एक जिज्ञासु "भंवर" (swirl) पैटर्न की रिपोर्ट करता है, जो अर्थ संबंधी विरोध के अंतर्निहित जटिल स्थानिक संरचनाओं को उजागर करता है।

Rami Luisto2026-03-26
💬 NLP

Variation is the Norm: Embracing Sociolinguistics in NLP

यह शोधपत्र एक ऐसे ढांचे का प्रस्ताव करता है जो भाषाई भिन्नता को शोर के बजाय एक सार्थक विशेषता के रूप में मानने के लिए प्राकृतिक भाषा प्रसंस्करण (Natural Language Processing) में समाजभाषावैज्ञानिक सिद्धांतों को एकीकृत करता है, और एक लक्ज़मबर्ग अध्ययन के माध्यम से यह प्रदर्शित करता है कि फाइन-ट्यूनिंग के दौरान वर्तनी संबंधी भिन्नता को स्पष्ट रूप से ध्यान में रखने से मॉडल की मजबूती और प्रदर्शन में उल्लेखनीय सुधार होता है।

Anne-Marie Lutgen, Alistair Plum, Verena Blaschke, Barbara Plank, Christoph Purschke2026-03-26
💬 NLP

Optimizing Multilingual LLMs via Federated Learning: A Study of Client Language Composition

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स के बहुभाषी फेडेरेटेड लर्निंग पर क्लाइंट की भाषाई संरचना के प्रभाव की जांच करता है, जो यह प्रदर्शित करता है कि क्लाइंट के भीतर बहुभाषता को बढ़ाने से वैश्विक मॉडल अधिक निष्पक्ष और प्रभावी होते हैं, विशेष रूप से कम संसाधन वाली भाषाओं के लिए, जबकि प्रशिक्षण दक्षता को बढ़ाने के लिए एक नवीन लोकल डायनेमिक अर्ली स्टॉपिंग तंत्र पेश करता है।

Aleix Sant, Jordi Luque, Carlos Escolano2026-03-26
💬 NLP

Semantic Centroids and Hierarchical Density-Based Clustering for Cross-Document Software Coreference Resolution

यह शोध पत्र क्रॉस-डॉक्यूमेंट सॉफ्टवेयर कोरेफरेंस रेजोल्यूशन के लिए एक हाइब्रिड फ्रेमवर्क प्रस्तुत करता है जो कई साझा कार्य उप-कार्यों (shared task subtasks) में उच्च F1 स्कोर प्राप्त करने के लिए सिमेंटिक एम्बेडिंग्स, FAISS के माध्यम से नॉलेज बेस लुकअप और HDBSCAN क्लस्टरिंग को एकीकृत करता है।

Julia Matela, Frank Krüger2026-03-26
⚛️ quantum physics

SpinGQE: A Generative Quantum Eigensolver for Spin Hamiltonians

यह शोध पत्र SpinGQE पेश करता है, जो एक जनरेटिव क्वांटम आइजनसॉल्वर है जो स्पिन हैमिल्टोनियन के ग्राउंड स्टेट्स खोजने के लिए क्वांटम सर्किटों पर वितरण सीखने हेतु एक ट्रांसफार्मर-आधारित डिकोडर का उपयोग करता है, जो पारंपरिक वेरिएशनल विधियों के एक स्केलेबल विकल्प के रूप में चार-क्यूबिट हाइजेनबर्ग मॉडल पर सफल अभिसरण प्रदर्शित करता है।

Alexander Holden, Moinul Hossain Rahat, Nii Osae Osae Dade2026-03-26
💬 NLP

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

यह शोध पत्र GameplayQA प्रस्तुत करता है, जो एक नवीन बेंचमार्किंग फ्रेमवर्क है जो उच्च-आवृत्ति वाले, त्रिपक्षीय एनोटेशन के माध्यम से सघन, प्रथम-व्यक्ति बहु-एजेंट 3D गेमप्ले को समझने और उसके बारे में तर्क करने की मल्टीमॉडल LLMs की क्षमता का मूल्यांकन करता है, जो मानव प्रदर्शन की तुलना में वर्तमान मॉडलों की टेम्पोरल ग्राउंडिंग, एजेंट एट्रिब्यूशन और निर्णय लेने की क्षमताओं में महत्वपूर्ण अंतराल को प्रकट करता है।

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun2026-03-26
💬 NLP

Improving Lean4 Autoformalization via Cycle Consistency Fine-tuning

यह शोध पत्र प्रदर्शित करता है कि फाइन-ट्यूनिंग Qwen3.5-2B को साइकिल कंसिस्टेंसी रिवॉर्ड (cycle consistency reward) का उपयोग करते हुए सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से करने पर, FineLeanCorpus और PutnamBench दोनों पर Lean4 ऑटोफॉर्मलाइजेशन (autoformalization) में सुपरवाइज्ड फाइन-ट्यूनिंग वेरिएंट्स की तुलना में काफी बेहतर प्रदर्शन करता है, जबकि करिकुलम लर्निंग (curriculum learning) कोई मापने योग्य लाभ प्रदान नहीं करता है।

Arsen Shebzukhov2026-03-26
💬 NLP

Towards Reward Modeling for AI Tutors in Math Mistake Remediation

यह शोध पत्र मानव प्राथमिकताओं से एक शैक्षणिक पदानुक्रम (pedagogical hierarchy) व्युत्पन्न करके, विरोधाभासी प्रतिक्रिया युग्मों (contrastive response pairs) को संश्लेषित करके, और एक संक्षिप्त 0.5B-पैरामीटर वाले ब्रैडली-टेरी रिवॉर्ड मॉडल को प्रशिक्षित करके AI गणित ट्यूटर्स के मूल्यांकन की चुनौती को संबोधित करता है, जो मानव प्राथमिकता परीक्षणों पर 0.74 की युग्म सटीकता (pairwise accuracy) प्राप्त करता है और बड़े सामान्य-उद्देश्य वाले मॉडलों से बेहतर प्रदर्शन करता है।

Kseniia Petukhova, Ekaterina Kochmar2026-03-26
💬 NLP

OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework

यह शोध पत्र OneSearch-V2 को प्रस्तुत करता है, जो एक लेटेंट रीजनिंग-एन्हांस्ड सेल्फ-डिस्टिलेशन जेनेरेटिव सर्च फ्रेमवर्क है जो तीन प्रमुख नवाचारों के माध्यम से क्वेरी की समझ में सुधार करता है, सटीक उपयोगकर्ता इरादों को उजागर करता है और व्यक्तिगत प्राथमिकताओं के साथ संरेखित होता है, जिसके परिणामस्वरूप ई-कॉमर्स सर्च में इन्फरेंस लागत बढ़ाए बिना महत्वपूर्ण ऑफलाइन और ऑनलाइन प्रदर्शन लाभ प्राप्त होते हैं।

Ben Chen, Siyuan Wang, Yufei Ma, Zihan Liang, Xuxin Zhang, Yue Lv, Ying Yang, Huangyu Dai, Lingtao Mao, Tong Zhao, Zhipe (…)2026-03-26