🤖 AI

Positional Encoding via Token-Aware Phase Attention

यह शोध पत्र टोकन-अवेयर फेज अटेंशन (TAPA) को प्रस्तुत करता है, जो एक नवीन पोजीशनल एनकोडिंग विधि है जो एक सीखने योग्य फेज फंक्शन को शामिल करके RoPE की अंतर्निहित दीर्घ-रेंज मॉडलिंग सीमाओं पर विजय प्राप्त करती है, जिससे न्यूनतम अतिरिक्त प्रशिक्षण के साथ दीर्घ-संदर्भ परिदृश्यों में बेहतर परप्लेक्सिटी और रिट्रीवल प्रदर्शन प्राप्त होता है।

Yu Wang, Sheng Shen, Rémi Munos, Hongyuan Zhan, Yuandong Tian2026-05-12
💬 NLP

LogitTrace: Detecting Benchmark Contamination via Layerwise Logit Trajectories

यह शोध पत्र LogitTrace प्रस्तुत करता है, जो एक ऐसा ढांचा है जो याद किए गए उदाहरणों के शुरुआती प्रतिबद्धता पैटर्न और वास्तविक रूप से तर्कसंगत प्रतिक्रियाओं के क्रमिक साक्ष्य संचय के बीच अंतर करने के लिए लेयरवाइज लॉजिट प्रक्षेप पथों (layerwise logit trajectories) का विश्लेषण करके लार्ज लैंग्वेज मॉडल्स में बेंचमार्क संदूषण (benchmark contamination) का पता लगाता है।

Zirui He, Haiyan Zhao, Yingcong Li, Ali Payani, Mengnan du2026-05-12
🤖 AI

Users as Annotators: LLM Preference Learning from Comparison Mode

यह शोध पत्र एक अपेक्षा-अधिकतमीकरण (expectation-maximization) एल्गोरिदम पेश करके LLM तुलना मोड से प्राप्त उपयोगकर्ता-जनित युग्म-वरीयता डेटा का लाभ उठाने के लिए एक विधि प्रस्तावित करता है, जो विषम मॉडल प्रतिक्रियाओं के माध्यम से अंतर्निहित उपयोगकर्ता गुणवत्ता कारकों का अनुमान लगाता है, जिससे प्रभावी डेटा फ़िल्टरिंग और बेहतर LLM संरेखण सक्षम होता है।

Zhongze Cai, Xiaocheng Li2026-05-12
🤖 machine learning

LILO: Bayesian Optimization with Natural Language Feedback

यह शोध पत्र LILO को प्रस्तुत करता है, जो एक ऐसा बेयसियन ऑप्टिमाइज़ेशन फ्रेमवर्क है जो मुक्त-रूप प्राकृतिक भाषा फीडबैक को संरचित प्राथमिकता संकेतों में बदलने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे पारंपरिक तरीकों की तुलना में जटिल, व्यक्तिपरक उद्देश्यों को अनुकूलित करने में नमूना दक्षता और लचीलेपन को बढ़ाया जा सके।

Katarzyna Kobalczyk, Zhiyuan Jerry Lin, Benjamin Letham, Zhuokai Zhao, Maximilian Balandat, Eytan Bakshy2026-05-12
🤖 machine learning

TELL-TALE: Task Efficient LLMs with Task Aware Layer Elimination

यह शोध पत्र TALE को पेश करता है, जो एक इन्फरेंस-टाइम विधि है जो बिना पुनरप्रशिक्षण (retraining) के कार्य-विशिष्ट प्रदर्शन को अनुकूलित करने और कम्प्यूटेशनल लागत को कम करने के लिए लार्ज लैंग्वेज मॉडल्स में अप्रासंगिक परतों (layers) को गतिशील रूप से समाप्त करती है।

Omar Naim, Krish Sharma, Niyar R Barman, Nicholas Asher2026-05-12
🤖 machine learning

Complete Evidence Extraction with Model Ensembles: A Case Study on Medical Coding

यह शोध पत्र उच्च-जोखिम वाले मेडिकल कोडिंग के लिए एक पूर्ण साक्ष्य निष्कर्षण कार्य (evidence extraction task) प्रस्तुत करता है और यह प्रदर्शित करता है कि मॉडलों के एक छोटे समूह (एक राशोमोन एनसेम्बल) से टोकन-स्तरीय एट्रिब्यूशन को एकत्रित करना, व्यक्तिगत मॉडलों की तुलना में न्यूनतम ओवरहेड के साथ साक्ष्य रिकॉल (evidence recall) में महत्वपूर्ण सुधार करता है।

Katharina Beckh, Sven Heuser, Stefan Rüping2026-05-12
💬 NLP

Attention Grounded Enhancement for Visual Document Retrieval

यह शोध पत्र AGREE का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स से क्रॉस-मोडल अटेंशन का लाभ उठाकर प्रॉक्सी सुपरविजन के रूप में विजुअल डॉक्यूमेंट रिट्रीवर्स को सूक्ष्म, रीजन-लेवल प्रासंगिकता सीखने के लिए निर्देशित करता है, जिससे ग्लोबल-सुपरविजन-ओनली बेसलाइन्स की तुलना में जटिल, नॉन-एक्सट्रैक्टिव क्वेरीज पर प्रदर्शन में उल्लेखनीय सुधार होता है।

Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi2026-05-12
🤖 AI

Auditing Data Membership in Reinforcement Learning With Verifiable Rewards

यह शोध पत्र डाइवर्जेंस-इन-बिहेवियर ऑडिटिंग (DIBA) को प्रस्तुत करता है, जो एक व्हाइट-बॉक्स फ्रेमवर्क है जो प्री- और पोस्ट-RLVR मॉडल चेकपॉइंट्स के बीच व्यवहार संबंधी और रिवॉर्ड-साइड वितरण बदलावों का विश्लेषण करके, वेरिफिएबल रिवार्ड्स के साथ रिइन्फोर्समेंट लर्निंग (RLVR) में अनधिकृत डेटा एक्सपोज़र का प्रभावी ढंग से पता लगाता है, और मौजूदा मेंबरशिप इन्फरेंस बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Yule Liu, Heyi Zhang, Jinyi Zheng, Zhen Sun, Zifan Peng, Jiaheng Wei, Tianshuo Cong, Yilong Yang, Xinlei He2026-05-12
🤖 machine learning

MapFormer: Self-Supervised Learning of Cognitive Maps with Input-Dependent Positional Embeddings

यह शोध पत्र MapFormer प्रस्तुत करता है, जो एक नवीन ट्रांसफार्मर-आधारित आर्किटेक्चर है जो अनसुपरवाइज्ड कॉग्निटिव मैप्स सीखने के लिए ली-एल्जेब्रा जनरेटर्स से प्राप्त इनपुट-डिपेंडेंट पोजीशनल एम्बेडिंग्स का उपयोग करता है, जिससे मौजूदा एआई मॉडलों की तुलना में विविध कॉग्निटिव कार्यों में बेहतर आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन और स्केलेबिलिटी प्राप्त होती है।

Victor Rambaud, Salvador Mascarenhas, Yair Lakretz2026-05-12
🤖 machine learning

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

यह शोध पत्र 'प्लास्टिसिटी-सीलिंग फ्रेमवर्क' (Plasticity-Ceiling Framework) को पेश करता है ताकि यह प्रदर्शित किया जा सके कि बड़े पैमाने के डेटा के साथ SFT के स्थिर या हल्के ओवरफिटिंग वाले शासन (regime) में शुरू की गई एक क्रमिक SFT-फिर-RL पाइपलाइन, सिंक्रोनाइज्ड दृष्टिकोणों से बेहतर प्रदर्शन करती है और LLMs में गणितीय तर्क क्षमताओं को अधिकतम करने के लिए "लेस इज़ मोर" (Less is More) परिकल्पना को खारिज करती है।

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei M (…)2026-05-12