🤖 AI

When and How Human Curation Backfires: Preference Alignment under Multi-Model Self-Consuming Loop

यह शोध पत्र प्रकट करता है कि जहाँ मानव क्यूरेशन (human curation) पृथक स्व-उपभोज्य मॉडलों (self-consuming models) में संरेखण (alignment) में सुधार करता है, वहीं इस प्रतिमान को बहु-मॉडल प्रणालियों तक विस्तारित करने से क्रॉस-मॉडल इंटरैक्शन के माध्यम से क्यूरेशन प्रभाव मंद या विपरीत हो सकते हैं, जो अंततः दीर्घकालिक संरेखण को खराब कर देते हैं।

Yang Zhang, Xiukun Wei, Xueru Zhang2026-05-29
💻 computer science

Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits

यह शोध पत्र BaSE का प्रस्ताव देने के लिए LLM-निर्देशित विकासवादी खोज (evolutionary search) की अनुभवजन्य नियमितताओं का विश्लेषण करता है, जो एक मल्टी-आर्म्ड बैंडिट एल्गोरिदम है जो समानांतर प्रक्षेप पथों (parallel trajectories) के बीच कंप्यूट को गतिशील रूप से आवंटित करता है, जिससे अंतर्निहित मॉडल या प्रॉम्प्ट्स को संशोधित किए बिना पारंपरिक डेप्थ-ब्रेड्थ रणनीतियों की तुलना में औसत फिटनेस में 12.3% सुधार और उन्नत विश्वसनीयता प्राप्त होती है।

Sixue Xing, Haoyu He, Kerui Wu, Zhuo Yang, Haozheng Luo, Tianfan Fu, Aarthy Nagarajan2026-05-29
🤖 AI

Indexing the Unreadable: LLM-Native Recursive Construction and Search of Service Taxonomies

उभरते हुए इंटरनेट ऑफ एजेंट्स में कॉन्टेक्स्ट विंडो की सीमाओं और "लॉस्ट-इन-द-मिडल" घटना को संबोधित करने के लिए, यह शोध पत्र A2X का प्रस्ताव करता है, जो एक LLM-नेटिव सिस्टम है जो सेवाओं को एक पदानुक्रमित वर्गीकरण (hierarchical taxonomy) में गतिशील रूप से व्यवस्थित करता है और मौजूदा बेसलाइनों की तुलना में टोकन खपत को नाटकीय रूप से कम करते हुए और रिट्रीवल सटीकता में उल्लेखनीय सुधार करने के लिए इसमें परत-दर-परत नेविगेट करता है।

Wei Zheng, Yang Yan, Yiyang Shao, Jinyang Li, Zeze Chang, Yukuang Jia, Qiming Mao, Chihyung Wang, Jingbin Zhou2026-05-29
🤖 AI

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA

यह शोध पत्र Code-QA-Bench को प्रस्तुत करता है, जो एक स्वचालित फ्रेमवर्क है जो एक 'आंसर-फर्स्ट' जनरेशन पाइपलाइन और 10 पायथन रिपॉजिटरीज़ में एक तीन-शर्त वाले प्रयोगात्मक डिज़ाइन का उपयोग करके, दस्तावेज़ीकरण रटने (documentation memorization) से वास्तविक कोड तर्क (genuine code reasoning) को कड़ाई से अलग करने के लिए रिपॉजिटरी-स्तरीय QA बेंचमार्क को संश्लेषित करता है।

Jun Zhang, JianYing Qu, Hanwen Du, Zhongkai Sun, Yehua Yang, Qiao Zhao2026-05-29
🤖 AI

Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces

यह शोध पत्र उत्तर-सही लॉन्ग चेन-ऑफ-थॉट ट्रेनिंग ट्रेसेस में "हानिकारक निरंतरता" (harmful continuation) की पहचान और समाधान करता है, यह प्रदर्शित करते हुए कि निष्कर्ष के बाद के तर्क को हटाने से फाइन-ट्यूनिंग के परिणाम बेहतर होते हैं और इस सीमा का पता लगाने के लिए एक हल्का तरीका, हार्मफुल कंटीन्यूएशन कट (HCC), प्रस्तावित करता है।

Chen He, Yuhao Wu, Lei Wang, Wenxuan Zhang, Fumin Shen2026-05-29
🤖 AI

GrepSeek: Training Search Agents for Direct Corpus Interaction

GrepSeek एक दो-चरणीय प्रशिक्षण पाइपलाइन पेश करता है जो एक ऐसे खोज एजेंट के लिए है जो निष्पादन योग्य शेल कमांड के माध्यम से सीधे टेक्स्ट कॉर्पोरा के साथ इंटरैक्ट करता है, जो ओपन-डोमेन प्रश्नोत्तर बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है और पारंपरिक पुनर्प्राप्ति-आधारित प्रणालियों के लिए एक व्यावहारिक, स्केलेबल विकल्प प्रदान करता है।

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi, Fernando Diaz, Hamed Zamani2026-05-29
🤖 AI

Rethinking FID Through the Geometry of the Reference Dataset

यह शोध पत्र यह प्रदर्शित करता है कि इमेज जनरेटर्स के मूल्यांकन में फ्रैच इनसेप्शन डिस्टेंस (FID) मीट्रिक की विश्वसनीयता संदर्भ डेटासेट के ज्यामितीय गुणों, विशेष रूप से इसके वितरण घनत्व (distributional density) और प्रभावी रैंक (effective rank) से मौलिक रूप से प्रभावित होती है, जिसके कारण बिखरे हुए डेटासेट्स में नमूना गुणवत्ता में सुधार होने के बावजूद भी FID खराब हो सकता है।

Yunghee Lee, Byeonghyun Pak2026-05-29
🤖 AI

ConMoE: Expert-Pool Consolidation via Prototype Reassignment for MoE Compression

ConMoE एक 'ट्रेन-फ्री' फ्रेमवर्क है जो मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडल्स को कंप्रेस करने के लिए प्रोटोटाइप एक्सपर्ट्स के एक छोटे सेट का चयन करके एक्सपर्ट पूल को समेकित करता है और मूल एक्सपर्ट कॉल्स को उन्हें नियत रूप से रिमैप करता है, जिससे बिना किसी वेट अपडेट या पोस्ट-कंप्रेशन फाइन-ट्यूनिंग के मेमोरी लागत को कम किया जा सकता है।

Yilun Yao, Jiaming Pan, Elsie Dai, Peizhuang Cong, Yaoming Li, Tong Yang2026-05-29
🤖 AI

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

यह शोध पत्र यह प्रदर्शित करता है कि स्पार्स ऑटोएनकोडर (sparse autoencoders), उत्पादन-स्तर के क्लाउड 3 सोनेट (Claude 3 Sonnet) मॉडल से व्याख्या योग्य, बहुभाषी और बहुआयामी विशेषताओं को निकालने के लिए सफलतापूर्वक स्केल कर सकते हैं, जिनमें धोखेबाजी और चापलूसी जैसे हानिकारक व्यवहारों का प्रतिनिधित्व करने वाली वे विशेषताएँ भी शामिल हैं जो आउटपुट को कार्य-कारण प्रभाव (causally influence) से प्रभावित करती हैं, जबकि यह विशेषता पूर्णता और मूल्यांकन की कठोरता में वर्तमान सीमाओं को स्वीकार करता है।

Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emman (…)2026-05-29
🤖 AI

Does Distributed Training Undermine Compute Governance?

यह शोध पत्र तर्क देता है कि वितरित प्रशिक्षण एल्गोरिदम (distributed training algorithms) में प्रगति डेवलपर्स को विकेंद्रीकृत हार्डवेयर समूहों (decentralized hardware agglomerations) का उपयोग करके कंप्यूट गवर्नेंस नियमों से बचने की अनुमति दे सकती है, जिसके लिए अवैध संचालन का पता लगाने और उन्हें रोकने के लिए चिप ट्रैकिंग, फोरेंसिक अकाउंटिंग और उन्नत निगरानी थ्रेशोल्ड जैसे नए जवाबी उपायों की आवश्यकता है।

Robi Rahman2026-05-29