🤖 AI

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

यह शोध पत्र संकुचित चेन-ऑफ-थॉट रीजनिंग (एक्सप्लिसिट, कंपोज़्ड और इम्प्लिसिट) का एक वर्गीकरण प्रस्तुत करता है और नियंत्रित प्रयोगों के माध्यम से यह प्रदर्शित करता है कि जहाँ मोटे तौर पर की गई रीजनिंग के लिए अधिक डेटा की आवश्यकता होती है और इसमें विशिष्ट स्केलिंग एवं मेमोराइजेशन व्यवहार दिखाई देते हैं, वहीं सत्यापन योग्य पुरस्कारों (वेरिफिएबल रिवार्ड्स) के साथ आगामी सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग), सुपरवाइज्ड फाइन-ट्यूनिंग के दौरान सीखे गए इन संकुचित चरणों को प्रभावी ढंग से विघटित कर सकता है।

Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo2026-05-28
💬 NLP

MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models

MemGuard एक प्रकार-जागरूक (type-aware) मेमोरी फ्रेमवर्क है जो स्मरणीयों (memories) को स्पष्ट कार्यात्मक भूमिकाएँ सौंपकर और साक्ष्यों को चुनिंदा रूप से संयोजित करके दीर्घकालिक मेमोरी-संवर्धित (memory-augmented) LLMs में विषम मेमोरी संदूषण (heterogeneous memory contamination) को रोकता है, जिससे विश्वसनीयता और पुनर्प्राप्ति दक्षता (retrieval efficiency) में महत्वपूर्ण सुधार होता है।

Hyeonjeong Ha, Jeonghwan Kim, Cheng Qian, Jiayu Liu, William M. Campbell, Yue Wu, Yuji Zhang, Kathleen McKeown, Dilek Ha (…)2026-05-28
🤖 AI

Confidence-Orchestrated Self-Evolution against Uncertain LLM Feedback

यह शोध पत्र COSE का प्रस्ताव करता है, जो एक स्व-विकसित (self-evolving) ढांचा है जो आत्मविश्वास-भारित (confidence-weighted) PPO अपडेट और प्राथमिकता वाले रिप्ले (prioritized replay) के माध्यम से सीखने को नियंत्रित करने के लिए एक LLM के अंतर्निहित आत्मविश्वास का लाभ उठाता है, जो प्रभावी रूप से त्रुटिपूर्ण स्व-निर्णयों के जोखिमों को कम करता है और तर्क एवं गणितीय बेंचमार्क में उत्कृष्ट प्रदर्शन प्राप्त करता है।

Bowen Wei, Nan Wang, Yuqing Zhou, Jinhao Pan, Ziwei Zhu2026-05-28
💬 NLP

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

यह शोध पत्र VCap का प्रस्ताव करता है, जो एक नवीन विटनेस-एडजुडिकेटर (witness-adjudicator) रिवॉर्ड तंत्र है जो संदर्भ और जनरेट किए गए कैप्शन के बीच तथ्यात्मक निरंतरता को सत्यापित करने के लिए हाइपरजियोमेट्रिक-डिस्ट्रीब्यूशन-लेवल परिशुद्धता का लाभ उठाता है, जिससे सुदृढीकरण शिक्षण (reinforcement learning) में कमजोर-से-मजबूत सामान्यीकरण (weak-to-strong generalization) सक्षम होता है जो एक 8B मॉडल को अत्याधुनिक विजुअल कैपशनिंग प्रणालियों से बेहतर प्रदर्शन करने की अनुमति देता है।

Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Ti (…)2026-05-28
🤖 machine learning

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

यह शोध पत्र SPARD का प्रस्ताव करता है, जो एक रक्षा ढांचा (defense framework) है जो हानिकारक फाइन-ट्यूनिंग हमलों को प्रभावी ढंग से कम करने और कार्य प्रदर्शन को बनाए रखने के लिए सेफ्टी-प्रोजेक्टेड अल्टरनेटिंग ऑप्टिमाइज़ेशन (Safety-Projected Alternating optimization) को रिलेवेंस-डाइवर्सिटी अवेयर डेटा चयन (Relevance-Diversity aware data selection) के साथ जोड़ता है।

Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang2026-05-28
🤖 AI

Clark Hash: Stateless Sparse Johnson-Lindenstrauss Quantization for Neural Embeddings

क्लार्क हैश (Clark Hash) एक स्टेटलेस, ट्रेनिंग-मुक्त कोडेक है जो न्यूरल एम्बेडिंग्स को कॉम्पैक्ट 48-बाइट स्पार्स साइन्ड जॉनसन-लिंडेनस्ट्रास स्केचेस (sparse signed Johnson-Lindenstrauss sketches) में संकुचित करता है, जिससे बिना किसी सीखे गए कोडबुक या पूर्व-निर्धारित सांख्यिकी की आवश्यकता के, उच्च कोसाइन-सिमिलरिटी सर्च सटीकता बनाए रखते हुए 32x स्टोरेज रिडक्शन प्राप्त किया जाता है।

Stanislav Kirdey, Clark Labs Inc2026-05-28
🤖 AI

MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents

यह शोधपत्र MemCog को प्रस्तुत करता है, जो एक "मेमोरी-एज़-कॉग्निशन" (स्मृति-के-रूप-में-संज्ञान) ढांचा है जो निष्क्रिय, एक-बार के रिट्रीवल (पुनर्प्राप्ति) को नेविगेबल मेमोरी ग्राफ और सक्रिय अन्वेषण प्रोटोकॉल वाले एक सक्रिय, तर्क-एकीकृत सिस्टम से बदल देता है, जिससे यह पैसिव क्यूए (QA) और एक नए प्रस्तावित प्रोएक्टिव मेमोरी बेंचमार्क दोनों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zihan Li, Xingyu Fan, Feifei Li, Wenhui Que2026-05-28
🤖 machine learning

On the Learnability of Test-Time Adaptation: A Recovery Complexity Perspective

यह शोधपत्र (ϵ,δ)(\epsilon,\delta)-रिकवरी कॉम्प्लेक्सिटी (Recovery Complexity) और (ϵ,ρ)(\epsilon,\rho)-TTA लर्नैबिलिटी (Learnability) को पेश करके टेस्ट-टाइम अडैप्टेशन (TTA) के लिए पहला सैद्धांतिक ढांचा स्थापित करता है, ताकि गैर-स्थिर (non-stationary) टेस्ट स्ट्रीम्स के अनुकूल मॉडल बनाने की मौलिक सीमाओं, अनुकूलनशीलता-सूचना व्यापार-संबंधों (adaptivity-information trade-offs), और दीर्घकालिक विश्वसनीयता का लक्षण वर्णन किया जा सके।

Zhi Zhou, Ming Yang, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo, Yu-Feng Li2026-05-28
🤖 AI

Verifiable Benchmarking of Long-Horizon Spatial Biology

यह शोधपत्र SpatialBench-Long को प्रस्तुत करता है, जो विविध स्थानिक जीव विज्ञान (spatial biology) डेटासेट्स के माध्यम से 24 मूल्यांकनों वाला एक कठोर बेंचमार्क है, जिसे एआई एजेंटों की पूर्व-निर्धारित विधियों के बिना कच्चे डेटा से सटीक वैज्ञानिक निष्कर्ष निकालने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान शीर्ष मॉडल इन जटिल, दीर्घकालिक तर्क कार्यों (long-horizon reasoning tasks) में केवल 11.1% सफलता दर प्राप्त करते हैं।

Ian Diks, Harihara Muralidharan, Tim Proctor, Kenny Workman2026-05-28
💬 NLP

PromptEmbedder:: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting

PromptEmbedder एक नवीन dual-LLM फ्रेमवर्क पेश करता है जो सॉफ्ट प्रॉम्प्टिंग के माध्यम से एम्बेडिंग ज्ञान को विशिष्ट बैकबोन वेट्स से अलग करता है, जिससे कुशल, आर्किटेक्चर-अज्ञेय टेक्स्ट एम्बेडिंग अनुकूलन सक्षम होता है जो LoRA के प्रदर्शन से मेल खाता है और साथ ही मेमोरी उपयोग और प्रशिक्षण समय को काफी कम कर देता है।

Yu-Che Tsai, Kuan-Yu Chen, Yuan-Hao Chen, Yu-Han Chang, Ching-Yu Tsai, Yu-Hsiang Chuang, Shou-De Lin2026-05-28