🤖 machine learning

Reference-Based Distillation Detection in LLMs

यह शोध पत्र एक संदर्भ-आधारित डिस्टिलेशन डिटेक्शन (distillation detection) पद्धति प्रस्तुत करता है जो हिडन पाइपलाइनों वाले जटिल वास्तविक परिदृश्यों में भी, छात्र मॉडलों के आउटपुट की तुलना उनके पूर्ववर्ती वंश चेकपॉइंट्स (lineage checkpoints) से करके, मेंबरशिप इन्फरेंस (membership inference) और प्रॉक्सी प्रॉम्प्ट इन्फरेंस (proxy prompt inference) का लाभ उठाकर, शिक्षक मॉडलों की सटीक पहचान करने और एलएलएम (LLMs) में डिस्टिलेशन का पता लगाने के लिए उपयोग किया जाता है।

Rajat Rawat, Sizhe Chen, Akshay Anand, Michael Duan, Bob Rotsted, Sewon Min2026-07-14
🤖 AI

Norm Enforcement for AI Agents: Robustly Shaping Behavior in Multi-Agent Systems

यह शोध पत्र यह प्रदर्शित करता है कि एआई एजेंटों के लिए सुदृढ़ मानक प्रवर्तन तंत्र, जो गतिशील विश्वसनीयता अनुमान और बढ़ते दंड को शामिल करते हैं, उन बहु-एजेंट प्रणालियों में मिसअलाइन्ड (misaligned) एजेंटों द्वारा शोषण को प्रभावी ढंग से रोकते हैं और सामूहिक व्यवहार को आकार देते हैं जहाँ सरल प्रवर्तन विफल हो जाता है।

Yaowen Ye, Jacob Steinhardt2026-07-14
🤖 AI

Length Penalties Make Chain-of-Thought Less Monitorable

यह शोध पत्र यह प्रदर्शित करता है कि लंबाई-दंडित सुदृढीकरण शिक्षण (length-penalized reinforcement learning) चेन-ऑफ-थॉट तर्क को इस तरह से संकुचित करता है जो उत्तर की सटीकता को सुरक्षित रखते हुए उन विशिष्ट संकेतों को चुनिंदा रूप से हटा देता है जिनकी निगरानी करने वाले छिपे हुए प्रभावों का पता लगाने के लिए आवश्यकता होती है, जिससे एक "संपीड़न-निगरानी सीमा" (compression-monitorability frontier) निर्मित होती है जहाँ सस्ता तर्क ऑडिट करना काफी कठिन हो जाता है।

Bryce Little2026-07-14
🤖 machine learning

Gauge dependence and structured-output corruption in sign-branched repetition penalties: measurements across models, inference stacks, and alternative repetition controls

यह शोध पत्र यह प्रदर्शित करता है कि LLM इन्फरेंस इंजनों में व्यापक रूप से उपयोग किया जाने वाला साइन-ब्रांचिंग रिपिटिशन पेनल्टी (sign-branching repetition penalty) मौलिक रूप से त्रुटिपूर्ण है क्योंकि यह मनमाने लॉगिट ज़ीरो-पॉइंट (logit zero-point) पर निर्भर करता है, जिससे विभिन्न मॉडलों के बीच टोकन चयन में भारी अस्थिरता और स्ट्रक्चर्ड JSON आउटपुट में विनाशकारी विफलताएं होती हैं, एक ऐसी समस्या जिसे रॉ लॉगिट्स (raw logits) के बजाय सामान्यीकृत लॉग-प्रोबेबिलिटीज़ (normalized log-probabilities) पर पेनल्टी लागू करके हल किया गया है।

Peter Hollows2026-07-14
💬 NLP

Index SLM Technical Report

Bilibili ने Index-1.9B पेश किया है, जो ओपन स्मॉल लैंग्वेज मॉडल्स की एक श्रृंखला है जिसमें एक 1.9B-पैरामीटर फाउंडेशन है जिसे एक विशेष Warmup-Stable-Decay शेड्यूल और Norm-Head लेयर के साथ 2.8 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जो मानक बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त करता है और इसमें शुद्ध प्री-ट्रेनिंग, चैट अलाइनमेंट और कैरेक्टर-आधारित रोल-प्लेइंग के लिए वेरिएंट शामिल हैं।

Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li2026-07-14
🤖 machine learning

Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention

यह शोध पत्र डिरिचलेट-प्रोसेस क्लस्टरिंग (Dirichlet-process clustering) पर आधारित एक सीखने योग्य, विरल कैश (sparse cache) प्रस्तुत करता है जो केवल नवीन वस्तुओं के लिए मेमोरी स्लॉट आवंटित करता है, जिससे स्टेट-स्पेस मॉडल कुल टोकन के बजाय विशिष्ट वस्तुओं को ट्रैक करते हुए फुल-अटेंशन रिकॉल दक्षता प्राप्त करने में सक्षम होते हैं और फिक्स्ड-बजट इविक्शन रणनीतियों से बेहतर प्रदर्शन करते हैं।

Siddharth Pal, Viktoria Rojkova2026-07-14
💬 NLP

Workload-Driven Optimization for On-Device Real-Time Subtitle Translation

यह शोध पत्र LocalSubs प्रस्तुत करता है, जो ताइवान के उपकरणों पर कम-विलंबता (low-latency) और गोपनीयता-संरक्षण वाले इन्फरेंस के लिए अनुकूलित एक ऑन-डिवाइस अंग्रेजी-से-पारंपरिक-चीनी सबटाइटल अनुवाद प्रणाली है, जो शब्दावली के आकार को घटाकर 64k टोकन करता है, जिससे डिकोडिंग गति में उल्लेखनीय सुधार होता है और छोटे इनपुट पर गूगल ट्रांसलेट के विरुद्ध 59.2% की जीत दर प्राप्त होती है।

Tsz-To Wong2026-07-14
💬 NLP

Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora

यह शोध पत्र FindMyText को प्रस्तुत करता है, जो एक स्केलेबल, ओपन-सोर्स पायथन टूल है जो बड़े वेब-क्रॉल किए गए कॉर्पोरा में सटीक रूप से 'नियर-वर्बेटिम' (लगभग शब्दशः) टेक्स्ट की मौजूदगी का पता लगाने के लिए डिस्ट्रिब्यूटेड फिंगरप्रिंट चेनिंग का लाभ उठाता है, और कई डेटासेट्स पर मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

Lars Henry Berge Olsen, Pierre Lison, Martin Jullum, Mark Anderson2026-07-14
💬 NLP

A Survey on LLM Watermarking: Theory and Deployment

यह सर्वेक्षण मुख्य डिज़ाइन विकल्पों, थ्रेट मॉडल और सुरक्षा-उपयोगिता ट्रेड-ऑफ के इर्द-गिर्द क्षेत्र को व्यवस्थित करके LLM वॉटरमार्किंग की एक व्यवस्थित, परिनियोजन-उन्मुख समीक्षा प्रदान करता है ताकि चिकित्सकों को मजबूत एट्रिब्यूशन विधियों का चयन करने और विश्वसनीय AI परिनियोजन के लिए भविष्य की अनुसंधान दिशाओं की पहचान करने में मार्गदर्शन किया जा सके।

Huy Phan, Kieu Dang, Ojaswi Dulal, Aiham AL Shukairi, Abby Shine, Chase Garner, Phung Lai2026-07-14
💬 NLP

From Patent Expiry to Business Pathways: AI Workflows for Activating Innovation Archives

यह शोध पत्र एक एआई-सक्षम ढांचे का प्रस्ताव करता है जो कानूनी स्थिति की स्क्रीनिंग को सिमेंटिक विश्लेषण और जनरेटिव एआई के साथ एकीकृत करके, समाप्त हो चुके और लैप्स हो रहे पेटेंट अभिलेखों को कार्रवाई योग्य व्यावसायिक मार्गों में बदल देता है, ताकि सुप्त तकनीकी ज्ञान को वाणिज्यिक अवसरों में पहचाना और रूपांतरित किया जा सके।

Sidney Shapiro, Mark Price2026-07-14