🤖 machine learning

Dual Advantage Fields

यह शोधपत्र ड्यूल एडवांटेज फील्ड्स (DAF) का प्रस्ताव करता है, जो एक पॉलिसी-एक्सट्रैक्शन विधि है जो द्वैरेखीय (bilinear) ड्यूल वैल्यू मॉडल्स को लक्ष्य-निर्देशित फीचर विस्थापन (goal-directed feature displacements) के साथ उनके संरेखण के आधार पर क्रियाओं को स्कोर करके स्थानीय एडवांटेज संकेतों में परिवर्तित करती है, जिससे जटिल कार्यों पर ऑफलाइन गोल-कंडीशन्ड रिइन्फोर्समेंट लर्निंग के प्रदर्शन में सुधार होता है।

Alexey Zemtsov, Maxim Bobrin, Alexander Nikulin, Dmitry V. Dylov, Fakhri Karray, Vladislav Kurenkov, Martin Takáč, Arip (…)2026-06-04
🤖 AI

Notarized Agents: Receiver-Attested Confidential Receipts for AI Agent Actions

यह शोध पत्र Sello को प्रस्तुत करता है, जो सेवा प्राप्तकर्ताओं (service receivers) द्वारा एजेंट के स्वामी को गतिविधि रसीदों पर हस्ताक्षर और एन्क्रिप्ट करने के माध्यम से छेड़छाड़-प्रमाणित (tamper-evident) AI एजेंट अवलोकन सुनिश्चित करता है, जिससे एजेंट या उसके ऑपरेटर पर विश्वास करने की आवश्यकता समाप्त हो जाती है।

Juan Figuera2026-06-04
🤖 AI

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities

DetectZoo एक एकीकृत, ओपन-सोर्स टूलकिट है जो 61 डिटेक्टरों और 22 बेंचमार्क डेटासेट्स को एक एकल, प्रतिलिपि योग्य (reproducible) ढांचे में एकीकृत करके टेक्स्ट, ऑडियो और इमेज मोडैलिटीज में एआई-जनित सामग्री का पता लगाने के लिए अनुभवजन्य पाइपलाइन को मानकीकृत करता है।

Sajad Ebrahimi, Nima Jamali, Bardia Shirsalimian, Kelly McConvey, Wentao Zhang, Jalehsadat Mahdavimoghaddam, Maksym Tara (…)2026-06-04
🤖 AI

Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Representation Signal

यह शोध पत्र एक ज्ञान-प्रतिनिधित्व ढांचे का प्रस्ताव करता है जो मूल्य-युक्त कार्यों में रणनीतिक रूटिंग को सक्षम करने के लिए बहु-एजेंट तर्क ट्रेसेस और निर्णयों को चार प्रतीकात्मक असहमति अवस्थाओं में अमूर्त बनाता है, यह तर्क देते हुए कि मानदंडात्मक अनिश्चितता को संबोधित करने के लिए असहमति को समाप्त करने के बजाय उसे संरक्षित करना महत्वपूर्ण है।

Michał Wawer, Jarosław A. Chudziak2026-06-04
💬 NLP

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG एक मल्टीमॉडल रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क पेश करता है जो संरचनात्मक जानकारी को स्पष्ट रूप से कैप्चर करने के लिए एंटरप्राइज दस्तावेजों को ओरिएंटेशन-विशिष्ट पार्सिंग पाइपलाइनों के माध्यम से गतिशील रूप से रूट करता है, जो Q&A सटीकता में मौजूदा विजन-केंद्रित बेसलाइन से काफी बेहतर प्रदर्शन करता है और साथ ही FastRAGEval नामक एक लागत प्रभावी मूल्यांकन मीट्रिक भी प्रदान करता है।

Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng (…)2026-06-04
💬 NLP

Supportive Token Revealing for Fast Diffusion Language Model Decoding

यह शोधपत्र AXON को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) मॉड्यूल है जो अनिश्चित स्थितियों के डिनोइजिंग (denoising) में सहायता करने की उनकी क्षमता के आधार पर आत्मविश्वासी टोकनों को प्रकट करने के लिए गतिशील रूप से चुनने के माध्यम से डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल्स के गुणवत्ता-विलंबता ट्रेड-ऑफ (quality-latency trade-off) को बढ़ाता है, जिससे सटीकता को बनाए रखते हुए या उसमें सुधार करते हुए आवश्यक डिकोडिंग चरणों की संख्या कम हो जाती है।

Giries Abu Ayoub, Mario Barbara, Lluís Pastor-Pérez, Tanja Bien, Aneesh Barthakur, Alaa Maalouf, Loay Mualem2026-06-04
🤖 machine learning

Recover-LoRA for Aggressive Quantization: Reclaiming Accuracy in 2-Bit Language Models via Low-Rank Adaptation with Knowledge Distillation on Synthetic Data

यह शोधपत्र Recover-LoRA पेश करता है, जो एक डेटा-मुक्त विधि है जो MLP गेट और अप लेयर्स के चयनात्मक 2-बिट क्वांटाइजेशन को सिंथेटिक डेटा पर प्रशिक्षित लो-रैंक एडेप्टेशन के साथ जोड़ती है, जिससे आक्रामक 2-बिट लैंग्वेज मॉडल कंप्रेशन में खोई हुई 80-95% सटीकता को पुनः प्राप्त किया जा सकता है, जो एज डिप्लॉयमेंट के लिए महत्वपूर्ण थ्रूपुट लाभ प्रदान करता है।

Devleena Das, Rajeev Patwari, Elliott Delaye, Ashish Sirasao2026-06-04
🤖 AI

StepPRM-RTL: Stepwise Process-Reward Guided LLM Fine-Tuning for Enhanced RTL Synthesis

StepPRM-RTL एक नवीन ढांचा है जो पूर्ववर्ती विधियों की तुलना में बेहतर कार्यात्मक शुद्धता और लॉन्ग-होरिज़न रीजनिंग प्राप्त करने के लिए स्टेपवाइज़ ट्राजेक्टरी मॉडलिंग, प्रोसेस-रिवॉर्ड मॉडलिंग और रिट्रीवल-ऑगमेंटेड फाइन-ट्यूनिंग को एकीकृत करके LLM-आधारित RTL कोड जनरेशन को बढ़ाता है।

Prashanth Vijayaraghavan, Apoorva Nitsure, Luyao Shi, Ehsan Degan, Vandana Mukherjee2026-06-04
🤖 AI

Can Generalist Agents Automate Data Curation?

यह शोध पत्र Curation-Bench को प्रस्तुत करता है यह प्रदर्शित करने के लिए कि जबकि सामान्यवादी कोडिंग एजेंट डेटा क्यूरेशन लूप को स्वचालित कर सकते हैं और मौजूदा बेसलाइन से मेल खा सकते हैं, उच्च-स्तरीय, अनुसंधान-स्तर की डेटा नीतियों को प्राप्त करने के लिए ऐसे स्कैफोल्डिंग (scaffolding) की आवश्यकता होती है जो एजेंटों को ओपन-एंडेड प्रॉम्प्टिंग पर निर्भर रहने के बजाय पूर्व विधियों को उद्धृत करने और उन्हें अनुकूलित करने के लिए बाध्य करे।

Feiyang Kang, Hanze Li, Adam Nguyen, Mahavir Dabas, Jiaqi W. Ma, Frederic Sala, Dawn Song, Ruoxi Jia2026-06-04
🤖 AI

Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation

इंस्टेंट-फोल्ड (Instant-Fold) एक सिमुलेशन-प्रशिक्षित, इन-कॉन्टेक्स्ट इमिटेशन लर्निंग फ्रेमवर्क है जो बिना किसी ग्रेडिएंट अपडेट या अतिरिक्त फाइन-ट्यूनिंग की आवश्यकता के, एकल मानव प्रदर्शन से विविध निष्पादन मोड का अनुमान लगाकर, शून्य-शॉट वास्तविक दुनिया के विरूपणीय वस्तु हेरफेर (deformable object manipulation) को सक्षम बनाता है।

Yilong Wang, Cheng Qian, Edward Johns2026-06-04