🤖 machine learning

Interactive Critique-Revision Training for Reliable Structured LLM Generation

यह शोध पत्र DPA-GRPO का प्रस्ताव करता है, जो एक जनरेटर-वेरिफायर गेम के लिए एक डुअल पेयर्ड-एक्शन प्रशिक्षण विधि है जो संरचित LLM आउटपुट को अनुकूलित करने के लिए सुरक्षा आश्वासन मामलों (safety assurance cases) और काउंटरफैक्चुअल एक्शन समूहों का उपयोग करता है, जो TaxCalcBench TY24 बेंचमार्क पर बेहतर सटीकता, त्रुटि पहचान और कैलिब्रेटेड संशोधन व्यवहार प्रदर्शित करता है।

Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan2026-05-12
🤖 AI

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

यह शोध पत्र Auto-Rubric as Reward (ARR) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो निहित प्राथमिकताओं को स्पष्ट, सत्यापन योग्य रूब्रिक्स (rubrics) में बाह्यीकृत करके और उन्हें Rubric Policy Optimization (RPO) के माध्यम से अनुकूलित करके मल्टीमॉडल जनरेटिव मॉडल्स को संरेखित करता है, जिससे पारंपरिक स्केलर-आधारित रिवॉर्ड विधियों की तुलना में अधिक विश्वसनीय, व्याख्या योग्य और डेटा-कुशल संरेखण प्राप्त होता है।

Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li2026-05-12
🤖 AI

Embeddings for Preferences, Not Semantics

यह शोध पत्र तर्क देता है कि मानक टेक्स्ट एम्बेडिंग सामूहिक निर्णय लेने के लिए आवश्यक "वरीयता समानता" (preferential similarity) को पकड़ने में विफल रहती हैं क्योंकि वे अर्थ संबंधी अर्थ (semantic meaning) को उपयोगकर्ता के रुख (user stance) के साथ मिला देती हैं, और इन संकेतों को अलग करने के लिए सिंथेटिक प्रशिक्षण डेटा का उपयोग करते हुए एक समाधान प्रस्तावित करती है, जिससे कई विमर्श डेटासेट (deliberation datasets) में वरीयता भविष्यवाणी में महत्वपूर्ण सुधार होता है।

Carter Blair, Ariel D. Procaccia, Milind Tambe2026-05-12
🤖 AI

On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective

यह शोध पत्र क्षमता उद्दीपन (capability elicitation), जो मॉडल के सुलभ समर्थन (accessible support) के भीतर मौजूदा व्यवहारों को पुनर्रचित करता है, और क्षमता सृजन (capability creation), जो खोज या टूल के उपयोग जैसे तंत्रों के माध्यम से उस समर्थन का विस्तार करता है, के बीच अंतर करने के लिए एक मुक्त-ऊर्जा ढांचे (free-energy framework) का प्रस्ताव करता है, और यह तर्क देता है कि यह अंतर पोस्ट-ट्रेनिंग में पारंपरिक SFT बनाम RL द्विभाजन की तुलना में अधिक महत्वपूर्ण है।

Yuhao Li, Shengchao Liu2026-05-12
🤖 AI

What Software Engineering Looks Like to AI Agents? -- An Empirical Study of AI-Only Technical Discourse on MoltBook

यह अनुभवजन्य अध्ययन MoltBook पर स्वायत्त तकनीकी विमर्श का विश्लेषण करता है, जो यह प्रकट करता है कि केवल AI-आधारित अंतःक्रियाएं सुरक्षा और विश्वास जैसे विषयों के इर्द-गिर्द अत्यधिक केंद्रित हैं, जबकि उनमें उन ठोस, संदर्भ-युक्त डिबगिंग विवरणों और पर्यावरणीय विशिष्टताओं का अभाव है जो GitHub पर मानव डेवलपर्स की चर्चाओं की विशेषता है।

Junyu Huo, Ziqi Mao, Zihao Wan, Gouri Ginde2026-05-12
🤖 AI

SkillLens: Adaptive Multi-Granularity Skill Reuse for Cost-Efficient LLM Agents

SkillLens एक पदानुक्रमित ढांचा (hierarchical framework) है जो अनुकूलन योग्य पुनर्प्राप्ति (adaptive retrieval) और चयनात्मक परिशोधन (selective refinement) के लिए कौशल को बहु-स्तर के ग्राफ में व्यवस्थित करके LLM एजेंट के प्रदर्शन और लागत-दक्षता को अनुकूलित करता है, जिससे यह MuLocbench और ALFWorld जैसे बेंचमार्क पर मौजूदा फ्लैट स्किल-आधारित बेसलाइन से बेहतर प्रदर्शन करता है।

Yongliang Miao, Ziyang Yu, Liang Zhao, Bowen Zhu, Hasibul Haque2026-05-12
🤖 AI

PLACO: A Multi-Stage Framework for Cost-Effective Performance in Human-AI Teams

यह शोध पत्र PLACO को प्रस्तुत करता है, जो एक बहु-चरणीय ढांचा है जो मानव की क्लास-स्तरीय कैलिब्रेटेड संभावनाओं को मॉडल की इंस्टेंस-स्तरीय संभावनाओं के साथ प्रभावी ढंग से संयोजित करने के लिए सशर्त स्वतंत्रता धारणाओं के तहत बेयस नियम का लाभ उठाता है, जिससे मानव-AI वर्गीकरण टीमों में लागत प्रभावी प्रदर्शन को अनुकूलित किया जा सके।

Pranavkumar Mallela, Vinay Kumar, Shashi Shekhar Jha, Shweta Jain2026-05-12
🤖 AI

Decoupling Endpoint and Semantic Transition Learning for Zero-Shot Composed Image Retrieval

यह शोध पत्र DeCIR का प्रस्ताव करता है, जो ज़ीरो-शॉट कंपोज्ड इमेज रिट्रीवल (Zero-Shot Composed Image Retrieval) के लिए एक नवीन प्रोजेक्शन-आधारित ढांचा है, जो एंडपॉइंट और ट्रांज़िशन लर्निंग को लो-रैंक डायरेक्शनल मर्ज (Low-Rank Directional Merge) के माध्यम से विलीन किए गए अलग-अलग लो-रैंक एडेप्टर शाखाओं में डिकपलिंग करके सिमेंटिक ट्रांज़िशन बॉटलनेक को हल करता है, जिससे अनुमान की जटिलता बढ़ाए बिना जटिल सिमेंटिक संशोधनों पर प्रदर्शन में सुधार होता है।

Mingyu Liu, Sihan Huang, Yijia Fan, Yinlin Yan, Quan Zhang, Jian-Fang Hu, Jianhuang Lai2026-05-12
🤖 AI

CoCoDA: Co-evolving Compositional DAG for Tool-Augmented Agents

CoCoDA एक ऐसा फ्रेमवर्क है जो छोटे भाषा मॉडलों को एक एकल कंपोजिशनल कोड DAG के भीतर एक प्लानर और एक बढ़ते टूल लाइब्रेरी को सह-विकसित करके बड़े शिक्षकों के बराबर या उनसे बेहतर बनाने में सक्षम बनाता है, जो सिम्बोलिक यूनिफिकेशन के माध्यम से रिट्रीवल दक्षता को अनुकूलित करता है और एक स्ट्रक्चर-अवेयर रिवॉर्ड मैकेनिज्म के माध्यम से लर्निंग को त्वरित करता है।

Ziyang Yu, Qiyue Li, Liang Zhao2026-05-12
🤖 AI

Belief or Circuitry? Causal Evidence for In-Context Graph Learning

यह शोधपत्र कारण संबंधी साक्ष्य प्रदान करता है कि बड़े भाषा मॉडल (large language models) एक दोहरी प्रक्रिया के माध्यम से इन-कॉन्टेक्स्ट ग्राफ संरचनाओं को सीखते हैं, जहाँ वास्तविक वैश्विक टोपोलॉजी अनुमान (global topology inference) और स्थानीय पैटर्न मिलान (local pattern matching) एक एकल रणनीति पर निर्भर रहने के बजाय एक साथ संचालित होते हैं।

Katharine Kowalyshyn, Timothy Duggan, Daniel Little, Michael C Hughes2026-05-12