🤖 machine learning

Calibration, Not Compilation: Detecting and Repairing Misspecified Probabilistic Programs Written by Language Models

यह शोध पत्र तर्क देता है कि भाषा मॉडल द्वारा उत्पन्न संभाव्य कार्यक्रमों (प्रोबेबिलिस्टिक प्रोग्राम्स) के लिए, सांख्यिकीय शुद्धता को संकलन (कंपाइलेशन) के बजाय अंशांकन (कैलिब्रेशन) द्वारा परिभाषित किया जाता है, जो यह प्रदर्शित करता है कि बेयसियन वर्कफ़्लो-आधारित पहचान और मरम्मत, सांख्यिकीय मिसस्पेसिफिकेशन की पहचान करने और उन्हें ठीक करने में पारंपरिक यूनिट टेस्टिंग और स्व-समीक्षा विधियों की तुलना में काफी बेहतर प्रदर्शन करती है।

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao2026-07-01
🤖 AI

Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents

यह शोध पत्र लकीस्टार (LuckyStar) 111B को प्रस्तुत करता है, जो कोहेर (Cohere) और एलजी सीएनएस (LG CNS) द्वारा विकसित एक हाइब्रिड रीजनिंग मॉडल है, जो विशिष्ट फाइन-ट्यूनिंग और क्वांटाइजेशन रणनीतियों के माध्यम से कोरियाई-अंग्रेजी एंटरप्राइज एजेंटों के लिए एक पोस्ट-ट्रेन्ड मल्टीलिंगुअल बेस मॉडल को कुशलतापूर्वक अनुकूलित करता है, जिससे मेमोरी की सीमाओं के तहत सामान्य इंस्ट्रक्शन-फॉलोइंग गुणवत्ता बनाए रखते हुए फंक्शन कॉलिंग और एनएल2एसक्यूएल (NL2SQL) जैसी टूल-यूज़ क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।

Utsav Garg, Sungjin Hong, Jason Jung, Justin Lee, Shaan Desai, Joon Hee Kim, Anirudh Shrinivason, Edmond Wen, Susie Park2026-07-01
🤖 machine learning

ECHO: Prune to act, trace to learn with selective turn memory in agentic RL

यह शोध पत्र ECHO को प्रस्तुत करता है, जो लॉन्ग-होरिज़न लैंग्वेज एजेंटों के लिए एक चयनात्मक टर्न-मेमोरी फ्रेमवर्क है जो ट्रेस करने योग्य सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) और सूक्ष्म-स्तरीय साक्ष्य पुन: उपयोग को सक्षम करने के लिए वातावरण के टर्न्स को सोर्स-इंडेक्स्ड रिकॉर्ड्स में संकुचित करता है, जिससे मौजूदा कॉन्टेक्स्ट-मैनेजमेंट विधियों की तुलना में BrowseComp-Plus जैसे बेंचमार्क पर बेहतर प्रदर्शन और सामान्यीकरण प्राप्त होता है।

Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen2026-07-01
🤖 machine learning

Improving Certified Robustness via Adversarial Distillation

यह शोध पत्र AD-CERT को प्रस्तुत करता है, जो एक प्रमाणित प्रशिक्षण ढांचा (certified training framework) है जो एक अनुभवजन्य रूप से सुदृढ़ शिक्षक (empirically robust teacher) से एडवरसेरियल डिस्टिलेशन (adversarial distillation) को इंटरवल बाउंड प्रोपेगेशन (Interval Bound Propagation) के साथ जोड़ता है ताकि अत्याधुनिक प्रमाणित सुदृढ़ता (certified robustness) प्राप्त की जा सके और मानक सटीकता (standard accuracy) एवं औपचारिक सत्यापन (formal verification) के बीच के संतुलन में महत्वपूर्ण सुधार किया जा सके।

Matteo Melis, Jesus Martinez Del Rincon, Vishal Sharma2026-07-01
🤖 machine learning

Diffusing Blame: Task-Dependent Credit Assignment in Biologically Plausible Dual-Stream Networks

यह शोध पत्र डेल के सिद्धांत (Dale's principle) का कड़ाई से पालन करते हुए, मॉड्युलो एरर रूटिंग के साथ एरर डिफ्यूजन और कार्य-विशिष्ट नवाचारों का उपयोग करके MNIST, CIFAR-10 और निरंतर सुदृढीकरण लर्निंग (continuous reinforcement learning) कार्यों पर उत्कृष्ट प्रदर्शन प्राप्त करने के लिए एक जैविक रूप से प्रशंसनीय द्वैत-प्रवाह संरचना (dual-stream architecture) प्रस्तुत करता है।

Yutaro Yamada, Luca Grillotti, Rujikorn Charakorn, Sebastian Risi, David Ha, Robert Tjarko Lange2026-07-01
🤖 machine learning

WIDER-FAIR: An Annotated Version of the WIDER-FACE Dataset for Fairness Evaluation

यह शोध पत्र WIDER-FAIR को प्रस्तुत करता है, जो निष्पक्षता मूल्यांकन को सक्षम करने के लिए जातीयता और लिंग के मैनुअल एनोटेशन के साथ WIDER-FACE बेंचमार्क का विस्तार करने वाला एक नया डेटासेट है, जो प्रयोगों के माध्यम से यह प्रदर्शित करता है कि फेस डिटेक्शन मॉडल प्रदर्शन में महत्वपूर्ण असमानताएं प्रदर्शित करते हैं, विशेष रूप से अश्वेत व्यक्तियों के विरुद्ध।

Maxime Moussi, Benoît Ronval, Siegfried Nijssen, Félicien Schiltz2026-07-01
⚡ electrical engineering

Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation

यह शोध पत्र यह प्रदर्शित करता है कि टेक्स्ट-टू-स्पीच (TTS) मूल्यांकन के लिए 'वन-साइज-फिट्स-ऑल' दृष्टिकोण के बजाय संदर्भ-जागरूक मेट्रिक्स की आवश्यकता होती है, क्योंकि विभिन्न डोमेन में भाषण की उपयुक्तता काफी भिन्न होती है और अक्सर पारंपरिक नैचुरलनेस (स्वाभाविकता) स्कोर के साथ संघर्ष करती है।

Dominika Woszczyk, Andreas Triantafyllopoulos, Jura Miniota, Éva Székely, Bjoern Schuller2026-07-01
💬 NLP

STEB: Style Text Embedding Benchmark

यह शोध पत्र STEB को प्रस्तुत करता है, जो स्टाइल टेक्स्ट एम्बेडिंग्स के मूल्यांकन को मानकीकृत करने के लिए 7 भाषाओं में 96 डेटासेट्स तक फैला एक व्यापक ओपन-सोर्स बेंचमार्क है, जो यह प्रकट करता है कि मौजूदा सिमेंटिक एम्बेडिंग्स स्टाइल संबंधी कार्यों में विफल रहते हैं और कोई भी एकल स्टाइल एम्बेडिंग सार्वभौमिक रूप से श्रेष्ठ नहीं है।

Rafael Rivera Soto, Anna Wegmann, Cristina Aggazzotti2026-07-01
🤖 machine learning

FedXDS: Leveraging Model Attribution Methods to counteract Data Heterogeneity in Federated Learning

यह शोध पत्र FedXDS प्रस्तुत करता है, जो एक नवीन फेडरेटेड लर्निंग दृष्टिकोण है जो डेटा विषमता को कम करने के लिए स्पष्ट करने योग्य एआई (explainable AI) फीचर एट्रिब्यूशन का लाभ उठाता है और क्लाइंट्स के बीच कार्य-प्रासंगिक डेटा तत्वों की पहचान और चुनिकी रूप से साझा करता है, जिससे औपचारिक गोपनीयता गारंटी बनाए रखते हुए मौजूदा विधियों की तुलना में बेहतर सटीकता और अभिसरण (convergence) प्राप्त होता है।

Maximilian Andreas Hoefler, Karsten Mueller, Wojciech Samek2026-07-01
🤖 machine learning

Addressing Over-Refusal in LLMs with Competing Rewards

यह शोध पत्र SEAR को प्रस्तुत करता है, जो एक प्रशिक्षण ढांचा है जो एक प्रतिकूल अनुकूलन दृष्टिकोण का उपयोग करके LLM के अत्यधिक इनकार (over-refusal) को कम करता है, जहाँ एक एकल मॉडल हानिकारक प्रॉम्प्ट्स के बीच अंतर करने के लिए संकेत के रूप में असुरक्षित तर्क (unsafe reasoning) की एक साथ खोज करता है और यह सुनिश्चित करता है कि अंतिम आउटपुट सुरक्षित रहे, जिससे उपयोगिता से समझौता किए बिना सुरक्षा अनुपालन में सुधार होता है।

Taeyoun Kim, Aviral Kumar2026-07-01