🤖 machine learning

In-Place Feedback: Reliable Refinement for Multi-Turn Expert-LLM Collaboration

यह शोध पत्र "इन-प्लेस फीडबैक" (in-place feedback) का प्रस्ताव करता है, जो एक ऐसा सहयोग प्रतिमान (collaboration paradigm) है जहाँ उपयोगकर्ता सुधारों को निर्देशित करने के लिए सीधे LLM प्रतिक्रियाओं को संपादित करते हैं, और बेंचमार्क एवं विशेषज्ञ अध्ययनों के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण मानक मल्टी-टर्न फीडबैक की तुलना में अधिक विश्वसनीय त्रुटि सुधार, उच्च उपयोगकर्ता संतुष्टि और कम थकान प्रदान करता है।

Youngbin Choi, Minjong Lee, Saemi Moon, Seunghyuk Cho, Chaehyeon Chung, MoonJeong Park, Dongwoo Kim2026-05-29
🤖 machine learning

Contrastive Representation Regularization for Vision-Language-Action Models

यह शोध पत्र रोबोट स्टेट-अवेयर कॉन्ट्रास्टिव लॉस (RS-CL) का परिचय देता है, जो एक हल्का प्रतिनिधित्व नियमितीकरण (representation regularization) तकनीक है जो विजन-लैंग्वेज-एक्शन मॉडल के प्रतिनिधित्व को रोबोटिक प्रोप्रियोसेप्टिव अवस्थाओं के साथ संरेखित करता है, जिससे सिम्युलेटेड और वास्तविक दुनिया के मैनिपुलेशन बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Taeyoung Kim, Jimin Lee, Myungkyu Koo, Dongyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin2026-05-29
🤖 AI

Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting

यह शोध पत्र एक नवीन दृष्टिकोण प्रस्तावित करता है जो हानिकारक संदर्भों को लार्ज लैंग्वेज मॉडल के प्रदर्शन को ज़ीरो-शॉट बेसलाइन से नीचे गिराने से रोकने के लिए डिस्ट्रीब्यूशन-फ्री रिस्क कंट्रोल को डायनेमिक अर्ली-एग्जिटिंग के साथ जोड़ता है, और साथ ही सहायक इनपुट्स पर दक्षता और सटीकता में सुधार करता है।

Andrea Wynn, Metod Jazbec, Charith Peris, Rinat Khaziev, Anqi Liu, Daniel Khashabi, Eric Nalisnick2026-05-29
🤖 machine learning

The Impact of Semantic Pairs on Self-Supervised Representation Learning

यह शोध पत्र एक नियंत्रित अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्व-पर्यवेक्षित प्रीट्रेनिंग (self-supervised pretraining) के लिए मैन्युअल रूप से क्यूरेट किए गए सिमेंटिक पॉजिटिव पेयर्स (एक ही क्लास के विभिन्न इंस्टेंस) का उपयोग करना, मानक ऑगमेंटेड पॉजिटिव पेयर्स की तुलना में निरंतर सामान्यीकरण (generalization) में सुधार करता है और व्यापक इनवेरियंस (invariances) को प्रेरित करता है, जिसमें SimCLR जैसी कंट्रास्टिव लर्निंग विधियों को सर्वाधिक लाभ मिलता है।

Mohammad Alkhalefi, Georgios Leontidis, Mingjun Zhong2026-05-29
🧬 biology

Calibrating Generative Models to Distributional Constraints

यह शोध पत्र कैलिब्रेशन को एक कड़े अनुकूलन (constrained optimization) समस्या के रूप में फ्रेम करके और दो सुलभ फाइन-ट्यूनिंग उद्देश्यों—रिलैक्स लॉस (relax loss) और रिवॉर्ड लॉस (reward loss)—को पेश करके जनरेटिव मॉडल्स के मिसकैलिब्रेशन को संबोधित करता है, जो विविध अनुप्रयोगों और बड़े पैमाने के मॉडल्स में वांछित सांख्यिकीय बाधाओं के साथ सैंपलिंग वितरणों को प्रभावी ढंग से संरेखित करते हैं।

Henry D. Smith, Nathaniel L. Diamant, Brian L. Trippe2026-05-29
🤖 machine learning

Offline Reinforcement Learning with Generative Trajectory Policies

यह शोधपत्र जेनेरेटिव ट्रैजेक्टरी पॉलिसीज़ (GTPs) को प्रस्तुत करता है, जो एक एकीकृत ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो निरंतर-समय ODE-आधारित ट्रैजेक्टरी समाधान मानचित्रों को सीखकर धीमे डिफ्यूजन मॉडल्स और तेज़ कंसिस्टेंसी मॉडल्स के बीच के अंतर को पाटता है, और चुनौतीपूर्ण AntMaze कार्यों पर परफेक्ट स्कोर सहित D4RL बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Xinsong Feng, Leshu Tang, Chenan Wang, Haipeng Chen2026-05-29
📊 statistics

Follow-the-Perturbed-Leader for Decoupled Bandits: Best-of-Both-Worlds and Practicality

यह शोध पत्र डिकपल्ड मल्टी-आर्म्ड बैंडिट समस्या के लिए एक कुशल 'फॉलो-द-पर्टर्बड-लीडर' नीति प्रस्तावित करता है जो बेस्ट-ऑफ-बौथ-वर्ल्ड गारंटी प्राप्त करती है—स्टोकेस्टिक परिवेश में निरंतर रिग्रेट और एडवर्सियल परिवेश में इष्टतम O(KT)O(\sqrt{KT}) रिग्रेट—जबकि गणनात्मक लागत को महत्वपूर्ण रूप से कम करने के लिए उत्तरोत्तर अनुकूलन (कॉन्वेक्स ऑप्टिमाइज़ेशन) और रीसॅम्पलिंग प्रक्रियाओं की आवश्यकता को समाप्त करती है।

Chaiwon Kim, Jongyeong Lee, Min-hwan Oh2026-05-29
⚡ electrical engineering

Singularity-free dynamical invariants-based quantum control

यह शोध पत्र एक सामान्यीकृत, सिंगुलैरिटी-मुक्त (singularity-free) इनवेरिएंट-आधारित प्रोटोकॉल प्रस्तुत करता है जो उच्च-निष्ठा (high-fidelity) परिणाम प्राप्त करने के लिए सुचारू, हार्डवेयर-व्यवहार्य नियंत्रण क्षेत्रों को संश्लेषित करने हेतु परिमित-आयामी क्वांटम अवस्था तैयारी को एक समतुल्य एकल-क्यूबिट समस्या में रूपांतरित करता है, जो अभिलक्षित (characterized) और अलक्षित (uncharacterized) नॉन-मार्कोवियन ओपन क्वांटम सिस्टम दोनों में सक्षम है।

Ritik Sareen, Akram Youssry, Alberto Peruzzo2026-05-29
📊 statistics

Beyond Accuracy: Are Time Series Foundation Models Well-Calibrated?

यह शोध पत्र पांच हालिया टाइम सीरीज़ फाउंडेशन मॉडल्स के कैलिब्रेशन का व्यवस्थित रूप से मूल्यांकन करता है, जिसमें यह पाया गया है कि वे विभिन्न पूर्वानुमान परिदृश्यों में बेसलाइन मॉडल्स की तुलना में लगातार बेहतर कैलिब्रेटेड हैं और व्यवस्थित अति-आत्मविश्वास (सिस्टमैटिक ओवरकॉन्फिडेंस) के प्रति कम संवेदनशील हैं।

Coen Adler, Yuxin Chang, Felix Draxler, Samar Abdi, Padhraic Smyth2026-05-29
🤖 machine learning

Leak@kk: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding

यह शोध पत्र प्रकट करता है कि मौजूदा LLM अनलर्निंग विधियाँ प्रोबेबिलिस्टिक डिकोडिंग के तहत वास्तविक विस्मृति (forgetting) प्राप्त करने में विफल रहती हैं, इस भेद्यता को मापने के लिए \texttt{leak@kk} मीट्रिक पेश करती हैं और कई बेंचमार्क में ज्ञान रिसाव (knowledge leakage) को प्रभावी ढंग से कम करने के लिए \texttt{RULE} एल्गोरिदम का प्रस्ताव देती हैं।

Hadi Reisizadeh, Jiajun Ruan, Yiwei Chen, Soumyadeep Pal, Sijia Liu, Mingyi Hong2026-05-29