🤖 machine learning

Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?

यह शोध पत्र 'डिफरेंशियल सर्किट वल्नरेबिलिटी' नामक एक हेड-लेवल मीट्रिक प्रस्तुत करता है यह प्रदर्शित करने के लिए कि जबकि सुपरवाइज्ड फाइन-ट्यूनिंग मॉडल्स को नए कार्यों के अनुकूल बनाने में तेज़ होता है, सुदृढीकरण सीखना (रीइन्फोर्समेंट लर्निंग) आंतरिक कम्प्यूटेशनल सर्किट्स को बेहतर ढंग से संरक्षित करता है, जिससे कैटास्ट्रोफिक फॉरगेटिंग के प्रति इसके बेहतर प्रतिरोध का एक यांत्रिक स्पष्टीकरण मिलता है।

Jeanmely Rojas Nunez, Viraj Sawant, Nathan Allen, Nomgondalai Amgalanbaatar, Yannis Zongo, Vasu Sharma, Maheep Chaudhary2026-05-29
🤖 machine learning

Self-Play Reinforcement Learning under Imperfect Information in Big 2

यह शोध पत्र 'बिग 2' (Big 2) नामक अपूर्ण-सूचना वाले कार्ड गेम के लिए एक सेल्फ-प्ले सुदृढीकरण शिक्षण (self-play reinforcement learning) ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि नियंत्रित परिस्थितियों में PPO, वैल्यू-आधारित विधियों से बेहतर प्रदर्शन करता है और मजबूत मल्टी-एजेंट एजेंटों को प्रशिक्षित करने के लिए एंट्रॉपी रेगुलराइजेशन (entropy regularization) और करंट-पॉलिसी सेल्फ-प्ले के लाभों को रेखांकित करता है।

Aalok Patwa2026-05-29
🤖 machine learning

TaxDistill: Improving Metagenomic Taxonomic Annotation via Distilled Genomic Foundation Models

TaxDistill एक नॉलेज डिस्टिलेशन फ्रेमवर्क है जो एक बड़े जीनोमिक फाउंडेशन मॉडल (GenomeOcean) का लाभ उठाकर एक हल्के स्टूडेंट नेटवर्क को प्रशिक्षित करने के लिए सॉफ्ट लेबल्स जेनरेट करता है, जिससे पारंपरिक समानता-आधार-आधारित विधियों से होने वाले शोर को कम किया जाता है और विविध डेटासेट्स में मेटाजीनोमिक टैक्सोनोमिक एनोटेशन की सटीकता में महत्वपूर्ण सुधार किया जाता है।

Rongye Ye, Lun Li, Zheng Luo, Yiran Zhan, Shuhui Song2026-05-29
💻 computer science

LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis

यह शोध पत्र LogDx-CI को प्रस्तुत करता है, जो 35 वास्तविक CI विफलताओं में 11 लॉग-रिडक्शन टूल्स का मूल्यांकन करने वाला एक बेंचमार्क है, जो यह प्रकट करता है कि हाइब्रिड grep+tail राउटर सर्वोत्तम लागत-गुणवत्ता संतुलन प्रदान करते हैं, एजेंट लूप्स उच्च लागत की कीमत पर संदर्भ गुणवत्ता के अंतर को कम करते हैं, और क्रॉस-फैमिली समराइज़र-डीबगर जोड़े स्वयं के कॉल पूर्वाग्रह (self-call bias) से बचकर सेम-फैमिली संयोजनों की तुलना में बेहतर प्रदर्शन करते हैं।

Bowen Qin2026-05-29
💻 computer science

GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

यह शोध पत्र GrowLoop का प्रस्ताव करता है, जो एक स्व-विकसित (self-evolving) संवदात्मक मूल्यांकन प्रणाली है जो न्यूनतम मानवीय सीड एनोटेशन और निरंतर विकसित होते मॉडलों एवं बदलते परिदृश्यों के अनुकूल होने के लिए पुनरावृत्तीय LLM-संचालित रूब्रिक शोधन का उपयोग करती है, जिससे यह मानव-समानता के आकलन में स्थिर बेंचमार्क की सीमाओं को दूर करती है।

Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Chenglong Song, Yue Liu2026-05-29
🤖 machine learning

Context Distillation as Latent Memory Management

यह शोध पत्र एक संदर्भ आसवन (context distillation) ढांचे का प्रस्ताव करता है जो प्रासंगिक जानकारी को एक लेटेंट मेमोरी बैंक के भीतर मॉड्यूलर लोरा (LoRA) एडेप्टर के रूप में मानता है, और प्रासंगिक स्मृतियों को कुशलतापूर्वक चुनने और सक्रिय करने के साथ-साथ मजबूती और अनुमान दक्षता में सुधार करने के लिए रिट्रीवल (retrieval), रूटिंग (routing) और एक सेल्फ-गेटिंग (Self-Gating) तंत्र का उपयोग करता है।

Ziyang Zheng, Zeju Li, Xiangyu Wen, Jianyuan Zhong, Junhua Huang, Lei Chen, Mingxuan Yuan, Qiang Xu2026-05-29
🤖 AI

Review Arcade: On the Human Alignment and Gameability of LLM Reviews

यह शोध पत्र 2025 ACL रोलिंग रिव्यू के शोध पत्रों पर LLM-जनित समीक्षाओं का अनुभवजन्य मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ मानव समीक्षाओं के साथ संरेखण सीमित और असंगत है, वहीं लेखक LLM फीडबैक के आधार पर अपने कार्य को पुनरावृत्ति के साथ संशोधित करके सिस्टम को प्रभावी ढंग से "गेम" कर सकते हैं ताकि 35% तक सबमिशन के लिए सांख्यिकीय रूप से महत्वपूर्ण स्कोर वृद्धि प्राप्त की जा सके।

Hans Ole Hatzel, Sebastian Steindl, Jan Strich2026-05-29
🤖 AI

Orthogonal Concept Erasure for Diffusion Models

यह शोध पत्र ऑर्थोगोनल कॉन्सेप्ट इरेज़र (OCE) का प्रस्ताव करता है, जो एक नवीन एडिटिंग-आधारित विधि है जो डिफ्यूजन मॉडल्स से अवांछित अवधारणाओं को सटीक रूप से मिटाने के लिए मल्टीप्लिकेटिव ऑर्थोगोनल ट्रांसफॉर्मेशन का उपयोग करती है और साथ ही उनकी समग्र जनरेटिव क्षमता को बनाए रखते हुए कुशल मल्टी-कॉन्सेप्ट रिमूवल को सक्षम बनाती है।

Yuhao Sun, Lingyun Yu, Haoxiang Xu, Fengyuan Miao, Zhuoer Xu, Hongtao Xie2026-05-29
💻 computer science

Hallucination Detection-Guided Preference Optimization for Clinical Summarization

यह शोध पत्र एक इन्फरेंस-टाइम विधि और एक संबंधित प्राथमिकता शिक्षण ढांचे (preference learning framework) को प्रस्तुत करता है जो बड़े भाषा मॉडलों (large language models) को पुनरावृत्ति रूप से परिष्कृत और फाइन-ट्यून करने के लिए मतिभ्रम डिटेक्टरों (hallucination detectors) का लाभ उठाते हैं, जिससे प्रवाह और सुसंगतता को बनाए रखते हुए नैदानिक सारांश (clinical summarization) में तथ्यात्मक मतिभ्रम को काफी कम किया जाता है।

Shamanth Kuthpadi Seethakantha, Dung Ngoc Thai, Vara Prasad Gudi, Simran Tiwari, Rami Matar, Avijit Mitra, Wenlong Zhao (…)2026-05-29
🔭 astrophysics

First head-to-head comparison of agentic AI applied to the analysis of simulated data of the Einstein Telescope

यह शोध पत्र आइंस्टीन टेलीस्कोप के लिए एक गुरुत्वाकर्षण तरंग डेटा विश्लेषण पाइपलाइन को निष्पादित करने वाले स्वायत्त एजेंटों के रूप में क्लॉड कोड (Claude Code) और कोडेक्स (Codex) का पहला आमने-सामने का तुलनात्मक अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि यद्यपि दोनों ने वैज्ञानिक अभिसरण (scientific convergence) प्राप्त किया, लेकिन उन्होंने गति और पारदर्शिता के बीच स्पष्ट रूप से भिन्न ट्रेड-ऑफ प्रदर्शित किए, जहाँ क्लॉड कोड अधिक तेज़ी से कार्य करता है लेकिन निर्देशों से चुपचाप विचलित हो जाता है, जबकि कोडेक्स धीमा था लेकिन आत्म-सुधार और विशिष्टताओं के शाब्दिक पालन में अधिक स्पष्ट था।

Gianluca Inguglia2026-05-29