🤖 AI

SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent

यह शोध पत्र स्टेट-अडेप्टिव मेमोरी (SAM) का प्रस्ताव करता है, जो एक स्टैंडअलोन फ्रेमवर्क है जो इंटरैक्शन इतिहास को संक्षिप्त, इरादा-संचालित मेमोरी क्यूज़ में समेकित करके दीर्घकालिक एजेंटिक तर्क (long-horizon agentic reasoning) को बढ़ाता है, जिससे एजेंटों को अंतर्निहित मॉडल को पुन: प्रशिक्षित किए बिना दूरस्थ जानकारी को गतिशील रूप से पुनर्गठित करने की अनुमति मिलती है, और विविध बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Yuyang Hu, Hongjin Qian, Shuting Wang, Jiongnan Liu, Ziliang Zhao, Jiejun Tan, Zheng Liu, Zhicheng Dou2026-05-26
🤖 AI

AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning

यह शोधपत्र AgentFugue को प्रस्तुत करता है, जो एक सामूहिक तर्क (collective reasoning) ढांचा है जो एक साझा तर्क हब (shared reasoning hub) के माध्यम से समानांतर पीअर एजेंटों को जोड़कर और मध्यवर्ती खोजों के रिकॉर्ड और पुन: उपयोग की सुविधा प्रदान करके दीर्घकालिक कार्यों (long-horizon tasks) के प्रदर्शन को बढ़ाता है, जिससे यह प्रदर्शित होता है कि एजेंट प्रणालियों को स्केल आउट करना केवल कंप्यूट विस्तार से परे विशिष्ट क्षमता लाभ प्रदान कर सकता है।

Yuyang Hu, Hongjin Qian, Shuting Wang, Jiongnan Liu, Tong Zhao, Xiaoxi Li, Zheng Liu, Zhicheng Dou2026-05-26
🧬 biology

TIGER: Text-Informed Generalized Enzyme-Reaction Retrieval

यह शोध पत्र TIGER को प्रस्तुत करता है, जो एक टेक्स्ट-इन्फॉर्म्ड फ्रेमवर्क है जो सामान्यीकृत एंजाइम निरूपण (representations) बनाने के लिए प्रोटीन-टू-टेक्स्ट जनरेशन मॉडल्स और एक डायनेमिक गेटिंग नेटवर्क का लाभ उठाता है, जो विविध वितरणों और कार्यों में द्विदिशीय एंजाइम-प्रतिक्रिया पुनर्प्राप्ति (bidirectional enzyme-reaction retrieval) में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Yuhang Zhang, Keyan Ding, Peilin Chen, Han Liu, Can Lin, Ruixi Chen, Shiqi Wang, Qi Song2026-05-26
💻 computer science

Adaptive Punishment for Cooperation in Mixed-Motive Games

यह शोध पत्र एडेप्टिव पनिशमेंट फॉर कोऑपरेशन (APC) का प्रस्ताव करता है, जो एक वितरित विधि है जो लागत और प्रभावकारिता को प्रभावी ढंग से संतुलित करने के लिए डिफेक्शन की गंभीरता और संभावना के आधार पर दंड की तीव्रता को गतिशील रूप से समायोजित करती है, जिससे मिश्रित-प्रेरणा वाले मल्टी-एजेंट परिदृश्यों में सहयोग को बढ़ावा मिलता है।

Min Tang, Fanqi Kong, Linyuan Lü, Xue Feng2026-05-26
🤖 AI

Hypothesis Generation and Inductive Inference in Children and Language Models

यह शोध पत्र एक आगमनात्मक अनुमान (inductive inference) कार्य में मानव बच्चों और LLM-आधारित एजेंटों की तुलना करता है, जो यह प्रकट करता है कि हालांकि दोनों विशिष्ट कम्प्यूटेशनल तंत्रों के माध्यम से पर्यावरणीय अनिश्चितता और साक्ष्य विश्वसनीयता के प्रति समान रूप से अनुकूलित होते हैं, फिर भी LLMs बच्चों की तुलना में अत्यधिक अवलोकन (over-observation) और निर्देश अनुपालन की अनूठी प्रवृत्तियों को प्रदर्शित करते हैं।

Jeffrey Qin, Wasu Top Piriyakulki, Zhuangfei Gao, Mia Radovanovic, Jessica Sommerville, Kevin Ellis, Marta Kryven2026-05-26
💻 computer science

AI-Driven Adaptive Adversaries and the Erosion of Cryptographic Trust in Public Key Systems

यह शोध पत्र इस बात की जांच करता है कि कैसे एआई-संचालित अनुकूलनशील विरोधी (AI-driven adaptive adversaries), कार्यान्वयन-स्तरीय अवलोकनीयताओं (implementation-level observabilities) का लाभ उठाकर पब्लिक की क्रिप्टोग्राफी को कमजोर कर रहे हैं, जिससे पारंपरिक एल्गोरिदम-केंद्रित सुरक्षा मॉडलों और आधुनिक परिचालन हमले की वास्तविकताओं के बीच एक महत्वपूर्ण विसंगति उजागर होती है।

Petar Radanliev2026-05-26
🤖 machine learning

Rethinking Federated Unlearning via the Lens of Memorization

यह शोध पत्र फेडरेटेड मेमोराइजेशन प्रूनिंग (FedMemPrune) का प्रस्ताव करता है, जो एक नया 'ग्रुपड मेमोराइजेशन इवैल्यूएशन' मीट्रिक का लाभ उठाने वाला एक नवीन फेडरेटेड अनलर्निंग दृष्टिकोण है, जो मॉडल की उपयोगिता से समझौता किए बिना प्रभावी अनलर्निंग प्राप्त करने के लिए ओवरलैपिंग पैटर्न को संरक्षित करते हुए अद्वितीय मेमोराइज्ड जानकारी को अलग करने और हटाने का कार्य करता है।

Jiaheng Wei, Yanjun Zhang, He Zhang, Leo Yu Zhang, Chao Chen, Kok-Leong Ong, Jun Zhang, Yang Xiang2026-05-26
🤖 AI

Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models

यह शोध पत्र एक "बफर-एंड-रिनफोर्स" (Buffer-and-Reinforce) फाइन-ट्यूनिंग फ्रेमवर्क प्रस्तावित करता है जो हानिकारक ग्रेडिएंट्स को बफर करने के लिए अस्थायी जेलब्रेकिंग एडेप्टर्स का उपयोग करता है और तत्पश्चात QR डिकंपोजिशन-आधारित मर्जिंग के माध्यम से सुरक्षा संरेखण को सुदृढ़ करता है, जिससे बिना किसी अतिरिक्त सुरक्षा डेटा या महत्वपूर्ण कम्प्यूटेशनल ओवरहेड के लार्ज लैंग्वेज मॉडल्स को हानिकारक फाइन-ट्यूनिंग हमलों से सुरक्षित रखा जा सके।

Seokil Ham, Jaehyuk Jang, Wonjun Lee, Changick Kim2026-05-26
🤖 machine learning

PILOT: Policy-Informed Learned Optimization for Adaptive Deep Network Training

यह शोध पत्र PILOT को प्रस्तुत करता है, जो एक अनुकूली ऑनलाइन ऑप्टिमाइज़र है जो प्रशिक्षण स्थिरता में सुधार करने और मौजूदा विधियों की तुलना में FashionMNIST और CIFAR-10 पर बेहतर सटीकता प्राप्त करने के लिए ग्रेडिएंट-दिशा सहमति (gradient-direction agreement) के आधार पर अपने अपडेट व्यवहार को गतिशील रूप से समायोजित करता है।

Sattam Altuuaim, Lama Ayash, Muhammad Mubashar, Naeemullah Khan2026-05-26
🤖 machine learning

Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m

यह शोध पत्र यह प्रदर्शित करता है कि स्वतंत्र रूप से प्रशिक्षित ट्रांसफॉर्मर एक समान यादृच्छिक घूर्णन (uniform random rotation) द्वारा संबंधित परस्पर अविबोध्य आंतरिक निर्देशांकों का उपयोग करके समान फलनों की गणना करते हैं, जिसे "पॉलीमॉर्फिज्म" (polymorphism) नामक एक घटना कहा जाता है जिसे बिना पुनप्रशिक्षण के फीचर डिक्शनरी और स्टीयरिंग वेक्टर्स के प्रत्यक्ष हस्तांतरण को सक्षम करने के लिए एक एकल ऑर्थोगोनल प्रोक्रस्टेस फिट (orthogonal Procrustes fit) के माध्यम से हल किया जा सकता है।

Jordan F. McCann2026-05-26