🤖 machine learning

One Mask to Rule Them All: On Hidden Facts after Editing and How to Find Them

यह शोध पत्र प्रकट करता है कि ट्रांसफार्मर मॉडलों में विविध ज्ञान संपादन (knowledge edits), जैसे कि ROME और MEMIT, भार (weights) के एक सामान्य कार्यात्मक उप-स्थान (functional subspace) पर निर्भर करते हैं जो ज्ञान को ओवरराइट करने के बजाय बाद की परतों में ओवर-अटेंशन को दबा देता है, एक ऐसी प्रक्रिया जिसे संपादनों को उलटने और अवांछित संशोधनों के विरुद्ध सुरक्षा उपायों को सूचित करने के लिए एक बाइनरी मास्क के माध्यम से अलग किया जा सकता है।

Ali Holmov, Paul Youssef, Nandi Schoots, Christin Seifert2026-05-29
💻 computer science

WASHH: An Anchor-Aware Whale-Guided Selection Hyper-Heuristic for Continuous Optimization and SVC Configuration

यह शोध पत्र WASHH का प्रस्ताव करता है, जो एक एंकर-अवेयर व्हेल-गाइडेड सिलेक्शन हाइपर-ह्यूरिस्टिक है, जो सीमित मूल्यांकन बजट के तहत निरंतर अनुकूलन (continuous optimization) और SVC कॉन्फ़िगरेशन कार्यों में बेहतर प्रदर्शन प्राप्त करने के लिए एक ऑनलाइन रिवॉर्ड कंट्रोलर के साथ कई खोज रणनीतियों को गतिशील रूप से संयोजित करता है।

Yifu Zhao, Xiaofan Zou, Junhao Wei, Yanxiao Li, Baili Lu, Zhenhong Peng, Dexing Yao, Haochen Li, Qinbin He, Sio-Kei Im (…)2026-05-29
🤖 machine learning

Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents

यह शोध पत्र TradeArena प्रस्तुत करता है, जो एक ऑडिट करने योग्य टेस्टबेड है जो यह प्रदर्शित करता है कि विशिष्ट रिप्रजेंटेशन सिग्नेचर—जैसे कि एम्बेडिंग ड्रिफ्ट और प्रभावी-रैंक संकुचन (effective-rank contraction)—LLM ट्रेडिंग एजेंट की विफलताओं के शुरुआती संकेतक के रूप में कार्य कर सकते हैं, जबकि यह भी प्रकट करता है कि संरचित जोखिम फीडबैक, लाभप्रदता को सार्वभौमिक रूप से बढ़ाने के बिना, एलाइनमेंट डायग्नोस्टिक्स में सुधार करता है।

Weicheng Xue2026-05-29
🔭 astrophysics

Towards a Foundation Model for the Martian Atmosphere

यह शोध पत्र उपलब्ध डेटा स्रोतों का विश्लेषण करके, संभावित डाउनस्ट्रीम अनुप्रयोगों की पहचान करके, और वर्तमान सामान्य परिसंचरण मॉडलों (जनरल सर्कुलेशन मॉडल्स) की कम्प्यूटेशनल और अवलोकन संबंधी सीमाओं को दूर करने के लिए हालिया एआई (AI) प्रगति का लाभ उठाकर, मंगल के वायुमंडल के लिए एक डेटा-संचालित फाउंडेशन मॉडल विकसित करने के डिज़ाइन परिदृश्य की रूपरेखा प्रस्तुत करता है।

Sujit Roy, Udayshankar Nair, Yuling Wu, Georgios Priftis, Liping Wang, Anastasia Georgiou, Anne Jones, Björn Lütjens, Jo (…)2026-05-29
🤖 machine learning

Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?

यह शोध पत्र 'डिफरेंशियल सर्किट वल्नरेबिलिटी' नामक एक हेड-लेवल मीट्रिक प्रस्तुत करता है यह प्रदर्शित करने के लिए कि जबकि सुपरवाइज्ड फाइन-ट्यूनिंग मॉडल्स को नए कार्यों के अनुकूल बनाने में तेज़ होता है, सुदृढीकरण सीखना (रीइन्फोर्समेंट लर्निंग) आंतरिक कम्प्यूटेशनल सर्किट्स को बेहतर ढंग से संरक्षित करता है, जिससे कैटास्ट्रोफिक फॉरगेटिंग के प्रति इसके बेहतर प्रतिरोध का एक यांत्रिक स्पष्टीकरण मिलता है।

Jeanmely Rojas Nunez, Viraj Sawant, Nathan Allen, Nomgondalai Amgalanbaatar, Yannis Zongo, Vasu Sharma, Maheep Chaudhary2026-05-29
🤖 machine learning

Molecular Lead Optimization via Agentic Tool Planning

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक प्रक्षेपवक्र-जागरूक (trajectory-aware) LLM-रीजनिंग एजेंट है जो टूल चयन को एक क्रमिक निर्णय लेने की प्रक्रिया के रूप में तैयार करके आणविक लीड अनुकूलन (molecular lead optimization) में सुधार करता है, जिससे पारंपरिक एक-चरणीय दृष्टिकोणों की तुलना में संरचनात्मक समानता बनाए रखते हुए बेहतर ADMET गुणों की वृद्धि प्राप्त होती है।

Lingxiao Li, Haobo Zhang, Ruohao Fan, Bin Chen, Jiayu Zhou2026-05-29
🤖 machine learning

Self-Play Reinforcement Learning under Imperfect Information in Big 2

यह शोध पत्र 'बिग 2' (Big 2) नामक अपूर्ण-सूचना वाले कार्ड गेम के लिए एक सेल्फ-प्ले सुदृढीकरण शिक्षण (self-play reinforcement learning) ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि नियंत्रित परिस्थितियों में PPO, वैल्यू-आधारित विधियों से बेहतर प्रदर्शन करता है और मजबूत मल्टी-एजेंट एजेंटों को प्रशिक्षित करने के लिए एंट्रॉपी रेगुलराइजेशन (entropy regularization) और करंट-पॉलिसी सेल्फ-प्ले के लाभों को रेखांकित करता है।

Aalok Patwa2026-05-29
🤖 machine learning

TaxDistill: Improving Metagenomic Taxonomic Annotation via Distilled Genomic Foundation Models

TaxDistill एक नॉलेज डिस्टिलेशन फ्रेमवर्क है जो एक बड़े जीनोमिक फाउंडेशन मॉडल (GenomeOcean) का लाभ उठाकर एक हल्के स्टूडेंट नेटवर्क को प्रशिक्षित करने के लिए सॉफ्ट लेबल्स जेनरेट करता है, जिससे पारंपरिक समानता-आधार-आधारित विधियों से होने वाले शोर को कम किया जाता है और विविध डेटासेट्स में मेटाजीनोमिक टैक्सोनोमिक एनोटेशन की सटीकता में महत्वपूर्ण सुधार किया जाता है।

Rongye Ye, Lun Li, Zheng Luo, Yiran Zhan, Shuhui Song2026-05-29
🤖 machine learning

Pre-Registering the Detectable Effect: A Paired-MDE Budget for 4-bit Quantization Benchmarks, with a Pilot Audit

यह शोध पत्र युग्मित-द्विआधारी (paired-binary) नमूना-आकार गणनाओं से व्युत्पन्न एक रूढ़िवादी न्यूनतम पता लगाने योग्य प्रभाव (MDE) बजट प्रस्तावित करता है ताकि डिजाइनरों को विश्वसनीय 4-बिट क्वांटाइजेशन दावों को प्री-रजिस्टर करने के लिए बेंचमार्क करने में मदद मिल सके, जो एक पायलट ऑडिट के माध्यम से यह प्रदर्शित करता है कि छोटे उप-नमूनों पर रिपोर्ट किया गया बहुत सा बेंचमार्क विचलन वास्तव में द्विपद शोर (binomial noise) है और प्रॉम्प्ट-टेम्प्लेट परिवर्तनशीलता अक्सर क्वांटाइजेशन प्रभावों से अधिक होती है।

Zexin Zhuang, Yanhang Li, Zhichao Fan2026-05-29
🤖 machine learning

Towards Continuous-time Causal Foundation Models

यह शोध पत्र एक निरंतर-समय कारण मॉडल (continuous-time causal foundation model) प्रस्तावित करता है जो पृथक प्रेक्षणों (decoupled observations) के साथ महीन-ग्रिड एकीकरण (fine-grid integration) के माध्यम से अवलोकन अनुसूचियों के प्रति प्रक्षेपवक्र-नियम अपरिवर्तनीयता (trajectory-law invariance) सुनिश्चित करता है, जो विविध गैररेखीय गतिकी और अनियमित डेटा परिदृश्यों में सरल एकीकरण विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Dennis Thumm, Ruben Wiedemann, Ying Chen2026-05-29