🧬 biology

Clin-JEPA: A Multi-Phase Co-Training Framework for Joint-Embedding Predictive Pretraining on EHR Patient Trajectories

Clin-JEPA एक स्थिर, पांच-चरणीय सह-प्रशिक्षण ढांचे को पेश करता है जो जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर (JEPA) को EHR डेटा के अनुकूल बनाने में सफलतापूर्वक सक्षम बनाता है, जिससे एक एनकोडर और प्रेडिक्टर को संयुक्त रूप से प्रशिक्षित करके, एक एकल बैकबोन को प्रति-कार्य फाइन-ट्यूनिंग के बिना बेहतर लेटेंट-स्पेस प्रक्षेपवक्र पूर्वानुमान और बहु-कार्य जोखिम भविष्यवाणी प्राप्त करने में सक्षम बनाया जा सके।

Yixuan Yang, Mehak Arora, Ryan Zhang, Baraa Abed, Junseob Kim, Tilendra Choudhary, Md Hassanuzzaman, Kevin Zhu, Ayman Al (…)2026-05-12
🤖 AI

Training-Free Cultural Alignment of Large Language Models via Persona Disagreement

यह शोध पत्र DISCA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), ब्लैक-बॉक्स इन्फरेंस-टाइम विधि है, जो मॉडल आउटपुट को फाइन-ट्यूनिंग के बिना सुधारने के लिए वर्ल्ड वैल्यूज सर्वे-आधारित व्यक्तित्व मतभेदों (persona disagreements) का लाभ उठाकर बड़े भाषा मॉडलों (LLMs) को विविध सांस्कृतिक प्राथमिकताओं के साथ संरेखित करती है।

Huynh Trung Kiet, Dao Sy Duy Minh, Tuan Nguyen, Chi-Nguyen Tran, Phu-Hoa Pham, Nguyen Lam Phu Quy, The Anh Han, Long Tra (…)2026-05-12
🤖 AI

BEACON: A Multimodal Dataset for Learning Behavioral Fingerprints from Gameplay Data

यह शोध पत्र BEACON को प्रस्तुत करता है, जो 28 *Valorant* खिलाड़ियों के सिंक्रोनाइज़्ड गेमप्ले डेटा से बना एक बड़े पैमाने का मल्टीमॉडल डेटासेट है, जिसे वास्तविक प्रतिस्पर्धी तनाव के तहत उच्च-सटीक मोटर और संज्ञानात्मक संकेतों को कैप्चर करके निरंतर प्रमाणीकरण (continuous authentication) और व्यवहारिक फिंगरप्रिंटिंग अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है।

Ishpuneet Singh, Gursmeep Kaur, Uday Pratap Singh Atwal, Guramrit Singh, Gurjot Singh, Maninder Singh2026-05-12
🤖 AI

Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory

यह शोधपत्र DeMem का प्रस्ताव करता है, जो एक निर्णय-केंद्रित मेमोरी फ्रेमवर्क है जो वर्णनात्मक निष्ठा (descriptive fidelity) के बजाय निर्णय लेने के लिए महत्वपूर्ण विभेदों के संरक्षण को प्राथमिकता देकर सीमित बजट के तहत लॉन्ग-होरिज़न एजेंट प्रदर्शन को अनुकूलित करता है, जिससे नियर-मिनिमैक्स रिग्रेट गारंटी और सिंथेटिक एवं संवादात्मक बेंचमार्क पर निरंतर लाभ प्राप्त होता है।

Mingxi Zou, Zhihan Guo, Langzhang Liang, Zhuo Wang, Qifan Wang, Qingsong Wen, Irwin King, Lizhen Qu, Zenglin Xu2026-05-12
🧬 biology

AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents

यह शोध पत्र AssayBench प्रस्तुत करता है, जो 1,920 CRISPR स्क्रीन्स से बना एक नया बेंचमार्क है जिसे सेलुलर फेनोटाइपिक परिणामों (cellular phenotypic outcomes) की भविष्यवाणी करने के लिए लार्ज लैंग्वेज मॉडल्स और एजेंट्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि ज़ीरो-शॉट जनरलिस्ट LLMs वर्तमान में विशिष्ट जीव विज्ञान मॉडल्स (specialized biology models) से बेहतर प्रदर्शन करते हैं और साथ ही एक सुदृढ़ वर्चुअल सेल मॉडल प्राप्त करने की दिशा में सुधार की महत्वपूर्ण गुंजाइश को भी उजागर करते हैं।

Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajira (…)2026-05-12
🤖 machine learning

Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why

यह शोध पत्र एक प्रशिक्षण-मुक्त (training-free), प्रति-टोकन (per-token) नैदानिक ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) सही चरणों को सुदृढ़ करने के बजाय गलत तर्क चरणों को सुधारने के लिए सर्वाधिक लाभकारी है, जबकि यह भी प्रदर्शित करता है कि इष्टतम डिस्टिलेशन कॉन्फ़िगरेशन छात्र मॉडल की क्षमता और विशिष्ट कार्य के आधार पर महत्वपूर्ण रूप से भिन्न होता है।

Mohammadreza Armandpour, Fatih Ilhan, David Harrison, Ajay Jaiswal, Duc N. M Hoang, Fartash Faghri, Yizhe Zhang, Minsik (…)2026-05-12
🤖 machine learning

DataMaster: Towards Autonomous Data Engineering for Machine Learning

यह शोध पत्र DataMaster को प्रस्तुत करता है, जो एक स्वायत्त एजेंट फ्रेमवर्क है जो डेटा इंजीनियरिंग कार्यों—जैसे कि खोज, चयन और रूपांतरण—को साझा डेटा पूल्स और संचयी मेमोरी के साथ एक ट्री-स्ट्रक्चर्ड सर्च के माध्यम से अनुकूलित करके मशीन लर्निंग प्रदर्शन को बढ़ाता है, जो अंतर्निहित लर्निंग एल्गोरिदम में संशोधन किए बिना MLE-Bench Lite और PostTrainBench बेंचमार्क पर महत्वपूर्ण सुधार प्राप्त करता है।

Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xiny (…)2026-05-12
🤖 AI

Confidence-Guided Diffusion Augmentation for Enhanced Bangla Compound Character Recognition

यह शोध पत्र एक कॉन्फिडेंस-गाइडेड डिफ्यूजन ऑग्मेंटेशन फ्रेमवर्क प्रस्तावित करता है जो स्क्वीज़-एंड-एक्साइटेशन एन्हांसमेंट्स और एक फ़िल्टरिंग मैकेनिज्म के साथ क्लास-कंडीशनल डिफ्यूजन मॉडल्स का उपयोग करके उच्च गुणवत्ता वाले हस्तलिखित बांग्ला संयुक्त अक्षरों को संश्लेषित करता है, जिससे AIBangla डेटासेट पर 89.2% की नई स्टेट-ऑफ-द-आर्ट सटीकता प्राप्त होती है।

Md. Sultan Al Rayhan, Maheen Islam2026-05-12
🤖 machine learning

ELF: Embedded Language Flows

यह शोध पत्र एम्बेडेड लैंग्वेज फ्लोज़ (ELF) को प्रस्तुत करता है, जो एक निरंतर-समय फ्लो मैचिंग मॉडल है जो डिस्क्रीट टोकन में मैप करने से पहले मुख्य रूप से निरंतर एम्बेडिंग स्पेस में कार्य करता है, और मौजूदा डिस्क्रीट और निरंतर डिफ्यूजन लैंग्वेज मॉडल्स की तुलना में बेहतर जनरेशन गुणवत्ता और दक्षता प्रदर्शित करता है।

Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He2026-05-12
🤖 AI

Active teacher selection for reward learning

यह शोध पत्र रिवॉर्ड लर्निंग में एकल मानव शिक्षक को मानने की सीमा को संबोधित करने के लिए हिडन यूटिलिटी बैंडिट (HUB) फ्रेमवर्क और एक्टिव टीचर सिलेक्शन (ATS) एल्गोरिदम पेश करता है, जो विविध वास्तविक दुनिया के अनुप्रयोगों में तर्कसंगतता, विशेषज्ञता और लागत में शिक्षक की विषमता को प्रभावी ढंग से मॉडल और लाभान्वित करता है।

Rachel Freedman, Justin Svegliato, Kyle Wray, Stuart Russell2026-05-11