💬 NLP

MolSight: Molecular Property Prediction with Images

MolSight एक व्यवस्थित बड़े पैमाने का अध्ययन है जो यह प्रदर्शित करता है कि एक विजन एनकोडर द्वारा संसाधित एक एकल 2D कंकाल छवि (skeletal image), विशेष रूप से जब इसे रसायन-सूचित पाठ्यक्रम (chemistry-informed curriculum) के साथ प्रशिक्षित किया जाता है, ग्राफ-आधारित या भाषा मॉडल दृष्टिकोणों की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ विविध कार्यों में प्रतिस्पर्धी आणविक गुण भविष्यवाणी प्राप्त करती है।

Aaditya Baranwal, Akshaj Gupta, Yogesh S Rawat, Shruti Vyas2026-06-16
💻 computer science

Spectro-Temporal Interference Confounds Phase Encoding in Spatial Audio Foundation Models

यह शोध पत्र एक मनोध्वनिक (psychoacoustic) बेंचमार्क प्रस्तुत करता है जो यह दर्शाता है कि जहाँ समर्पित द्विकर्ण (binaural) स्थानिक ऑडियो मॉडल अंतर-कानीय चरण (interaural phase) सूचना को सफलतापूर्वक एनकोड करते हैं, वहीं सामान्य-उद्देश्य वाले द्विकर्ण मॉडल वास्तविक माइक्रोसेकंड चरण गणना के बजाय भ्रमित करने वाले स्पेक्ट्रो-टेम्पोरल हस्तक्षेप पैटर्न और ब्रॉडबैंड लिफाफों (broadband envelopes) पर निर्भर करते हैं।

Yuxuan Chen, Haoyuan Yu, Peize He2026-06-16
💬 NLP

Context Compression Is Not One Thing: Readable Symbolic Re-expression vs. Coherent Summary at Matched Budget

यह शोध पत्र यह प्रदर्शित करता है कि छोटे भाषा मॉडलों (small language models) के साथ मल्टी-हॉप प्रश्न-उत्तर (multi-hop question answering) के लिए, 'टेलीग्राफ इंग्लिश' (Telegraph English) नामक एक पठनीय प्रतीकात्मक प्रारूप, जो पुनर्प्राप्त गद्यांशों को संरचित इकाई-संबंध कथनों (structured entity-relation statements) में पुनर्गठित करता है, इकाई सामग्री को अधिक सघनता से संरक्षित करके, समान बजट वाले संपीड़न बेसलाइन (matched-budget compression baselines) और सुसंगत गद्य सारांशों (coherent prose summaries) दोनों से काफी बेहतर प्रदर्शन करता है।

Sisong Bei, Mikhail L. Arbuzov, Ziwei Dong, Dmitri Kalaev, Alexey Shvets2026-06-16
🤖 AI

Dr-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion

यह शोध पत्र DR-DCI को प्रस्तुत करता है, जो एक रूपरेखा (framework) है जो रिट्राइवर-निर्देशित दस्तावेज़ पुनर्प्राप्ति (retriever-steered document retrieval) के माध्यम से एक स्थानीय वर्कस्पेस का गतिशील रूप से विस्तार करके डायरेक्ट कॉर्पस इंटरैक्शन को स्केल करता है, जिससे बड़े पैमाने पर कॉर्पस में बेहतर सटीकता और दक्षता प्राप्त करने के लिए पारंपरिक पुनर्प्राप्ति की स्केलेबिलिटी को डायरेक्ट कॉर्पस ऑपरेशन्स की परिशुद्धता के साथ जोड़ा जाता है।

Yi Lu, Zhuofeng Li, Ping Nie, Haoxiang Zhang, Yuyu Zhang, Kai Zou, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang2026-06-16
💬 NLP

Simplifying the Modeling of Arbitrary Conditionals in Natural Language

यह शोध पत्र आर्बिट्रेरी कंडिशनल्स जीपीटी (AC-GPT) का प्रस्ताव करता है, जो मानक कॉज़ल ट्रांसफॉर्मर्स में एक सरल संशोधन है जो मॉडल के मूल बाएँ-से-दाएँ प्रदर्शन और प्रशिक्षण दक्षता को संरक्षित करते हुए, एक ही फॉरवर्ड पास में मनमाने टेक्स्ट कंडिशनल्स (पिछले, भविष्य और मिश्रित संदर्भों सहित) से कुशल मूल्यांकन और सैंपलिंग को सक्षम बनाता है।

Yinhan Lu, Eric Elmoznino, Léo Gagnon, Sarthak Mittal, Tejas Kasetty, Guillaume Lajoie2026-06-16
💬 NLP

Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

नेमोट्रोन 3 अल्ट्रा (Nemotron 3 Ultra) एक ओपन-सोर्स, 550-बिलियन-पैरामीटर हाइब्रिड मंबा-ट्रांसफॉर्मर (Mamba-Transformer) मॉडल है जिसमें 1M-टोकन का कॉन्टेक्स्ट और उन्नत प्रशिक्षण तकनीकें हैं जो अत्याधुनिक सटीकता के साथ 6 गुना अधिक इन्फरेंस थ्रूपुट प्रदान करती है, जो इसे जटिल एजेंटिक रीजनिंग कार्यों के लिए आदर्श बनाती है।

NVIDIA (Allan), : (Allan), Aaron Blakeman (Allan), Aaron Thomas (Allan), Aastha Jhunjhunwala (Allan), Abhibha Gupta (Al (…)2026-06-16
💬 NLP

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

यह अध्ययन प्रदर्शित करता है कि जब एक निश्चित टोकन बजट के तहत मूल्यांकन किया जाता है, तो वैनिला वेब एजेंट अक्सर सफलता दर में मेमोरी और स्किल मॉड्यूल जैसे ऑनलाइन ऑग्मेंटेशन तरीकों के बराबर या उनसे बेहतर प्रदर्शन करते हैं, जो यह सुझाव देता है कि इन मॉड्यूल्स के लाभ अक्सर तब लुप्त हो जाते हैं जब उनके टोकन ओवरहेड को ध्यान में रखा जाता है।

Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier2026-06-16
💬 NLP

Deep Temporal Modeling and Ensemble Fusion for Multimodal Emotion Recognition from Physiological Signals

यह शोध पत्र मल्टीमॉडल इमोशन रिकग्निशन के लिए WESAD डेटासेट पर डीप लर्निंग मॉडल्स (LSTM, TCN, और Transformer) का एक व्यापक मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इन आर्किटेक्चर को संयोजित करने वाली एक लेट-फ्यूजन एंसेम्बल रणनीति 98.91% सटीकता के साथ अत्याधुनिक प्रदर्शन प्राप्त करती है।

Desta Haileselassie Hagos, Saurav Keshari Aryal, Patrick Ymele-Leki, Anietie Andy, Legand L. Burge2026-06-16
💬 NLP

ReportQA: QA-Based Radiology Report Evaluation

यह शोध पत्र ReportQA प्रस्तुत करता है, जो एक नवीन रेडियोलॉजी रिपोर्ट मूल्यांकन ढांचा है जो संरचित नैदानिक प्रश्न उत्पन्न करने और उत्तर देने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिसके परिणामस्वरूप QAScore मीट्रिक प्राप्त होता है जो मौजूदा मूल्यांकन विधियों की तुलना में रेडियोलॉजिस्ट के निर्णयों के साथ बेहतर तालमेल प्रदर्शित करता है।

Yiming Shi, Shaoshuai Yang, Xi Chen, Haolin Li, Hengyu Zhang, Che Jiang, Kaiwen Wang, Xun Zhu, Dong Xie, Fei Wang, Dejin (…)2026-06-16
💬 NLP

Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

यह शोध पत्र 11 दक्षिण-पूर्व एशियाई भाषाओं में न्यायसंगत टोकनाइज़र का एक व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि 'पैरिटी-अवेयर बीपीई' (Parity-aware BPE) और 'मॉर्फोलॉजी-ड्रिवन बाइट एनकोडिंग' (Morphology-Driven Byte Encoding), बहुभाषी लार्ज लैंग्वेज मॉडल्स के लिए संपीड़न दक्षता, अर्थपूर्ण तर्क और क्रॉस-लिंगुअल निष्पक्षता को संतुलित करने में विशिष्ट लाभ प्रदान करते हैं।

Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng, Hwee Tou Ng2026-06-16