🤖 AI

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

यह शोध पत्र VideoSearcher प्रस्तुत करता है, जो एक क्लोज्ड-लूप एजेंटिक फ्रेमवर्क है जो टेम्पोरल लोकलाइजेशन (temporal localization), स्पेशियल फोकसिंग (spatial focusing) और मल्टीमॉडल सर्च को एकीकृत करके वीडियो डीप रिसर्च को आगे बढ़ाने के लिए मल्टी-टूल रीजनिंग और एक नवीन Bi-branch Sequence Policy Optimization (BiSPO) सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम का लाभ उठाता है, जिसके साथ मूल्यांकन के लिए नया VideoSearch-QA बेंचमार्क भी दिया गया है।

Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xi (…)2026-07-07
🤖 AI

PromptPET: Privacy-Utility Optimized Prompt Obfuscation

यह शोध पत्र PROMPTPET को प्रस्तुत करता है, जो एक LLM-आधारित एजेंट है जो उपयोगकर्ता की गोपनीयता और चैटबॉट उपयोगिता के बीच के संतुलन को अनुकूलित करने के लिए उपयोगकर्ता के प्रॉम्प्ट में संवेदनशील जानकारी हेतु सबसे प्रभावी अस्पष्टीकरण क्रिया (रे redaction, अमूर्तीकरण, प्रतिस्थापन, या एक नवीन शोर/शोर-निवारण योजना) को गतिशील रूप से चुनता है।

Ke Yang, Olivia Figueira, Umar Iqbal, Athina Markopoulou2026-07-07
🔬 materials science

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

यह शोध पत्र MatPhaseBench प्रस्तुत करता है, जो जटिल पदार्थ अवस्था आरेखों (materials phase diagrams) को समझने में विजन-लैंग्वेज मॉडल्स की क्षमताओं का मूल्यांकन करने के लिए 3,681 पदार्थ विज्ञान संबंधी शोध पत्रों से प्राप्त एक उच्च-गुणवत्ता वाला, मानव-सत्यापित बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल गहरे ऊष्मागतिक तंत्र विश्लेषण (thermodynamic mechanism analysis) के बजाय केवल सतही दृश्य धारणा (surface visual perception) पर अपनी निर्भरता के कारण विशेषज्ञ-स्तरीय तर्क कौशल से काफी पीछे हैं।

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang2026-07-07
🤖 AI

The Foreign Policy AI Evaluation Gap

यह शोध पत्र तर्क देता है कि विदेश नीति कूटनीति में निहित अद्वितीय संरचनात्मक जटिलताओं और विनाशकारी जोखिमों के लिए एक मांग-पक्ष मूल्यांकन ढांचे को विकसित करने हेतु एक तत्काल, साहित्य-आधारित अनुसंधान एजेंडा आवश्यक है जो उच्च-परिणाम वाले वर्कफ़्लो को मूल्यांकनीय उप-कार्यों में विभाजित कर सके, जिससे इस क्षेत्र के लिए तकनीकी एआई (AI) शासन में वर्तमान महत्वपूर्ण अंतराल को संबोधित किया जा सके।

Charles Pozniak, Jeba Sania2026-07-07
💬 NLP

Individual Parameters in Weight-Sparse Transformers Appear Interpretable

यह शोध पत्र एक स्वचालित LLM पाइपलाइन प्रस्तुत करता है जो यह सत्यापित करता है कि क्या ट्रांसफॉर्मर में व्यक्तिगत वेट्स (weights) के पास वैश्विक रूप से व्याख्या योग्य कार्य होते हैं, जिसमें यह पाया गया कि डेंस मॉडल्स की तुलना में वेट-स्पार्स (weight-sparse) मॉडल्स में ऐसे व्याख्या योग्य वेट्स का एक काफी अधिक हिस्सा (12–31%) होता है।

Arnau Marin-Llobet, Stefan Heimersheim2026-07-07
💬 NLP

Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

यह शोध पत्र इन्कोग्निटा (Incognita) को प्रस्तुत करता है, जो सामाजिक रूप से वितरित कार्य परिवेशों में जनरेटिव एजेंटों के मूल्यांकन के लिए एक ढांचा है जहाँ ज्ञान को भूमिका-पृथक संस्थाओं (role-isolated entities) के बीच विभाजित किया गया है, यह प्रदर्शित करते हुए कि हालांकि वर्तमान मॉडल ज्ञान प्राप्ति (knowledge elicitation) और समयपूर्व समापन में कमी जैसे बेहतर व्यवहार दिखाते हैं, फिर भी उनकी समग्र सफलता दर कम बनी हुई है।

Dan C. Hsu, Luke Lu2026-07-07
🧬 biology

Back to Basics: Improving Molecular Understanding in LLMs via SMILES-Graph Translation

यह शोधपत्र MolBasic को प्रस्तुत करता है, जो एक संरचना-प्रथम (structure-first) ढांचा है जो द्विदिशीय SMILES-ग्राफ अनुवाद और एक प्रगतिशील चेन-ऑफ-थॉट (Chain-of-Thought) शिक्षण योजना का उपयोग करके आणविक बड़े भाषा मॉडलों की संरचनात्मक समझ और डाउनस्ट्रीम प्रदर्शन को बढ़ाता है।

Wenda Wang, Jinjia Feng, Zhewei Wei2026-07-07
💬 NLP

Can Model Merging Improve Aggregation in DiLoCo?

यह शोध पत्र यह प्रदर्शित करके मॉडल मर्जिंग और डिस्ट्रिब्यूटेड लर्निंग के बीच के अंतर को पाटता है कि नेस्टरोव मोमेंटम के साथ आइसो-सी (Iso-C) मर्जिंग तकनीक को अनुकूलित करना (IsoLoCo), कम-कम्युनिकेशन वाले डिस्ट्रिब्यूटेड ट्रेनिंग में मौजूदा डिलोको (DiLoCo) विधियों से काफी बेहतर प्रदर्शन करता है, विशेष रूप से जैसे-जैसे स्थानीय वर्कर्स की संख्या बढ़ती है।

Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky2026-07-07
🤖 AI

Beyond Forecasting: The Belief-to-Trade Layer in Prediction-Market Agents

यह शोधपत्र Raven-Agent को प्रस्तुत करता है, जो प्रेडिक्शन मार्केट्स (prediction markets) के लिए पहला स्वायत्त ट्रेडिंग एजेंट है, जो आर्काइव किए गए निर्णय डेटा पर सकारात्मक रिटर्न प्राप्त करने के लिए कैलिब्रेटेड पूर्वानुमान और लाभदायक ट्रेडिंग के बीच के अंतर को पाटकर मौजूदा नीतियों से बेहतर प्रदर्शन करता है।

Yishu Wang, Yuxuan Wang, Jiaqi Deng, Hanyang Tang2026-07-07
🤖 AI

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

ओम्नीफोकस (OmniFocus) एक प्रशिक्षण-मुक्त, क्वेरी-निर्देशित टोकन संपीड़न विधि है जो ओम्नी-मोडल लार्ज लैंग्वेज मॉडल्स के लिए ऑडियो और वीडियो टोकन के महत्व का स्वतंत्र रूप से आकलन करके मोडैलिटी-सिमेट्रिक संपीड़न प्राप्त करती है, जिससे क्रॉस-मोडल संरेखण को बनाए रखते हुए और सटीकता-दक्षता ट्रेड-ऑफ में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करते हुए अनुमान लागत को कम किया जाता है।

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun2026-07-07