🤖 AI

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

यह शोध पत्र छह लोकप्रिय कोडिंग एजेंटों की पहली व्यवस्थित रेड-टीमिंग (red-teaming) प्रस्तुत करता है, जो प्रॉम्प्ट एक्सफिल्ट्रेशन (prompt exfiltration) के लिए एक सामान्य "टूललीक" (ToolLeak) भेद्यता और एक नवीन दो-चैनल प्रॉम्प्ट इंजेक्शन तकनीक को प्रकट करता है जो विविध एजेंट-एलएलएम (agent-LLM) संयोजनों में रिमोट कोड निष्पादन (remote code execution) प्राप्त करने के लिए टूल इनवोकेशन (tool invocations) को सफलतापूर्वक हाईजैक करती है।

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong Sh (…)2026-06-30
🔬 physics

ArchesClimate: Probabilistic Decadal Ensemble Generation With Flow Matching

यह शोध पत्र ArchesClimate को प्रस्तुत करता है, जो IPSL-CM6A-LR सिमुलेशन पर प्रशिक्षित एक डीप लर्निंग-आधारित एमुलेटर है जो स्थिर, भौतिक रूप से सुसंगत और विनिमेय (interchangeable) दशक जलवायु एन्सेम्बल सदस्यों को कुशलतापूर्वक उत्पन्न करने के लिए फ्लो मैचिंग का उपयोग करता है, जिससे आंतरिक परिवर्तनशीलता (internal variability) की खोज करने की कम्प्यूटेशनल लागत में काफी कमी आती है।

Graham Clyne, Guillaume Couairon, Guillaume Gastineau, Claire Monteleoni, Anastase Charantonis2026-06-30
💬 NLP

Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning

यह शोध पत्र एक पैटर्न-अवेयर टूल-इंटीग्रेटेड रीजनिंग फ्रेमवर्क प्रस्तावित करता है जो शिक्षक की प्राथमिकताओं के साथ पैटर्न चयन को संरेखित करने से पहले कोड निष्पादन और एल्गोरिद्मिक एनकोडिंग पैटर्न दोनों को स्पष्ट रूप से सीखकर बड़े रीजनिंग मॉडल्स में सुधार करता है, जिससे MATH500 और AIME24 जैसे चुनौतीपूर्ण गणितीय बेंचमार्क पर महत्वपूर्ण सटीकता लाभ प्राप्त होता है।

Ningning Xu, Yuxuan Jiang, Shubhashis Roy Dipta, Hengyuan Zhang2026-06-30
💰 quantitative finance

Generative AI and Sales Productivity: Field Experiments in Online Retail

एक प्रमुख सीमा पार रिटेल प्लेटफॉर्म पर बड़े पैमाने के यादृच्छिक क्षेत्र प्रयोगों (randomized field experiments) के माध्यम से, यह अध्ययन प्रदर्शित करता है कि प्रमुख व्यावसायिक वर्कफ़्लो में जनरेटिव एआई (Generative AI) को एकीकृत करना बिक्री उत्पादकता को महत्वपूर्ण रूप से बढ़ाता है—मुख्य रूप से खरीद के बाद की संतुष्टि को नुकसान पहुँचाए बिना रूपांतरण दरों (conversion rates) को बढ़ाकर—जिसमें सबसे अधिक लाभ कम अनुभवी उपभोक्ताओं के बीच देखा गया है।

Lu Fang, Zhe Yuan, Kaifu Zhang, Dante Donati, Miklos Sarvary2026-06-30
💬 NLP

Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers

यह शोध पत्र यह प्रदर्शित करता है कि एक प्रतीकात्मक इनडायरेक्ट ऑब्जेक्ट आइडेंटिफिकेशन (Indirect Object Identification) कार्य पर स्क्रैच से छोटे, अटेंशन-ओनली ट्रांसफॉर्मर्स को प्रशिक्षित करने से न्यूनतम, अत्यधिक व्याख्या योग्य सर्किट—विशेष रूप से एक दो-हेड सिंगल-लेयर मॉडल—प्राप्त होते हैं जो विशिष्ट योगात्मक (additive) और विरोधाभासी (contrastive) उप-सर्किट्स के माध्यम से पूर्ण सटीकता प्राप्त करते हैं, जिससे ट्रांसफॉर्मर रीजनिंग के कम्प्यूटेशनल आधारों को समझने के लिए एक नियंत्रित ढांचा प्रदान होता है।

Rabin Adhikari2026-06-30
💬 NLP

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

यह शोध पत्र प्रदर्शित करता है कि आगामी फाइन-ट्यूनिंग आम तौर पर ज्ञान संवर्द्धन (knowledge edits) में पर्याप्त क्षय का कारण बनती है, जो यह प्रकट करता है कि केवल संपादित परतों (edited layers) को फाइन-ट्यून करना डाउनस्ट्रीम प्रदर्शन को बनाए रखते हुए ऐसे संवर्द्धनों को हटाने का एक प्रभावी तरीका है, जिससे मॉडल अनुकूलन पाइपलाइनों के व्यापक संदर्भ के भीतर ज्ञान संवर्द्धन के मूल्यांकन की महत्वपूर्ण आवश्यकता रेखांकित होती है।

Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao2026-06-30
💻 computer science

SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?

यह शोध पत्र SWE-fficiency को प्रस्तुत करता है, जो 498 वास्तविक-विश्व रिपॉजिटरी कार्यों वाला एक बेंचमार्क है जिसे कोड की शुद्धता बनाए रखते हुए उसके प्रदर्शन को अनुकूलित करने की भाषा मॉडलों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक एजेंट बॉटलनैक्स (bottlenecks) को स्थानीयकृत करने और जटिल कोडबेस में तर्क करने के मामले में मानव विशेषज्ञों की तुलना में काफी कम प्रदर्शन करते हैं।

Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarath (…)2026-06-30
🤖 machine learning

Weighted Contrastive Learning for Anomaly-Aware Time-Series Forecasting

यह शोध पत्र वेटेड कॉन्ट्रास्टिव एडेप्टेशन (WECA) का प्रस्ताव करता है, जो एक नवीन विधि है जो सामान्य और विसंगति-संवर्धित (anomaly-augmented) निरूपणों को संरेखित करती है ताकि नियमित डेटा पर प्रदर्शन बनाए रखते हुए विसंगतिपूर्ण स्थितियों के तहत मल्टीवेरिएट टाइम-सीरीज़ पूर्वानुमान सटीकता में महत्वपूर्ण सुधार किया जा सके।

Joel Ekstrand, Tor Mattsson, Zahra Taghiyarrenani, Slawomir Nowaczyk, Jens Lundström, Mikael Lindén2026-06-30
💬 NLP

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

यह शोध पत्र ORCA को प्रस्तुत करता है, जो ऑडियो प्रश्नोत्तर में मुक्त-अंत वाली प्रतिक्रियाओं के मूल्यांकन के लिए एक हल्का मॉडल-आधारित ढांचा है, जो मानव निर्णयों के साथ उच्च सहसंबंध प्राप्त करने और समस्याग्रस्त बेंचमार्क मदों को प्रभावी ढंग से पहचानने के लिए एक तीन-चरणीय मानव-AI एनोटेशन पाइपलाइन का लाभ उठाता है।

Šimon Sedláček, Sara Barahona, Bolaji Yusuf, Laura Herrera-Alarcón, Santosh Kesiraju, Cecilia Bolaños, Alicia Lozano-Die (…)2026-06-30
💻 computer science

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

यह शोध पत्र STAR फ्रेमवर्क प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को एक व्यापक वीडियो टूलकिट और एक रणनीतिक शेड्यूलिंग तंत्र से सुसज्जित करता है ताकि स्पैटियोटेम्पोरल रीजनिंग (स्थानिक-कालिक तर्क) को बढ़ाया जा सके, जिसके परिणामस्वरूप VideoMME और LongVideoBench जैसे चुनौतीपूर्ण VideoQA बेंचमार्क पर महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang2026-06-30