💻 computer science

Lacuna: A Research Map for Machine Learning

लैक्युना (Lacuna) एक मशीन लर्निंग रिसर्च मैप है जो विद्वत्तापूर्ण शोध पत्रों को संरचित, लिंक-समर्थित सारांशों और प्रस्तावों में बदलने के लिए एलएलएम (LLMs) का लाभ उठाता है, जो ओपनस्कॉलर (OpenScholar) और जीपीटी-रिसर्चर (GPT-Researcher) जैसे मौजूदा बेंचमार्क की तुलना में साहित्य पुनर्प्राप्ति और गहन अनुसंधान रिपोर्ट निर्माण में बेहतर प्रदर्शन प्रदर्शित करता है।

Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman2026-06-26
🤖 AI

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

यह शोधपत्र स्वायत्त एआई प्रणालियों के लिए एक शासन मॉडल प्रस्तावित करता है जो योजना बनाने में एजेंट की स्वायत्तता को बनाए रखता है, जबकि उच्च-जोखिम वाले कार्यों के निष्पादन को उन कार्यों तक सीमित करता है जो स्वतंत्र रूप से आधिकारिक स्रोतों द्वारा प्रमाणित हों, इरादे (intent) से क्रिप्टोग्राफिक रूप से बंधे हों, और नियत नीतियों (deterministic policies) द्वारा मान्य हों।

Jakob Salfeld-Nebgen2026-06-26
🤖 AI

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

यह शोध पत्र तर्क देता है कि जैसे-जैसे कोडिंग एजेंट अधिक सक्षम होते जा रहे हैं, उनके आउटपुट का विश्वसनीय सत्यापन प्राथमिक बाधा बन गया है क्योंकि मानव इरादे की अपूर्ण विशिष्टता और त्रुटिपूर्ण प्रॉक्सी सत्यापनकर्ताओं के बीच एक अंतर्निहित अंतर मौजूद है, जिसके लिए रिवॉर्ड डिज़ाइन के प्रति एक सह-विकासवादी दृष्टिकोण की आवश्यकता है जो रिवॉर्ड हैकिंग को रोकने और निरंतर सुधार सुनिश्चित करने के लिए स्केलेबिलिटी, निष्ठा और मजबूती के बीच संतुलन बनाए रखे।

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen, Mouxiang Chen, Rongyao Fang, Siyuan Zhang, Xuwu W (…)2026-06-26
🤖 AI

How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?

यह शोध पत्र 243 विशेषज्ञ-क्यूरेटेड, वास्तविक दुनिया के ऊर्जा बाजार विश्लेषण कार्यों—लाइव डेटा पुनर्प्राप्ति से लेकर मात्रात्मक मॉडलिंग तक—पर टूल-संवर्धित एलएलएम (LLM) एजेंटों के प्रदर्शन का मूल्यांकन करने वाले एक अनुभवजन्य अध्ययन को प्रस्तुत करता है, जिसमें यह आकलन करने के लिए एक बहु-आयामी स्कोरिंग प्रोटोकॉल का उपयोग किया गया है कि मॉडल की क्षमताएं और डोमेन-विशिष्ट उपकरण उच्च-दांव वाले पेशेवर परिवेश में कैसे परस्पर क्रिया करते हैं।

David Akinpelu, Akintonde Abbas, Rereloluwa Alimi, Ayodeji Lana2026-06-26
🤖 AI

What We are Missing in Multimodal LLM Evaluation?

यह शोध पत्र तर्क देता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) के लिए वर्तमान मूल्यांकन बेंचमार्क अपर्याप्त हैं क्योंकि वे टेम्पोरल-स्पेशियल कोहेरेंस (temporal-spatial coherence), भौतिक दुनिया की समझ (physical world understanding), मल्टीमॉडल निरंतरता (multimodal consistency) और चयनात्मक ध्यान (selective attention) जैसी महत्वपूर्ण क्षमताओं का आकलन करने के बजाय अलग-थलग कार्यों पर ध्यान केंद्रित करते हैं, और यह इन कमियों को दूर करने तथा वास्तविक मल्टीमॉडल बुद्धिमत्ता को बेहतर ढंग से मापने के लिए एक संशोधित वर्गीकरण (taxonomy) प्रस्तावित करता है।

Po-han Li, Shenghui Chen, Sandeep Chinchali, Ufuk Topcu2026-06-26
🤖 AI

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

यह शोध पत्र OpenFinGym को प्रस्तुत करता है, जो एक एकीकृत और सत्यापन योग्य मल्टी-टास्क जिम वातावरण है जो मौजूदा बेंचमार्क में विखंडन और वित्तीय प्रासंगिकता की कमी को दूर करने के लिए पूर्वानुमान और रणनीति निर्माण से लेकर वास्तविक समय के व्यापार और धोखाधड़ी का पता लगाने तक विविध क्वांटिटेटिव फाइनेंस वर्कफ़्लो को स्वचालित कार्य पीढ़ी और मजबूत सत्यापन तंत्र के साथ एकीकृत करता है ताकि लार्ज लैंग्वेज मॉडल एजेंटों का बेहतर मूल्यांकन किया जा सके।

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni2026-06-26
🤖 AI

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

यह शोध पत्र "कंपोजिशनल बिहेवियरल लीकेज" (CBL) को पहचानता और औपचारिक रूप देता है, जो प्रॉम्प्ट-निर्मित एजेंटिक प्रणालियों में एक सूक्ष्म विफलता मोड है जहाँ ट्रांसफॉर्मर सेल्फ-अटेंशन में आर्किटेक्चरल गैर-अलगाव के कारण एक प्रॉम्प्ट मॉड्यूल को संपादित करना अन्य मॉड्यूल के व्यवहार को चुपचाप बदल देता है, जो अनुभवजन्य परीक्षणों के माध्यम से यह प्रदर्शित करता है कि ऐसा हस्तक्षेप, हालांकि व्यक्तिगत निर्णयों के लिए अक्सर सीमा से नीचे होता है, बड़े पैमाने पर तैनाती में एक महत्वपूर्ण संचयी जोखिम पैदा करता है।

Ching-Yu Lin, Yifan Liu2026-06-26
💻 computer science

Hybrid privacy-aware semantic search: SVD-truncated document geometry and CKKS-encrypted query reranking under a restricted threat model

यह शोध पत्र एक हाइब्रिड गोपनीयता-जागरूक सिमेंटिक सर्च फ्रेमवर्क प्रस्तावित करता है जो स्थिर दस्तावेज़ वेक्टर्स के लिए SVD-ट्रंकेटेड ज्यामितीय अस्पष्टीकरण (geometric obfuscation) को डायनेमिक क्वेरी रीरैंकिंग के लिए CKKS होमोमोर्फिक एन्क्रिप्शन के साथ जोड़ता है, जिससे एक परिभाषित थ्रेट मॉडल के तहत उच्च रैंकिंग गुणवत्ता बनाए रखते हुए एम्बेडिंग-इन्वर्जन हमलों के विरुद्ध मजबूत सुरक्षा और सब-सेकंड लेटेंसी प्राप्त होती है।

Sergey Kurilenko2026-06-26
💬 NLP

Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models

यह शोध पत्र सोशल-फिजिकल ह्यूमन-रोबोट इंटरैक्शन (spHRI) का एक व्यवस्थित अवलोकन प्रस्तुत करता है जो यह दर्शाता है कि कैसे स्थानीय रूप से चलने वाले छोटे लैंग्वेज मॉडल्स (SLMs) मानव विशेषज्ञ स्क्रीनिंग को प्रभावी ढंग से बढ़ा सकते हैं, जिससे प्रक्रिया में काफी तेजी आती है और उन प्रासंगिक शोध पत्रों की पहचान होती है जिन्हें समीक्षक अन्यथा चूक सकते थे।

Mayumi Mohan, Ju-Hung Chen, Alexis E. Block2026-06-26