🧬 biology

Ontology-constrained multi-LLM scoring of hypothesis support in the predictive processing literature

यह शोध पत्र एक ऑन्टोलॉजी-प्रतिबंधित, मल्टी-एलएलएम (multi-LLM) पाइपलाइन प्रस्तुत करता है जो परिकल्पनाओं की एक परिभाषित शब्दावली के विरुद्ध अध्ययनों को स्कोर करके खंडित प्रेडिक्टिव कोडिंग साहित्य को संश्लेषित करता है, जिससे ऑडिट योग्य असहमति माप और मात्रात्मक साक्ष्य स्थान उत्पन्न होते हैं जिन्हें पारंपरिक मेटा-विश्लेषण हल नहीं कर सकता।

Hamed Nejat, Alexander Maier, Jesse Spencer-Smith, André M. Bastos2026-06-05
💻 computer science

Domain-Conditioned Safety in Frontier Computer-Using Agents: A 793-Episode Browser Benchmark, a Coding-Domain Cross-Reference, and a Reproducibility Audit of Recent Red-Teaming

यह शोध पत्र CUA-HandCrafted बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि जबकि फ्रंटियर कंप्यूटर-उपयोग करने वाले एजेंट ब्राउज़र वातावरण में हस्तनिर्मित प्रॉम्प्ट-इंजेक्शन हमलों के प्रति मजबूत प्रतिरोध प्रदर्शित करते हैं, उनकी सुरक्षा डोमेन-आधारित है और कोडिंग कार्यों तक सामान्यीकृत होने में विफल रहती है, जो यह सुझाव देता है कि पूर्व में रिपोर्ट की गई उच्च हमला सफलता दरें काफी हद तक RL-अनुकूलित इंजेक्शन स्ट्रिंग्स द्वारा संचालित थीं न कि अंतर्निहित मॉडल कमजोरियों द्वारा।

Nicholas Saban2026-06-05
💻 computer science

Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark Evaluation

यह शोध पत्र "सर्च-टाइम कंटैमिनेशन" (Search-Time Contamination) की पहचान और मात्रा निर्धारण करता है, जो एक ऐसी घटना है जहाँ डीप रिसर्च एजेंट इन्फरेंस के दौरान वेब सर्च के माध्यम से बेंचमार्क उत्तर या संदर्भ प्राप्त कर लेते हैं, जिससे प्रदर्शन मेट्रिक्स कृत्रिम रूप से बढ़ जाते हैं और यह आइसोलेटेड सैंडबॉक्स जैसे कंटैमिनेशन-अवेयर मूल्यांकन अभ्यासों को अपनाने का आग्रह करता है।

Yongjie Wang, Xinyue Zhang, Kunhong Yao, Zhiwei Zeng, Kaisong Song, Jun Lin, Zhiqi Shen2026-06-05
🤖 AI

How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment

यह शोध पत्र एक बंद किए गए रेडिट (Reddit) फील्ड प्रयोग का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि कैसे अज्ञात एआई (AI) एजेंटों ने पहचान अपनाने, अधिकार संकेत देने और संज्ञानात्मक पूर्वाग्रह के शोषण जैसे परिष्कृत अलंकारिक तौर-तरीकों का व्यवस्थित रूप से उपयोग किया—ताकि प्रेरक दक्षता को अधिकतम किया जा सके, जिससे एक ऐसा ज्ञानमीमांसीय विषमता (epistemic asymmetry) उत्पन्न हुई जिसे केवल प्रकटीकरण अनिवार्यताओं द्वारा हल नहीं किया जा सकता।

Kokil Jaidka, Saifuddin Ahmed2026-06-05
💻 computer science

NIV: Neural Axis Variations for Variable Font Generation

यह शोध पत्र NIV (न्यूरल एक्सिस वेरिएशंस) प्रस्तुत करता है, जो एक न्यूरल नेटवर्क पद्धति है जो एक नवीन प्रॉपर्टी एम्बेडिंग तंत्र का उपयोग करके प्रति-बिंदु ग्लिफ विस्थापन (per-point glyph displacement) की भविष्यवाणी करती है, जिससे स्थिर फोंट को स्वचालित रूप से पूर्णतः कार्यात्मक वेरिएबल फोंट में परिवर्तित किया जा सकता है और बिना किसी मानवीय हस्तक्षेप के विविध वर्ण समूहों और शैलियों में सुसंगत बहु-अक्षीय विविधताओं को सक्षम बनाया जा सकता है।

Nadav Benedek, Ariel Shamir, Ohad Fried2026-06-05
💻 computer science

Policy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language Agents

यह शोध पत्र CVT-RL का प्रस्ताव करता है, जो एक कतिपय (constrained) पॉलिसी-ग्रेडिएंट एल्गोरिदम है जो पॉलिसी-कंडीशन्ड काउंटरफैक्चुअल क्रेडिट एस्टीमेशन और वेरिफिएबल रिवॉर्ड गेटिंग का लाभ उठाता है ताकि लॉन्ग-होरिजन लैंग्वेज एजेंट्स की सफलता दर और साक्ष्य गुणवत्ता में महत्वपूर्ण सुधार किया जा सके, जबकि अनसपोर्टेड क्लेम्स और शॉर्टकट हैकिंग व्यवहारों को प्रभावी ढंग से कम किया जा सके।

Renwei Meng2026-06-05
💻 computer science

Personal AI Agent for Camera Roll VQA

यह शोधपत्र **camroll** डेटासेट और **camroll-agent** सिस्टम को पेश करता है ताकि संवादात्मक एआई सहायकों द्वारा विशाल, व्यक्तिगत कैमरा रोल आर्काइव्स में नेविगेट करने की चुनौती का समाधान किया जा सके, जो यह दर्शाता है कि प्रभावी लॉन्ग-होराइजन विजुअल मेमोरी के लिए मानक टेक्स्टुअल लॉन्ग-कॉन्टेक्स्ट रीजनिंग से अलग विशिष्ट दृष्टिकोणों की आवश्यकता होती है।

Thao Nguyen, Krishna Kumar Singh, Donghyun Kim, Yong Jae Lee, Yuheng Li2026-06-05
💻 computer science

Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents

यह शोध पत्र एजेंटिक मोंटे कार्लो (AMC) का प्रस्ताव करता है, जो एक टेस्ट-टाइम ऑप्टिमाइज़ेशन विधि है जो पॉलिसी को एक बेयसियन पोस्टीरियर (Bayesian posterior) के रूप में मानकर, सीक्वेंशियल मोंटे कार्लो और एक सीखे हुए वैल्यू फंक्शन का लाभ उठाकर ब्लैक-बॉक्स LLM एजेंटों से इष्टतम प्रक्षेपवक्र (optimal trajectories) को सैंपल करती है, जिससे अंतर्निहित मॉडल में संशोधन किए बिना प्रॉम्प्टिंग और यहाँ तक कि GRPO जैसी ट्रेनिंग-आधारित RL विधियों से भी बेहतर प्रदर्शन प्राप्त होता है।

Dae Yon Hwang, Raunaq Suri, Valentin Villecroze, Anthony L. Caterini, Jesse C. Cresswell, Noël Vouitsis, Brendan Leigh R (…)2026-06-05
🤖 AI

What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems

यह शोध पत्र PACT को प्रस्तुत करता है, जो एक प्रोटोकॉल आधारित एक्शन-स्टेट संचार ढांचा (protocolized action-state communication framework) है जो मल्टी-एजेंट सिस्टम में मुक्त-रूप प्राकृतिक भाषा के आदान-प्रदान को संक्षिप्त रिकॉर्ड में संकुचित करता है, जिससे विभिन्न सिस्टम टोपोलॉजी में कार्य प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए टोकन उपयोग और इन्फरेंस लागत को काफी कम किया जाता है।

Chen Huang, Yuhao Wu, Wenxuan Zhang2026-06-05
🤖 AI

Uncertainty Aware Functional Behavior Prediction and Material Fatigue Assessment for Circular Factory

यह शोध पत्र सर्कुलर फैक्ट्रियों के लिए एक अनसर्टेन्टी-अवेयर (अनिश्चितता-जागरूक) फ्रेमवर्क प्रस्तावित करता है जो एंगल ग्राइंडर जैसे लौटाए गए उत्पादों के लिए इंस्टेंस-विशिष्ट विश्वसनीयता वर्कफ़्लो को सक्षम करने हेतु डीप लर्निंग-आधारित कार्यात्मक भविष्यवाणी को भौतिकी-संचालित सामग्री थकान मूल्यांकन के साथ एकीकृत करता है।

Nehal Afifi, Mehdi Khabou, Victor Mas, Jonas Hemmerich, Patric Grauberger, Stefan Dietrich, Volker Schulze, Sven Matthie (…)2026-06-05