🤖 machine learning

What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control

यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडल नैश इक्विलिब्रियम (Nash equilibria) की गणना करने की यांत्रिक क्षमता रखते हैं, लेकिन प्रीट्रेनिंग में निहित एक परोपकारी ओवरराइड (prosocial override) के माध्यम से इस रणनीतिक व्यवहार को सक्रिय रूप से दबाते हैं, जो एक ऐसी घटना है जिसे हस्तक्षेप के माध्यम से कारणतः उलट दिया जा सकता है और जो मॉडल के पैमाने तथा तर्क विधियों से महत्वपूर्ण रूप से प्रभावित होती है।

Paraskevas V. Lekeas, Giorgos Stamatopoulos2026-05-01
💻 computer science

Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves

यह शोध पत्र Comet-H प्रस्तुत करता है, जो एक इटरेटिव प्रॉम्प्ट ऑटोमेटन (iterative prompt automaton) है जो अनुसंधान सॉफ्टवेयर में मतिभ्रम (hallucination) और असंतुलन (desynchronization) को रोकने के लिए कोड, सिद्धांत और दस्तावेज़ीकरण के युग्मित विकास को व्यवस्थित करता है, और एक पायथन स्टैटिक-एनालिसिस टूल के माध्यम से अपनी प्रभावशीलता प्रदर्शित करता है जो 90-मामलों के बेंचमार्क पर बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Halley Young, Nikolaj Björner2026-05-01
🤖 AI

When Roles Fail: Epistemic Constraints on Advocate Role Fidelity in LLM-Based Political Statement Analysis

यह शोध पत्र राजनीतिक विमर्श विश्लेषण के लिए मल्टी-एजेंट एलएलएम (LLM) पाइपलाइनों में 'रोल फिडेलिटी' (भूमिका निष्ठा) का पहला व्यवस्थित अनुभवजन्य परीक्षण प्रस्तुत करता है, जो यह प्रकट करता है कि मॉडल अक्सर 'एपिस्टेमिक रोल ओवरराइड' (ज्ञान संबंधी भूमिका अधिभावीकरण) जैसी प्रणालियों के कारण निर्धारित प्रतिकूल भूमिकाओं को बनाए रखने में विफल रहते हैं, जिसमें विशिष्ट मॉडल, भाषा और तथ्य-जांच उपकरणों के उपयोग के आधार पर विफलता के तरीकों और निष्ठा में महत्वपूर्ण भिन्नताएं देखी गई हैं।

Juergen Dietrich2026-05-01
💻 computer science

Upskilling with Generative AI: Practices and Challenges for Freelance Knowledge Workers

स्व-निर्देशित शिक्षण सिद्धांत पर आधारित एक मिश्रित-पद्धति अध्ययन के माध्यम से, यह शोध पत्र प्रकट करता है कि जहाँ फ्रीलांस ज्ञान कार्यकर्ता बाजार में अस्तित्व बनाए रखने के लिए ऑन-डिमांड अपस्किलिंग हेतु जनरेटिव एआई का तेजी से उपयोग कर रहे हैं, वहीं उन्हें इस उपकरण की विश्वसनीयता और प्रतिस्पर्धी श्रम बाजारों में इन नव-अर्जित "अदृश्य दक्षताओं" को विश्वसनीय रूप से प्रमाणित करने में असमर्थता के संबंध में महत्वपूर्ण चुनौतियों का सामना करना पड़ रहा है।

Kashif Imteyaz, Isabel Lopez, Nakul Rajpal, Hunjun Shin, Saiph Savage2026-05-01
🤖 AI

Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents

यह शोध पत्र "Reinforced Agent" प्रस्तुत करता है, जो एक इन्फरेंस-टाइम फ्रेमवर्क है जो निष्पादन से पहले टूल कॉल्स का मूल्यांकन करने के लिए एक विशिष्ट समीक्षक (reviewer) का उपयोग करता है, जिससे वास्तविक समय में त्रुटि सुधार सक्षम होता है और नए हेल्पफुलनेस-हार्मफुलनेस मेट्रिक्स के माध्यम से यह प्रदर्शित करता है कि निष्पादन को समीक्षा से अलग करने से बेस एजेंट को पुन: प्रशिक्षित किए बिना मॉडल चयन और प्रॉम्प्ट अनुकूलन के माध्यम से व्यवस्थित प्रदर्शन लाभ प्राप्त किया जा सकता है।

Anh Ta, Junjie Zhu, Shahin Shayandeh2026-05-01
💬 NLP

Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation

यह शोध पत्र यह प्रदर्शित करता है कि प्रतिकूल निर्देशों (adversarial instructions) की जटिलता यह निर्धारित करती है कि क्या निर्देश-ट्यून किए गए LLMs प्रश्न की सामग्री के साथ जुड़ते हैं या स्थितिगत शॉर्टकट (positional shortcuts) का सहारा लेते हैं, जो यह प्रकट करता है कि अत्यधिक जटिल, बहु-चरणीय परिहार निर्देश (avoidance instructions) चरम "पोजीशनल कोलैप्स" (positional collapse) को ट्रिगर करते हैं जहाँ मॉडल विशिष्ट उत्तर स्थितियों पर डिफ़ॉल्ट करने के लिए सामग्री को पूरी तरह से अनदेखा कर देते हैं।

Jon-Paul Cacioli2026-05-01
🤖 AI

AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling

AutoSurfer एक नवीन वेब प्रक्षेपवक्र जनरेटर (web trajectory generator) है जो डेटा की कमी और मतिभ्रम (hallucination) की समस्याओं को दूर करने के लिए व्यवस्थित ब्रैडथ-फर्स्ट एक्सप्लोरेशन, एक्सप्लोरेशन-गाइडेड टास्क सिंथेसिस और प्रक्षेपवक्र-आधारित परिशोधन का उपयोग करता है, जिससे WebArena बेंचमार्क पर वेब एजेंट के प्रदर्शन और कार्य विविधता में महत्वपूर्ण सुधार होता है।

Fazle Elahi Faisal, Qianhui Wu, Baolin Peng, Jianfeng Gao2026-05-01
🤖 AI

Self-Evolving Software Agents

यह शोध पत्र एक स्व-विकसित (self-evolving) सॉफ्टवेयर एजेंट आर्किटेक्चर प्रस्तुत करता है जो गतिशील मल्टी-एजेंट परिवेशों में अनुभव के आधार पर लक्ष्यों, तर्क और निष्पादन योग्य कोड को स्वायत्त रूप से अपडेट करने के लिए BDI रीजनिंग को लार्ज लैंग्वेज मॉडल्स (LLMs) के साथ एकीकृत करता है, जो LLM-संचालित सॉफ्टवेयर विकास की व्यवहार्यता और वर्तमान सीमाओं दोनों को प्रदर्शित करता है।

Marco Robol, Paolo Giorgini2026-05-01
🤖 AI

OptimusKG: Unifying biomedical knowledge in a modern multimodal graph

OptimusKG एक बड़े पैमाने का, स्कीमा-प्रवर्तित (schema-enforced) मल्टीमॉडल बायोमेडिकल नॉलेज ग्राफ है जो मशीन लर्निंग और परिकल्पना सृजन (hypothesis generation) का समर्थन करने के लिए 18 ऑन्टोलॉजी से संरचित और अर्ध-संरचित डेटा को एकीकृत करता है, जो प्रयोगात्मक संसाधनों से उभरते ज्ञान को कैप्चर करते हुए साहित्य-समर्थित साक्ष्यों के माध्यम से उच्च वैधता प्रदर्शित करता है।

Lucas Vittor, Ayush Noori, Iñaki Arango, Joaquín Polonuer, Sam Rodriques, Andrew White, David A. Clifton, Marinka Zitnik2026-05-01
💬 NLP

When 2D Tasks Meet 1D Serialization: On Serialization Friction in Structured Tasks

यह शोध पत्र यह प्रदर्शित करता है कि 2D संरचित कार्यों को 1D टोकन अनुक्रमों के रूप में प्रस्तुत करने से "सीरियलाइजेशन फ्रिक्शन" (serialization friction) उत्पन्न होता है जो प्रदर्शन में बाधा डालता है, जबकि एक विजन-ऑगमेंटेड पाथवे के माध्यम से मूल 2D लेआउट को बनाए रखने से मैट्रिक्स ट्रांसपोज़, कॉनवेज़ गेम ऑफ लाइफ और LU डिकंपोजिशन जैसे कार्यों में सटीकता में उल्लेखनीय सुधार होता है और स्थानिक रूप से संरचित त्रुटियों में कमी आती है।

Chung-Hsiang Lo, Lu Li, Diji Yang, Tianyu Zhang, Yunkai Zhang, Yoshua Bengio, Yi Zhang2026-05-01