🤖 AI

LACUNA: Safe Agents as Recursive Program Holes

LACUNA LLM एजेंटों के लिए एक सुरक्षित प्रोग्रामिंग मॉडल है जो क्रियाओं (actions) को मॉडल द्वारा भरे जाने वाले टाइप किए गए प्रोग्राम होल्स (program holes) के रूप में मानता है और निष्पादन से पहले स्टैटिक टाइप-चेकिंग के माध्यम से उन्हें मान्य करता है, जिससे एजेंट कंट्रोल फ्लो को जनरेटेड कोड के साथ एकीकृत किया जाता है और रनटाइम विफलताओं को रोका जाता है तथा टूल एक्सेस को सीमित किया जाता है।

Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky2026-05-28
🤖 AI

AutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation

यह शोध पत्र AutoScientists को प्रस्तुत करता है, जो AI एजेंटों की एक विकेंद्रीकृत टीम है जो परिकल्पना सृजन और आलोचना के माध्यम से लंबे समय तक चलने वाले वैज्ञानिक प्रयोगों को स्वायत्त रूप से संचालित करने के लिए स्वयं को व्यवस्थित करती है, और बायोमेडिकल मशीन लर्निंग, लैंग्वेज मॉडल ऑप्टिमाइज़ेशन और प्रोटीन फिटनेस प्रेडिक्शन कार्यों में मौजूदा सिंगल-एजेंट और केंद्रीकृत दृष्टिकोणों से काफी बेहतर प्रदर्शन करती है।

Shanghua Gao, Ada Fang, Marinka Zitnik2026-05-28
🤖 AI

AI in the Workplace: The Impact of AI on Perceived Job Decency and Meaningfulness

आईटी, सेवा और स्वास्थ्य सेवा क्षेत्रों के 24 कर्मचारियों के साक्षात्कार के आधार पर, यह शोध पत्र बताता है कि नौकरी की संतुष्टि पर एआई (AI) का प्रभाव डोमेन के अनुसार भिन्न होता है, क्योंकि कर्मचारी कथित नौकरी की शालीनता और सार्थकता में अलग-अलग परिवर्तनों की प्रत्याशा करते हैं, जैसे कि आईटी और स्वास्थ्य सेवा पेशेवरों द्वारा बेहतर कार्य-जीवन संतुलन लेकिन निम्न सामाजिक स्थिति की अपेक्षा करना, जबकि सेवा क्षेत्र के कार्यकर्ता काम के घंटों में कोई बदलाव न होने के बावजूद बेहतर सामाजिक प्रतिष्ठा का पूर्वानुमान लगाते हैं।

Kuntal Ghosh, Marc Hassenzahl, Shadan Sadeghian2026-05-28
🤖 AI

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

यह शोध पत्र VeriTrip प्रस्तुत करता है, जो एक सत्यापन योग्य बेंचमार्क है जो एक सिंक्रोनाइज़्ड नॉलेज बेस स्थापित करके और तथ्यात्मक विश्वसनीयता को मापने के लिए अनस्ट्रक्चर्ड मल्टीमॉडल वेब कॉर्पोरा पर ट्रैवल प्लानिंग एजेंटों का मूल्यांकन करता है और स्वायत्त रिट्रीवल कॉग्निटिव लोड और इंस्ट्रक्शन रिटेंशन के बीच एक महत्वपूर्ण ट्रेड-ऑफ को प्रकट करता है।

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang2026-05-28
🧬 biology

Misalignment Between Backpropagation and the Hierarchy of Brain Responses to Images

यह अध्ययन प्रदर्शित करता है कि जबकि डीप न्यूरल नेटवर्क से बैकप्रोपैगेटेड ग्रेडिएंट्स उच्च दृश्य क्षेत्रों में मानव मस्तिष्क की गतिविधि की भविष्यवाणी कर सकते हैं, उनका स्थानिक और लौकिक संगठन मस्तिष्क के पदानुक्रमित प्रसंस्करण से मौलिक रूप से भिन्न है, जो यह सुझाव देता है कि डीप लर्निंग और मस्तिष्क समान प्रतिनिधि सामग्री साझा करने के बावजूद संभवतः अलग-अलग शिक्षण तंत्रों पर निर्भर करते हैं।

Joséphine Raugel, Maximilian Seitzer, Marc Szafraniec, Huy V. Vo, Jérémy Rapin, Patrick Labatut, Piotr Bojanowski, Valen (…)2026-05-28
⚡ electrical engineering

Deep Learning Strain Estimation: Is Physics-Based Simulation the Solution?

यह शोध पत्र एक नवीन भौतिकी-आधारित सिमुलेशन रणनीति प्रस्तावित करता है जो वास्तविक स्पेकल डिकोरिलेशन (speckle decorrelation) और पुनरावृत्ति परिशोधन (iterative refinement) से सुसज्जित है ताकि एक फोटोरियलिस्टिक डेटासेट तैयार किया जा सके जो डीप लर्निंग मॉडल्स को वर्तमान नैदानिक मानक की सटीकता को पीछे छोड़ते हुए, श्रेष्ठ वैश्विक और क्षेत्रीय मायोकार्डियल स्ट्रेन अनुमान प्राप्त करने में सक्षम बनाता है।

Thierry Judge, Nicolas Duchateau, Andreas Østvik, Khuram Faraz, Anders Austlid Taskén, Sigve Karlsen, Thor Edvardsen, Ha (…)2026-05-28
🤖 AI

The Importance of Being Statistically Earnest: A Critical Re-evaluation of GSM-Symbolic

यह शोध पत्र GSM-Symbolic बेंचमार्क के इस निष्कर्ष को चुनौती देता है कि LLMs में वास्तविक तर्क क्षमता का अभाव है, यह प्रदर्शित करते हुए कि रिपोर्ट की गई प्रदर्शन गिरावट अक्सर सांख्यिकीय रूप से महत्वहीन होती है और समस्या के पाठ में अनपेक्षित वितरण संबंधी बदलावों (distributional shifts) से भ्रमित होती है, जो इसके बजाय यह प्रकट करती है कि मॉडल की विफलताएं सार्वभौमिक होने के बजाय विशिष्ट और विषम हैं।

Dominika Agnieszka Długosz, Arlindo Oliveira, Natalia Díaz Rodríguez2026-05-28
🤖 AI

Beyond Binary Moral Judgment: Modeling Ethical Pluralism in AI

यह शोध पत्र एक दो-धारा (two-stream) सिमेंटिक आर्किटेक्चर और स्टैक्ड एन्सेम्बल लर्निंग का उपयोग करते हुए, नैतिक दुविधाओं को परिणामवाद (consequentialism), सद्गुण नैतिकता (virtue ethics) और कर्तव्यवाद (deontology) के बीच वर्गीकृत करने में 88.89% सटीकता प्राप्त करते हुए, एक नॉर्मेटिव एथिक्स सिम्प्लेक्स पर नैतिक तर्क को एक संभाव्यता वितरण (probabilistic distribution) के रूप में प्रस्तुत करके, एआई में नैतिक बहुलवाद (ethical pluralism) को मॉडल करने के लिए एक ढांचे का प्रस्ताव करता है।

Aisha Aijaz, Rahul Goel, Arnav Batra, Raghava Mutharaju2026-05-28
💬 NLP

Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

यह अनुभवजन्य अध्ययन उच्च-, मध्यम- और निम्न-संसाधन वाली भाषाओं में विश्वसनीय बहुभाषी LLM-as-a-judge विकसित करने की रणनीतियों की जांच करता है, जो यह प्रकट करता है कि फाइन-ट्यून किए गए छोटे मॉडल इन-डोमेन डेटा के साथ उत्कृष्ट प्रदर्शन करते हैं जबकि बड़े ज़ीरो-शॉट मॉडल आउट-ऑफ-डोमेन परिदृश्यों के लिए बेहतर होते हैं, और यह चेतावनी देता है कि आउट-ऑफ-डोमेन फाइन-ट्यूनिंग प्रदर्शन को कम कर सकती है।

Irune Zubiaga, Aitor Soroa, Rodrigo Agerri2026-05-28
💬 NLP

IPO-Mine: A Toolkit and Dataset for Section-Structured Analysis of Long, Multimodal IPO Documents

यह शोधपत्र IPO-Mine को प्रस्तुत करता है, जो एक ओपन-सोर्स टूलकिट और एक बड़े पैमाने का, खंड-संरचित मल्टीमॉडल डेटासेट है जिसमें 109,000 से अधिक IPO फाइलिंग और 76,000 चित्र शामिल हैं, जिसे लंबे नियामक दस्तावेजों के मानकीकृत विश्लेषण को सक्षम करने और अत्याधुनिक मल्टीमॉडल मॉडलों तथा विशेषज्ञ मानव निर्णयों के बीच महत्वपूर्ण संरेखण अंतराल (alignment gaps) को प्रकट करने के लिए डिज़ाइन किया गया है।

Michael Galarnyk, Siddharth Lohani, Vidhyakshaya Kannan, Sagnik Nandi, Aman Patel, Liqin Ye, Arnav Hiray, Rutwik Routu (…)2026-05-28