🤖 AI

Eyla: Toward an Identity-Anchored LLM Architecture with Integrated Biological Priors -- Vision, Implementation Attempt, and Lessons from AI-Assisted Development

यह शोध पत्र "एयला" (Eyla) के डिज़ाइन तर्क, कार्यान्वयन प्रयास और विफलता विश्लेषण को प्रस्तुत करता है, जो जैविक पूर्वधारणाओं (biological priors) को एकीकृत करने वाला एक पहचान-आधारित (identity-anchored) एलएलएम (LLM) आर्किटेक्चर है, साथ ही एक गैर-प्रोग्रामर की $1,000+ की एआई-सहायता प्राप्त विकास यात्रा के असफल दस्तावेजीकरण के माध्यम से एआई प्रणालियों और सॉफ्टवेयर इंजीनियरिंग दोनों के लिए पांच व्यवस्थित विफलता मोड और सबक दर्ज करता है।

Arif Aditto2026-04-02
🤖 AI

Can LLMs Perceive Time? An Empirical Investigation

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में अपने स्वयं के अनुमान समय (इन्फ्रेंस टाइम) को समझने या अनुमान लगाने की क्षमता मौलिक रूप से नहीं है, जो उनके प्रपोजीशनल ज्ञान और अनुभवात्मक आधार के बीच विच्छेद के कारण विभिन्न कार्यों और मॉडल परिवारों में लगातार गलत पूर्व-कार्य भविष्यवाणियां, पश्च-घटना स्मरण (पोस्ट-हॉक रिकॉल), और सापेक्ष क्रमबद्ध निर्णय उत्पन्न करते हैं।

Aniketh Garikaparthi2026-04-02
🤖 AI

Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms

यह शोध पत्र यह पहचान करता है कि पोस्ट-ट्रेनिंग के दौरान लार्ज लैंग्वेज मॉडल्स, जैसे कि रीजनिंग मॉडल्स, अपने मूल सुरक्षा तंत्रों को हटाए बिना उन्हें मास्क कर देते हैं, और एक हल्का तरीका प्रस्तावित करता है जिसे सेफ़री-एक्ट (SafeReAct) कहा जाता है जो रीजनिंग प्रदर्शन से समझौता किए बिना LoRA एडेप्टर्स का उपयोग करके इन छिपे हुए सुरक्षा व्यवहारों को सफलतापूर्वक पुनर्स्थापित करता है।

Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang, Yisen Wang2026-04-02
🤖 AI

The Chronicles of RiDiC: Generating Datasets with Controlled Popularity Distribution for Long-form Factuality Evaluation

यह शोध पत्र RiDiC को प्रस्तुत करता है, जो विभिन्न लोकप्रियता स्तरों के across 3,000 संस्थाओं (entities) का एक कॉन्फ़िगर करने योग्य बहुभाषी डेटासेट है, जिसे फ्रंटियर LLMs द्वारा लंबी-फॉर्म तथ्यात्मकता पीढ़ी (long-form factuality generation) में मतिभ्रम (hallucinations) का मूल्यांकन करने और उन्हें प्रकट करने के लिए डिज़ाइन किया गया है।

Pavel Braslavski, Dmitrii Iarosh, Nikita Sushko, Andrey Sakhovskiy, Vasily Konovalov, Elena Tutubalina, Alexander Panche (…)2026-04-02
🤖 AI

How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models

चार भाषा मॉडलों के माध्यम से मल्टी-एजेंट सिमुलेशन के जरिए, यह अध्ययन प्रकट करता है कि नैतिक निर्देश प्रसंस्करण मॉडल-विशिष्ट क्षमता और प्रारूप के अनुसार भिन्न होता है, जो चार विशिष्ट नैतिक प्रसंस्करण प्रकारों की पहचान करता है और यह प्रदर्शित करता है कि सुरक्षा निर्देशों के साथ शाब्दिक अनुपालन अनिवार्य रूप से वास्तविक आंतरिक नैतिक विचार-विमर्श को प्रतिबिंबित नहीं करता है।

Hiroki Fukui2026-04-02
🤖 AI

Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce

यह अध्ययन प्रदर्शित करता है कि कन्वर्सेशनल कॉमर्स के लिए LLM-as-Judge मूल्यांकनों की क्राइटेरियन वैलिडिटी (criterion validity) आयाम-विशिष्ट विषमता (dimension-specific heterogeneity) पर निर्भर करती है, जो यह प्रकट करता है कि समान-भारित रूब्रिक्स (equal-weighted rubrics) भविष्य कहनेवाला शक्ति को कम कर देते हैं, जबकि सत्यापित व्यावसायिक परिणामों के आधार पर पुन: भारित करना और एजेंट-प्रकार के भ्रमों (agent-type confounds) को संबोधित करना संवाद गुणवत्ता स्कोर और रूपांतरण दरों (conversion rates) के बीच जुड़ाव में महत्वपूर्ण सुधार करता है।

Liang Chen, Qi Liu, Wenhuan Lin, Feng Liang2026-04-02
🤖 AI

WHBench: Evaluating Frontier LLMs with Expert-in-the-Loop Validation on Women's Health Topics

यह शोध पत्र WHBench को प्रस्तुत करता है, जो महिलाओं के स्वास्थ्य के 10 विषयों पर 47 विशेषज्ञ-निर्मित परिदृश्यों वाला एक विशिष्ट बेंचमार्क है, जो 22 फ्रंटियर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है और यह प्रकट करता है कि सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल भी 72.1% सटीकता से अधिक होने में विफल रहे हैं, जो नैदानिक सुरक्षा, समानता और दिशानिर्देशों के पालन में महत्वपूर्ण अंतराल को उजागर करता है जिसके लिए तैनाती हेतु विशेषज्ञ निरीक्षण की आवश्यकता है।

Sneha Maurya, Pragya Saboo, Girish Kumar2026-04-02
🤖 AI

Brevity Constraints Reverse Performance Hierarchies in Language Models

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स को संक्षिप्त प्रतिक्रियाएं उत्पन्न करने के लिए बाध्य करना प्रदर्शन पदानुक्रमों को उलट देता है, जिससे स्केल-निर्भर वाचालता त्रुटियों को समाप्त किया जा सकता है, और इस प्रकार गणितीय एवं वैज्ञानिक तर्क की उन श्रेष्ठ अंतर्निहित क्षमताओं को अनलॉक किया जा सकता है जिन्हें मानक मूल्यांकन प्रोटोकॉल छिपा देते हैं।

MD Azizul Hakim2026-04-02
🤖 AI

"Who Am I, and Who Else Is Here?" Behavioral Differentiation Without Role Assignment in Multi-Agent LLM Systems

यह अध्ययन प्रदर्शित करता है कि विषम बहु-एजेंट एलएलएम (LLM) प्रणालियाँ संरचित अंतःक्रियाओं के माध्यम से स्वतः ही विभेदित सामाजिक भूमिकाएँ और प्रतिपूरक व्यवहार विकसित करती हैं, जबकि एजेंटों के अलग-थलग होने, समरूप होने, या उनके वास्तविक मॉडल नामों द्वारा स्पष्ट रूप से पहचाने जाने पर व्यवहारिक अभिसरण होता है।

Houssam EL Kandoussi2026-04-02
🤖 AI

Terminal Agents Suffice for Enterprise Automation

यह शोध पत्र तर्क देता है कि सरल टर्मिनल-आधारित कोडिंग एजेंट, जो फाइलसिस्टम के माध्यम से सीधे प्लेटफॉर्म API के साथ इंटरैक्ट करते हैं, विविध एंटरप्राइज ऑटोमेशन कार्यों के लिए अधिक जटिल टूल-ऑगमेंटेड या वेब-आधारित एजेंटों के बराबर या उनसे बेहतर प्रदर्शन करने के लिए पर्याप्त हैं।

Patrice Bechard, Orlando Marquez Ayala, Emily Chen, Jordan Skelton, Sagar Davasam, Srinivas Sunkara, Vikas Yadav, Sai Ra (…)2026-04-02