💬 NLP

The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models

द्विचरणीय मॉडल (Bicameral Model) एक प्रशिक्षित न्यूरल इंटरफेस पेश करता है जो निरंतर हिडन-स्टेट कपलिंग के माध्यम से दो फ्रोजन लैंग्वेज मॉडल्स को द्विदिश रूप से समन्वय करने में सक्षम बनाता है, जिससे एक प्राथमिक मॉडल कार्यों को संचालित कर सकता है जबकि एक सहायक मॉडल टूल्स या कोड को निष्पादित करता है, जिससे टेक्स्ट-आधारित संचार पर निर्भर रहे बिना अंकगणित, तर्क और गणितीय तर्क में प्रदर्शन में उल्लेखनीय वृद्धि होती है।

Cedric Flamant, Udaya Ghai, Kanna Shimizu2026-05-13
💻 computer science

Adversarial SQL Injection Generation with LLM-Based Architectures

यह शोध पत्र प्रतिकूल SQL इंजेक्शन पेलोड उत्पन्न करने के लिए दो नवीन LLM-आधारित प्रणालियों, RADAGAS और RefleXQLi को प्रस्तुत करता है और विविध वेब एप्लिकेशन फायरवॉल्स (WAFs) के विरुद्ध उनकी प्रभावशीलता का मूल्यांकन करता है, जिससे यह पता चलता है कि जबकि ये मॉडल AI/ML-आधारित सुरक्षा प्रणालियों को बायपास करने में बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हैं, वे नियम-आधारित प्रणालियों के विरुद्ध संघर्ष करते हैं और यह प्रदर्शित करते हैं कि पेलोड विविधता हमेशा उच्च बायपास सफलता के साथ सह-संबंधित नहीं होती है।

Ali Karakoc, H. Birkan Yilmaz2026-05-13
💻 computer science

Continuous Discovery of Vulnerabilities in LLM Serving Systems with Fuzzing

यह शोध पत्र GRIEF को प्रस्तुत करता है, जो एक ग्रेबॉक्स फज़र (greybox fuzzer) है जो कैश आइसोलेशन विफलताओं और प्रदर्शन हस्तक्षेप जैसी महत्वपूर्ण कमजोरियों को उजागर करने के लिए LLM सर्विंग सिस्टम की समवर्ती (concurrency) और स्टेट-मैनेजमेंट जटिलताओं को लक्षित करता है, जिसने vLLM और SGLang जैसे इंजनों में दो CVEs सहित 15 नई समस्याओं की सफलतापूर्वक पहचान की है।

Yunze Zhao, Yibo Zhao, Yuchen Zhang, Zaoxing Liu, Michelle L. Mazurek2026-05-13
🤖 machine learning

The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains

यह शोध पत्र प्रदर्शित करता है कि कई डोमेनों में विषम आइटम कठिनाइयों वाले विरल मूल्यांकन मैट्रिसेस (sparse evaluation matrices) में सरल औसत विफल रहता है, जबकि आइटम रिस्पॉन्स थ्योरी (IRT) मॉडल इन परिस्थितियों में भी सुदृढ़ता से वास्तविक रैंकिंग को पुनः प्राप्त कर लेते हैं।

Jung Min Kang2026-05-13
🤖 AI

Don't Look at the Numbers: Visual Anchoring Bias and Layer-wise Representation in VLMs

यह शोध पत्र यह स्थापित करता है कि एम्बेडेड संख्यात्मक एंकर (numeric anchors) विजन-लैंग्वेज मॉडल गुणवत्ता निर्णयों को व्यवस्थित रूप से पक्षपाती बनाते हैं, जो व्यवहारिक संवेदनशीलता और परत-विशिष्ट प्रतिनिधित्व गतिशीलता (layer-specific representation dynamics) के बीच एक कारण संबंध को प्रकट करते हैं, जहाँ एंकर वर्गीकरण प्रारंभिक परतों में संतृप्त हो जाता है जबकि इष्टतम गुणवत्ता भविष्यवाणी नेटवर्क में गहराई में होती है।

M. Shalankin2026-05-13
🤖 AI

Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?

यह शोध पत्र VLATIM प्रस्तुत करता है जो *The Incredible Machine 2* पर आधारित एक बेंचमार्क है, जो वर्तमान विजन-लैंग्वेज मॉडल्स की उच्च-स्तरीय योजना बनाने की क्षमताओं और सटीक दृश्य ग्राउंडिंग (visual grounding) के बीच एक महत्वपूर्ण अंतर को प्रकट करता है, यह प्रदर्शित करते हुए कि उन्होंने इंटरैक्टिव पॉइंट-एंड-क्लिक पहेली वातावरण में अभी तक मानव जैसी तार्किक समस्या-समाधान क्षमताएं प्राप्त नहीं की हैं।

Dominik Helfenstein, Marco Menner, Maximilian Triebel2026-05-13
💻 computer science

ABRA: Agent Benchmark for Radiology Applications

यह शोध पत्र ABRA को प्रस्तुत करता है, जो एक नवीन रेडियोलॉजी-एजेंट बेंचमार्क है जिसमें एक वास्तविक DICOM वातावरण के भीतर 655 प्रोग्रामेटिक रूप से जनरेट किए गए कार्य शामिल हैं, जो वर्तमान मॉडलों की मजबूत टूल ऑर्केस्ट्रेशन क्षमताओं लेकिन चिकित्सा इमेज परसेप्शन और फाइंडिंग लोकलाइजेशन में महत्वपूर्ण सीमाओं को प्रकट करता है।

Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo2026-05-13
🤖 AI

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

PIVOT एक स्व-पर्यवेक्षित (self-supervised) फ्रेमवर्क है जो योजना (planning) और निष्पादन (execution) के बीच के अंतर को पाटने के लिए योजना, निरीक्षण, विकास और सत्यापन की चार-चरणीय प्रक्रिया के माध्यम से उम्मीदवार प्रक्षेप पथों (candidate trajectories) को पुनरावृत्ति से परिष्कृत करता है, जिससे काफी कम कम्प्यूटेशनल लागत के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis2026-05-13
🤖 machine learning

LiBaGS: Lightweight Boundary Gap Synthesis for Targeted Synthetic Data Selection

LiBaGS एक हल्का, जनरेटर-अज्ञेय (generator-agnostic) तरीका है जो सीमा निकटता (boundary proximity), अनिश्चितता और घनत्व के आधार पर नमूनों को स्कोर करके सिंथेटिक डेटा चयन को अनुकूलित करता है, जबकि अनावश्यक या अवास्तविक डेटा के बिना डाउनस्ट्रीम कार्य सटीकता में सुधार करने के लिए एक बाउंड्री-गैप एलोकेशन नियम और मार्जिनल-वैल्यू स्टॉपिंग मानदंड का उपयोग करता है।

Abhishek Moturu, Anna Goldenberg, Babak Taati2026-05-13
🤖 AI

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

यह शोध पत्र फ्रॉड और एएमएल (AML) अनुपालन के लिए विशेष रूप से तैयार किया गया एक वर्कलोड-अवेयर एलएलएमओप्स (LLMOps) स्टैक प्रस्तुत करता है जो ओपन-वेट मॉडल्स, पेज्डअटेंशन (PagedAttention) और प्रीफिक्स कैशिंग (prefix caching) जैसे उन्नत सर्विंग अनुकूलनों और कठोर गुणवत्ता गेटिंग का लाभ उठाता है ताकि जेनेरिक एलएलएम (LLM) सर्विंग दृष्टिकोणों की तुलना में थ्रूपुट, लेटेंसी और जीपीयू (GPU) उपयोगिता में महत्वपूर्ण सुधार प्राप्त किया जा सके।

Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang2026-05-13