💬 NLP

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

यह शोध पत्र ROK-FORTRESS को प्रस्तुत करता है, जो एक "ट्रांसक्रिएशन मैट्रिक्स" (transcreation matrix) का उपयोग करने वाला एक द्विभाषी बेंचमार्क है, यह प्रदर्शित करने के लिए कि बड़े भाषा मॉडलों (LLMs) के लिए राष्ट्रीय सुरक्षा और सार्वजनिक सुरक्षा मूल्यांकनों को भाषा और भू-राजनीतिक संदर्भ के बीच जटिल अंतःक्रियाओं को ध्यान में रखना चाहिए, क्योंकि केवल अनुवाद-आधारित दृष्टिकोण यह पकड़ने में विफल रहते हैं कि कोरियाई भाषा और ग्राउंडिंग (grounding) मॉडल के सुरक्षा व्यवहारों और ओवर-रिफ्यूज़ल (over-refusal) दरों को विशिष्ट रूप से कैसे प्रभावित करते हैं।

Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho (…)2026-05-15
💻 computer science

Agentic Systems as Boosting Weak Reasoning Models

यह शोध पत्र यह प्रदर्शित करता है कि सत्यापनकर्ता-समर्थित समिति खोज (verifier-backed committee search), विविध प्रस्तावों में से सही समाधानों को प्रभावी ढंग से चुनकर, कमजोर तर्क मॉडलों के प्रदर्शन को बहुत मजबूत प्रणालियों के स्तर तक बढ़ाने के लिए महत्वपूर्ण रूप से बढ़ावा दे सकती है, बशर्ते कि चयन त्रुटियों और कवरेज की सीमाओं को दूर करने के लिए स्थानीय सुदृढ़ता संकेतों (जैसे परीक्षण या प्रमाण) का उपयोग किया जाए।

Varun Sunkaraneni, Pierfrancesco Beneventano, Riccardo Neumarker, Tomaso Poggio, Tomer Galanti2026-05-15
💻 computer science

The Evaluation Trap: Benchmark Design as Theoretical Commitment

यह शोध पत्र "एपिस्टेमेटिक्स" (Epistematics) को प्रस्तुत करता है, जो एआई बेंचमार्क के ऑडिट करने के लिए एक मेटा-मूल्यांकन पद्धति है ताकि यह उजागर किया जा सके कि कैसे अनपरीक्षित सैद्धांतिक धारणाएं आत्म-सुदृढ़ मूल्यांकन जाल बनाती हैं जो संरचनात्मक सीमाओं को अस्पष्ट कर देती हैं, और एक हालिया प्रस्ताव की आलोचना करके अपने अनुप्रयोग को प्रदर्शित करता है जो अनजाने में उसी प्रतिमान को स्थापित कर देता है जिसे वह संशोधित करने का प्रयास करता है।

Theodore J Kalaitzidis2026-05-15✓ Author reviewed
💻 computer science

Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations

यह शोध पत्र ग्राउन्डेड कंटीन्यूएशन (Grounded Continuation) को प्रस्तुत करता है, जो एक लीनियर-टाइम रनटाइम वेरीफायर है जो लंबी बातचीत में असमर्थ दावों का पता लगाने और उन्हें वापस लेने के लिए प्रतीकात्मक तर्क (symbolic logic) और LLM-वर्गीकृत अपडेट ऑपरेशन्स का उपयोग करके एक स्पष्ट डिपेंडेंसी ग्राफ का निर्माण करता है, जिससे यह सटीकता में रिट्रीवल-ऑगमेंटेड बेसलाइन्स से बेहतर प्रदर्शन करते हुए औपचारिक साउंडनेस गारंटी प्रदान करता है।

Qisong He, Yi Dong, Xiaowei Huang2026-05-15
💬 NLP

Thinking Ahead: Prospection-Guided Retrieval of Memory with Language Models

यह शोध पत्र प्रोस्पेक्टशन-गाइडेड रिट्रीवल (PGR) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो भविष्य के सिम्युलेटेड चरणों को रिट्रीवल प्रोब्स के रूप में उपयोग करके संवाद प्रणालियों में लॉन्ग-होरिजन पर्सनलाइजेशन को बढ़ाता है ताकि उन प्रासंगिक उपयोगकर्ता स्मृतियों को खोजा जा सके जिन्हें मानक समानता-आधारित विधियाँ चूक जाती हैं, जिससे नए मेमोरीक्वेस्ट (MemoryQuest) बेंचमार्क पर रिकॉल और रिस्पॉन्स की गुणवत्ता में महत्वपूर्ण सुधार हुआ है।

Harshita Chopra, Krishna Kant Chintalapudi, Suman Nath, Ryen W. White, Chirag Shah2026-05-15
💻 computer science

LLM-Based Robustness Testing of Microservice Applications: An Empirical Study

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि प्रॉम्प्ट रणनीति माइक्रोसर्विस API के लिए LLM-जनित मजबूती परीक्षणों (robustness tests) की विविधता और कवरेज को महत्वपूर्ण रूप से प्रभावित करती है, जो यह प्रकट करता है कि एक वर्गीकरण-निर्देशित फ्यू-शॉट (taxonomy-guided few-shot) दृष्टिकोण विशिष्ट विफलता मोड (failure modes) को उजागर करने में बड़े मॉडल एन्सेम्बल्स और निश्चित प्रॉम्प्ट्स दोनों से बेहतर प्रदर्शन करता है।

Hrushitha Goud Tigulla, Marco Vieira2026-05-15
💻 computer science

SimPersona: Learning Discrete Buyer Personas from Raw Clickstreams for Grounded E-Commerce Agents

SimPersona एक नवीन फ्रेमवर्क है जो कच्चे क्लिकस्ट्रीम डेटा से डिस्क्रीट (discrete), व्याख्या योग्य खरीदार व्यक्तित्वों (buyer personas) को सीखने के लिए VQ-VAE का उपयोग करता है ताकि LLM-आधारित ई-कॉमर्स एजेंटों को वास्तविक जनसंख्या वितरण में स्थापित किया जा सके, जिससे बिना किसी पुनर्रचना (retraining) या मैनुअल प्रॉम्प्ट इंजीनियरिंग के मौजूदा विधियों की तुलना में बेहतर रूपांतरण-दर संरेखण (conversion-rate alignment) और लक्ष्य-उन्मुख प्रदर्शन प्राप्त होता है।

Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ted Chaiwachirasak, Han Li, Lingyun Wang2026-05-15
🤖 machine learning

ASH: Agents that Self-Hone via Embodied Learning

यह शोध पत्र ASH को प्रस्तुत करता है, जो एक स्व-सुधार करने वाला एजेंटिक सिस्टम है जो अनलेबल इंटरनेट वीडियो से एम्बोडीड पॉलिसीज़ (embodied policies) सीखता है, जिसमें अपनी विफलताओं से पर्यवेक्षण (supervision) निकालने के लिए एक इनवर्स डायनेमिक्स मॉडल का लाभ उठाया जाता है, जिससे यह पोकेमोन और ज़ेल्डा जैसे जटिल खेलों में लंबी अवधि के कार्यों (long-horizon tasks) को सफलतापूर्वक पूरा करने में सक्षम होता है जहाँ मौजूदा बेसलाइन विफल हो जाते हैं।

Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun2026-05-15
⚡ electrical engineering

PreFT: Prefill-only finetuning for efficient inference

यह शोधपत्र PreFT को प्रस्तुत करता है, जो एक प्रीफिल-ओनली (prefill-only) फाइनट्यूनिंग दृष्टिकोण है जो इनपुट टोकन को प्रोसेस करने के बाद एडेप्टर्स को हटा देता है ताकि मॉडल के प्रदर्शन पर न्यूनतम प्रभाव के साथ मल्टी-यूज़र सर्विंग थ्रूपुट में उल्लेखनीय सुधार किया जा सके, जो पारंपरिक पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग विधियों की तुलना में एक बेहतर सटीकता-थ्रूपुट ट्रेड-ऑफ प्रदान करता है।

Andrew Lanpouthakoun, Aryaman Arora, Zhengxuan Wu, Dhruv Pai, Ben Keigwin, Dan Jurafsky, Christopher Potts2026-05-15
🤖 machine learning

AudioMosaic: Contrastive Masked Audio Representation Learning

ऑडियोमोसेक (AudioMosaic) ऑडियो के लिए एक नवीन कंट्रास्टिव सेल्फ-सुपरवाइज्ड लर्निंग फ्रेमवर्क है जो पॉजिटिव पेयर्स को कुशलतापूर्वक उत्पन्न करने के लिए स्ट्रक्चर्ड टाइम-फ्रीक्वेंसी मास्किंग का उपयोग करता है, जिससे अत्यधिक डिस्क्रिमिनेटिव और ट्रांसफ़रेबल उत्तरे-लेवल रिप्रेजेंटेशन्स को सक्षम बनाया जा सके जो विविध ऑडियो बेंचमार्क और ऑडियो-लैंग्वेज कार्यों में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करते हैं।

Hanxun Huang, Qizhou Wang, Xingjun Ma, Cihang Xie, Christopher Leckie, Sarah Erfani2026-05-15