💬 NLP

More Context, Larger Models, or Moral Knowledge? A Systematic Study of Schwartz Value Detection in Political Texts

यह व्यवस्थित अध्ययन प्रदर्शित करता है कि जहाँ नैतिक ज्ञान को पुनः प्राप्त करना (retrieving) राजनीतिक ग्रंथों में श्वार्ट्ज मूल्यों (Schwartz values) का पता लगाने में निरंतर सुधार करता है, वहीं केवल संदर्भ लंबाई या मॉडल के आकार को बढ़ाने से बेहतर प्रदर्शन की गारंटी नहीं मिलती है, जिसमें पुनः प्राप्त ज्ञान का प्रारंभिक संलयन (early fusion), अन्य RAG वेरिएंट और बड़े मॉडलों से बेहतर प्रदर्शन करता है।

Víctor Yeste, Paolo Rosso2026-05-22
💬 NLP

Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora

यह शोध पत्र यह प्रदर्शित करता है कि सांस्कृतिक बारीकियों और स्लैंग (slang) की चुनौतियों के बावजूद, एलएलएम (LLM)-आधारित मशीन अनुवाद पोलिश सोशल मीडिया डेटा में सूक्ष्म नैतिक संकेतों को प्रभावी ढंग से संरक्षित करता है, जो उच्च सिमेंटिक समानता और डाउनस्ट्रीम वर्गीकरण कार्यों में न्यूनतम प्रदर्शन अंतराल के माध्यम से लागत प्रभावी क्रॉस-लिंगुअल नैतिक मूल्यों अनुसंधान को सक्षम बनाता है।

Maciej Skorski2026-05-22✓ Author reviewed
💻 computer science

WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance

यह शोध पत्र WorkstreamBench प्रस्तुत करता है, जो सटीकता (Accuracy), फॉर्मूला (Formula) और फॉर्मेट (Format) के बहुआयामी वर्गीकरण का उपयोग करके एंड-टू-एंड वित्तीय स्प्रेडशीट कार्यों पर LLM एजेंटों का मूल्यांकन करने वाला एक नवीन बेंचमार्क है, जो यह प्रकट करता है कि हालांकि क्लॉड (Claude) जैसे शीर्ष मॉडल पेशेवर दिखने वाले आउटपुट उत्पन्न करते हैं, फिर भी वर्तमान एजेंट वास्तविक दुनिया के वित्तीय वर्कफ़्लो के लिए आवश्यक जटिलता और गुणवत्ता मानकों को विश्वसनीय रूप से संभालने में संघर्ष करते हैं।

Thomson Yen, Julian Poeltl, Harshith Srinivas Gear, Yilin Meng, Joshua Fan, Adam Shen, Yili Liu, Ali Bauyrzhan, Siri Du (…)2026-05-22
💻 computer science

Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most

यह शोध पत्र प्रकट करता है कि अधिक सक्षम लार्ज लैंग्वेज मॉडल्स (LLMs) सुपरलीनियर ग्रोथ और टेल रिस्क से जुड़े पूर्वानुमान कार्यों में इन्वर्स स्केलिंग प्रदर्शित करते हैं, जिससे वे ऊपरी पूंछ (upper tails) का अत्यधिक विस्तार करके खराब वितरण संबंधी भविष्यवाणियां करते हैं—एक ऐसी विफलता जिसे मानक सिंगल-थ्रेशोल्ड मेट्रिक्स नहीं पकड़ पाते लेकिन जो निरंतर, टेल-समावेशी स्कोरिंग द्वारा उजागर हो जाती है।

Nick Merrill, Jaeho Lee, Ezra Karger2026-05-22
💻 computer science

Abstraction for Offline Goal-Conditioned Reinforcement Learning

यह शोधपत्र ऑफलाइन लक्ष्य-सशर्त सुदृढीकरण शिक्षण (Goal-Conditioned Reinforcement Learning) के लिए एक पदानुक्रमित ढांचे का प्रस्ताव करता है जो समरूपताओं और साझा संरचनाओं का लाभ उठाने के लिए सापेक्षिक विकल्पों (relativised options) और विशिष्ट अवस्था निरूपणों का उपयोग करता है, जिससे समान संदर्भों में अनुभव के पुन: उपयोग की क्षमता सक्षम होती है और प्रदर्शन में महत्वपूर्ण सुधार होता है।

Clarisse Wibault, Alexander Goldie, Antonio Villares, Maike Osborne, Jakob Foerster2026-05-22
💬 NLP

AMEL: Accumulated Message Effects on LLM Judgments

यह शोध पत्र "एकुमुलेटेड मैसेज इफेक्ट्स ऑन एलएलएम जजमेंट्स" (AMEL) को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि मूल्यांकनकर्ता के रूप में उपयोग किए जाने वाले बड़े भाषा मॉडल (LLMs) पूर्व बातचीत के इतिहास की प्रचलित ध्रुवीयता (polarity) के प्रति एक महत्वपूर्ण पूर्वाग्रह प्रदर्शित करते हैं—विशेष रूप से तब जब वे अनिश्चित हों या नकारात्मक संदर्भों के संपर्क में हों—चाहे मॉडल का पैमाना या इतिहास की लंबाई कुछ भी हो, जिससे विश्वसनीय स्वचालित मूल्यांकन के लिए ताज़ा संदर्भों या संतुलित इतिहास की सिफारिश की जाती है।

Sid-ali Temkit2026-05-22
💬 NLP

AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild

AnyMo एक ज्यामिति-जागरूक (geometry-aware), सेटअप-अज्ञेय (setup-agnostic) फ्रेमवर्क है जो विविध पहनने योग्य उपकरणों और अनदेखे डेटासेटों में सुदृढ़, सामान्यीकरण योग्य मानव गति समझ को सक्षम करने के लिए भौतिकी-आधारित IMU सिमुलेशन और LLM संरेखण का लाभ उठाता है, जो ज़ीरो-शॉट गतिविधि पहचान, क्रॉस-मोडल रिट्रीवल और मोशन कैप्शनिंग में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim2026-05-22
💻 computer science

Parametric Modular Answer Set Programs Made Declarative

यह शोध पत्र पैरामीट्रिक मॉड्यूलर लॉजिक प्रोग्राम्स को प्रथम-क्रम (first-order) आंसर सेट प्रोग्रामिंग के एक नए औपचारिक रूप (formalism) के रूप में प्रस्तुत करता है जो पैरामीटर्स और इंटेंशनलिटी (intensionality) का समर्थन करता है, जिससे clingo की कलेक्टिव कंट्रोल विशेषता के अर्थविज्ञान (semantics) को पकड़ने और मॉड्यूलर एवं पारंपरिक गैर-मॉड्यूलर ASP के बीच के अंतर को पाटने के लिए एक सैद्धांतिक आधार प्राप्त होता है।

Jorge Fandinno, Yuliya Lierler, Torsten Schaub2026-05-22
💻 computer science

Can AI Make Conflicts Worse? An Alignment Failure in LLM Deployment Across Conflict Contexts

यह शोध पत्र संघर्ष के संदर्भों में लार्ज लैंग्वेज मॉडल्स (LLMs) का मूल्यांकन करने के लिए पहले मूल्यांकन ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि प्रमुख प्रदाताओं के बीच महत्वपूर्ण संरेखण विफलताएं—जैसे कि झूठी समानता और नरसंहार का खंडन—अक्सर होती हैं, विशेष रूप से तब जब मॉडल्स को उन स्थितियों में "संतुलन" खोजने के लिए प्रेरित किया जाता है जहाँ अंतर्राष्ट्रीय न्यायालयों ने पहले ही जिम्मेदारी स्थापित कर दी है।

Andrii Kryshtal2026-05-22
💻 computer science

Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation

यह शोध पत्र LLM पोस्ट-ट्रेनिंग पर एक स्टेट-डिस्ट्रीब्यूशन परिप्रेक्ष्य प्रस्तावित करता है, जो नियंत्रित प्रयोगों के माध्यम से यह प्रदर्शित करता है कि प्रशिक्षण अवस्थाओं (training states) का स्रोत और स्थानीयता स्वयं सुपरविजन सिग्नल जितनी ही महत्वपूर्ण है, जैसा कि इस तथ्य से प्रमाणित होता है कि ऑन-पॉलिसी विधियाँ स्ट्रेस-ट्रेन्ड टीचर्स की तुलना में बेहतर प्रदर्शन करती हैं और मानक सुपरवाइज्ड फाइन-ट्यूनिंग की तुलना में रिटेंशन को बेहतर ढंग से संरक्षित करती हैं।

Dong Nie2026-05-22