💬 NLP

Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora

यह शोध पत्र यह प्रदर्शित करता है कि सांस्कृतिक बारीकियों और स्लैंग (slang) की चुनौतियों के बावजूद, एलएलएम (LLM)-आधारित मशीन अनुवाद पोलिश सोशल मीडिया डेटा में सूक्ष्म नैतिक संकेतों को प्रभावी ढंग से संरक्षित करता है, जो उच्च सिमेंटिक समानता और डाउनस्ट्रीम वर्गीकरण कार्यों में न्यूनतम प्रदर्शन अंतराल के माध्यम से लागत प्रभावी क्रॉस-लिंगुअल नैतिक मूल्यों अनुसंधान को सक्षम बनाता है।

Maciej Skorski2026-05-22✓ Author reviewed
💬 NLP

Tokenization with Split Trees

यह शोध पत्र ToaST को प्रस्तुत करता है, जो एक नवीन सबवर्ड टोकनाइजेशन विधि है जो न्यूनतम टोकन गणना के लिए शब्दावली चयन को अनुकूलित करने हेतु स्प्लिट ट्रीज़ (split trees) और इंटिजर प्रोग्रामिंग का उपयोग करती है, जिससे BPE और WordPiece जैसे मौजूदा बेसलाइनों की तुलना में संपीड़न दक्षता और लैंग्वेज मॉडल प्रदर्शन में महत्वपूर्ण सुधार प्राप्त होता है।

Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage, Seth Ebner, Varshini Reddy, Yuval Pinter, Chris Tanner2026-05-22
💬 NLP

AMEL: Accumulated Message Effects on LLM Judgments

यह शोध पत्र "एकुमुलेटेड मैसेज इफेक्ट्स ऑन एलएलएम जजमेंट्स" (AMEL) को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि मूल्यांकनकर्ता के रूप में उपयोग किए जाने वाले बड़े भाषा मॉडल (LLMs) पूर्व बातचीत के इतिहास की प्रचलित ध्रुवीयता (polarity) के प्रति एक महत्वपूर्ण पूर्वाग्रह प्रदर्शित करते हैं—विशेष रूप से तब जब वे अनिश्चित हों या नकारात्मक संदर्भों के संपर्क में हों—चाहे मॉडल का पैमाना या इतिहास की लंबाई कुछ भी हो, जिससे विश्वसनीय स्वचालित मूल्यांकन के लिए ताज़ा संदर्भों या संतुलित इतिहास की सिफारिश की जाती है।

Sid-ali Temkit2026-05-22
💬 NLP

AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild

AnyMo एक ज्यामिति-जागरूक (geometry-aware), सेटअप-अज्ञेय (setup-agnostic) फ्रेमवर्क है जो विविध पहनने योग्य उपकरणों और अनदेखे डेटासेटों में सुदृढ़, सामान्यीकरण योग्य मानव गति समझ को सक्षम करने के लिए भौतिकी-आधारित IMU सिमुलेशन और LLM संरेखण का लाभ उठाता है, जो ज़ीरो-शॉट गतिविधि पहचान, क्रॉस-मोडल रिट्रीवल और मोशन कैप्शनिंग में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim2026-05-22
⚡ electrical engineering

Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models

यह शोध पत्र प्रदर्शित करता है कि एलएलएम (LLM) आधारित मल्टीमॉडल विश्लेषण राजनीतिक भाषणों के अर्थपूर्ण "पाथोस" (Pathos) आयाम को पकड़ने में पारंपरिक ध्वनिक भावना पहचान मॉडल की तुलना में बेहतर प्रदर्शन करता है, जबकि यह अभिनय किए गए भाषण और सांस्कृतिक पूर्वाग्रहों के कारण मानक ध्वनिक बेंचमार्क में महत्वपूर्ण सीमाओं को भी रेखांकित करता है।

Juergen Dietrich2026-05-22
💬 NLP

ChronoMedKG: A Temporally-Grounded Biomedical Knowledge Graph and Benchmark for Clinical Reasoning

यह शोध पत्र ChronoMedKG को प्रस्तुत करता है, जो एक मल्टी-एजेंट LLM पाइपलाइन के माध्यम से निर्मित एक समय-आधारित (temporally-grounded) बायोमेडिकल नॉलेज ग्राफ है जो साक्ष्य-आधारित विश्वसनीयता के साथ समय-निर्भर रोग संबंधों को एनकोड करता है, और इसके साथ ही ChronoTQA बेंचमार्क पेश करता है जो यह प्रदर्शित करता है कि इस टेम्पोरल डेटा को एकीकृत करने से स्टेटिक नॉलेज सोर्सेज की तुलना में फ्रंटियर LLMs के लिए क्लिनिकल रीजनिंग और रिट्रीवल-ऑगमेंटेड जनरेशन में महत्वपूर्ण सुधार होता है।

Md Shamim Ahmed, Farzaneh Firoozbakht, Lukas Galke Poech, Jan Baumbach, Richard Röttger2026-05-22
💬 NLP

Reducing Political Manipulation with Consistency Training

यह शोध पत्र पॉलिटिकल कंसिस्टेंसी ट्रेनिंग (PCT) प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) विधि है जो बड़े भाषा मॉडलों में उनकी समग्र उपयोगिता को बनाए रखते हुए उनके गुप्त राजनीतिक पूर्वाग्रह को प्रभावी ढंग से कम करने के लिए सेंटिमेंट और हेल्पफुलनेस कंसिस्टेंसी मेट्रिक्स का उपयोग करती है।

Long Phan, Devin Kim, Alexander Pan, Alice Blair, Adam Khoja, Dan Hendrycks2026-05-22
💬 NLP

Evaluating Commercial AI Chatbots as News Intermediaries

यह शोध पत्र छह भाषाओं में 2,100 वास्तविक समय के समाचार प्रश्नों पर छह वाणिज्यिक एआई चैटबॉट्स का मूल्यांकन करता है, जो यह प्रकट करता है कि हालांकि वे सुव्यवस्थित प्रश्नों पर उच्च सटीकता प्राप्त करते हैं, वे महत्वपूर्ण क्षेत्रीय पूर्वाग्रहों, पुनर्प्राप्ति-निर्भर विफलताओं और गलत धारणाओं के प्रति गंभीर संवेदनशीलता से ग्रस्त हैं जो समाचार मध्यस्थों के रूप में उनकी विश्वसनीयता को कम करती है।

Mirac Suzgun, Emily Shen, Federico Bianchi, Alexander Spangher, Thomas Icard, Daniel E. Ho, Dan Jurafsky, James Zou2026-05-22
💬 NLP

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

यह शोध पत्र वेक्टर पॉलिसी ऑप्टिमाइज़ेशन (VPO) को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो वेक्टर-मान वाले पुरस्कारों (vector-valued rewards) का लाभ उठाकर भाषा मॉडलों को विविध समाधान उत्पन्न करने के लिए प्रशिक्षित करता है, जिससे मानक स्केलर रिवॉर्ड ऑप्टिमाइज़ेशन की तुलना में टेस्ट-टाइम सर्च प्रक्रियाओं में उनके प्रदर्शन में महत्वपूर्ण सुधार होता है।

Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong (…)2026-05-22
💬 NLP

Tokenisation via Convex Relaxations

यह शोध पत्र ConvexTok को प्रस्तुत करता है, जो एक नवीन टोकनाइजेशन एल्गोरिदम है जो शब्दावली निर्माण को एक रैखिक प्रोग्राम के रूप में तैयार करता है जिसे उत्तल अनुकूलन (convex optimization) के माध्यम से हल किया जा सकता है, जिससे यह पारंपरिक लालची (greedy) विधियों की तुलना में आंतरिक मेट्रिक्स और भाषा मॉडल दक्षता में बेहतर प्रदर्शन करता है और साथ ही इसकी इष्टतमता (optimality) के निकटता पर एक प्रमाणित सीमा प्रदान करता है।

Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel2026-05-22