💻 computer science

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

यह शोधपत्र ShredBench प्रस्तुत करता है, जो कि फटे हुए दस्तावेज़ों के पुनर्निर्माण के चुनौतीपूर्ण कार्य पर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (Multimodal Large Language Models) के मूल्यांकन के लिए एक स्वचालित पीढ़ी पाइपलाइन वाला एक नवीन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल अखंड दस्तावेज़ों पर अपने प्रदर्शन की तुलना में दृश्य विच्छेदन (visual discontinuities) को जोड़ने के लिए आवश्यक सूक्ष्म-स्तरीय क्रॉस-मोडल तर्क करने में काफी संघर्ष करते हैं।

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma2026-04-28
💻 computer science

DRACULA: Hunting for the Actions Users Want Deep Research Agents to Execute

यह शोध पत्र DRACULA प्रस्तुत करता है, जो वैज्ञानिक गहन अनुसंधान (Scientific Deep Research) एजेंटों के लिए मध्यवर्ती कार्यों (intermediate actions) पर विशेषज्ञ उपयोगकर्ता फीडबैक को कैप्चर करने वाला पहला डेटासेट है, जो यह प्रकट करता है कि उपयोगकर्ता के चयन इतिहास का लाभ उठाना पसंदीदा कार्यों के पूर्वानुमान में महत्वपूर्ण रूप से सुधार करता है और केवल यह तय करने के बजाय कि कार्यों को कैसे निष्पादित किया जाए, यह तय करने की महत्वपूर्ण चुनौती को उजागर करता है कि किन कार्यों को निष्पादित किया जाए।

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Ra (…)2026-04-28
💻 computer science

Resource-Lean Lexicon Induction for German Dialects

यह शोध पत्र प्रदर्शित करता है कि संसाधन-सीमित सांख्यिकीय मॉडल, विशेष रूप से स्ट्रिंग समानता विशेषताओं पर प्रशिक्षित रैंडम फॉरेस्ट, उच्च-गुणवत्ता वाले जर्मन बोली शब्दकोशों को प्रेरित करने में बड़े भाषा मॉडलों से बेहतर प्रदर्शन करते हैं, जिससे डेटा की कमी के बावजूद क्रॉस-डायलेक्ट ट्रांसफर और सूचना पुनर्प्राप्ति प्रदर्शन में महत्वपूर्ण सुधार होता है।

Robert Litschko, Barbara Plank, Diego Frassinelli2026-04-28
🤖 machine learning

One Size Fits None: Heuristic Collapse in LLM Investment Advice

यह शोधपत्र फ्रंटियर लार्ज लैंग्वेज मॉडल्स में "ह्यूरिस्टिक कोलैप्स" (heuristic collapse) की जांच करता है, जिसमें यह पाया गया है कि निवेश संबंधी सलाह देते समय, ये मॉडल्स अन्य महत्वपूर्ण प्रासंगिक जानकारी को अनदेखा करते हुए व्यवस्थित रूप से एक एकल कारक (जोखिम सहिष्णुता) पर अत्यधिक निर्भर हो जाते हैं, एक ऐसी समस्या जो मॉडल के बढ़ते पैमाने या वेब सर्च संवर्धन (web search augmentation) के बावजूद बनी रहती है।

Jillian Ross, Andrew W. Lo2026-04-28
💻 computer science

Reheat Nachos for Dinner? Evaluating AI Support for Cross-Cultural Communication of Neologisms

यह अध्ययन इस बात का मूल्यांकन करता है कि विभिन्न एआई (AI) सहायता उपकरण गैर-नेटिव वक्ताओं को अंग्रेजी नवोन्मेषी शब्दों (neologisms) को सीखने और उपयोग करने में कैसे सहायता करते हैं, जिसमें यह पाया गया है कि एआई-जनित स्पष्टीकरण अन्य तरीकों की तुलना में संचारत्मक दक्षता में महत्वपूर्ण सुधार करते हैं, हालांकि शिक्षार्थियों के कथित और वास्तविक प्रदर्शन के साथ-साथ शिक्षार्थी और मूल वक्ता के लेखन के बीच एक अंतर बना हुआ है।

Dayeon Ki, Yu Hou, Rachel Rudinger, Hal Daumé III, Marine Carpuat, Fumeng Yang2026-04-28
💻 computer science

Translate or Simplify First: An Analysis of Cross-lingual Text Simplification in English and French

यह अध्ययन बड़े भाषा मॉडलों का उपयोग करके अंग्रेजी और फ्रेंच के बीच क्रॉस-लिंगुअल टेक्स्ट सरलीकरण के लिए विभिन्न प्रॉम्प्टिंग रणनीतियों का मूल्यांकन करता है, जिसमें यह पाया गया है कि जबकि प्रत्यक्ष प्रॉम्प्टिंग उच्चतम अर्थ निष्ठा प्रदान करती है, एक "अनुवाद-फिर-सरलीकरण" दृष्टिकोण सबसे सरल आउटपुट उत्पन्न करता है।

Ido Dahan, Omer Toledano, Roey J. Gafter, Sharon Pardo, Oren Tsur, Hila Zahavi, Elior Sulem2026-04-28
💻 computer science

Learning Selective LLM Autonomy from Copilot Feedback in Enterprise Customer Support Workflows

यह शोध पत्र एक तैनात प्रणाली प्रस्तुत करता है जो एंटरप्राइज कस्टमर सपोर्ट वर्कफ़्लो को ऑटोमेट करने के लिए एक चयनात्मक (selective) LLM एजेंट को प्रशिक्षित करने हेतु कोपायलट फीडबैक और UI इंटरेक्शन ट्रेसेस का लाभ उठाती है, जिससे गुणवत्ता को कॉन्फिडेंस-आधारित एब्स्टेंशन मैकेनिज्म के माध्यम से बनाए रखते हुए 45% ऑटोमेशन दर और हैंडलिंग समय में 39% की कमी हासिल की गई है।

Nikita Borovkov, Elisei Rykov, Olga Tsymboi, Sergei Filimonov, Nikita Surnachev, Dmitry Bitman, Anatolii Potapov2026-04-28
💻 computer science

TSAssistant: A Human-in-the-Loop Agentic Framework for Automated Target Safety Assessment

TSAssistant एक ह्यूमन-इन-द-लूप मल्टी-एजेंट फ्रेमवर्क है जो टार्गेट सेफ्टी असेसमेंट रिपोर्ट के ड्राफ्टिंग को विशिष्ट, साक्ष्य-आधारित सब-एजेंट्स में विभाजित करके स्वचालित करता है, जबकि टॉक्सिकोलॉजिस्ट को अनुभागों को पुनरावृत्ति से परिष्कृत करने और अंतिम निर्णय अधिकार बनाए रखने की अनुमति देता है।

Xiaochen Zheng, Zhiwen Jiang, Melanie Guerard, Klas Hatje, Tatyana Doktorova2026-04-28
💻 computer science

KOMBO: Korean Character Representations Based on the Combination Rules of Subcharacters

यह शोध पत्र KOMBO को प्रस्तुत करता है, जो कोरियाई पूर्व-प्रशिक्षित भाषा मॉडलों के लिए एक नवीन ढांचा है जो ऐतिहासिक *हुनमिनजियोंगुम* में परिभाषित हंगेउल उप-पात्रों के अद्वितीय संयोजन नियमों का लाभ उठाता है, और कोरियाई भाषा की भाषाई विशेषताओं को बेहतर ढंग से पकड़कर कई प्राकृतिक भाषा समझ कार्यों पर मौजूदा अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करता है।

SungHo Kim, Juhyeong Park, Yeachan Kim, SangKeun Lee2026-04-28
🤖 machine learning

Representational Curvature Modulates Behavioral Uncertainty in Large Language Models

यह शोध पत्र यह प्रदर्शित करता है कि एक मॉडल के रिप्रजेंटेशनल प्रक्षेपवक्र (representational trajectory) का ज्यामितीय वक्रता (geometric curvature)—कि वह प्रोसेसिंग के दौरान कितना "मुड़ता" है—लार्ज लैंग्वेज मॉडल्स की प्रेडिक्टिव अनसर्टेन्टी (एन्ट्रॉपी) के साथ सीधे तौर पर सह-संबंधित है और इसका उपयोग उसे नियंत्रित करने के लिए किया जा सकता है।

Jack King, Evelina Fedorenko, Eghbal A. Hosseini2026-04-28