💬 NLP

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

यह शोध पत्र K-BrowseComp को प्रस्तुत करता है, जो कोरियाई संदर्भों पर आधारित एक नया वेब-ब्राउज़िंग एजेंट बेंचमार्क है जिसमें 400 मैन्युअल रूप से सत्यापित और सिंथेटिक समस्याएँ शामिल हैं, जो यह प्रकट करता है कि सीमांत (फ्रंटियर) और कोरिया-विशिष्ट बड़े भाषा मॉडल भी इन कार्यों के साथ काफी संघर्ष करते हैं, जिससे 0% और 45.67% के बीच सटीकता दर प्राप्त होती है।

Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Chan (…)2026-06-02
💬 NLP

Investigating and Alleviating Harm Amplification in LLM Interactions

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में मल्टी-टर्न हार्म एम्प्लीफिकेशन (बहु-चरण हानिकारक वृद्धि) के मूल्यांकन के लिए एक बेंचमार्क के रूप में HarmAmp पेश करता है, और TrajSafe का प्रस्ताव देता है जो एक सक्रिय निगरानी प्रणाली है जो हानिकारक प्रक्षेप पथों (harmful trajectories) का पूर्वानुमान लगाकर और मॉडल की उपयोगिता से समझौता किए बिना हस्तक्षेप करके इन जोखिमों को प्रभावी ढंग से कम करती है।

Ruohao Guo, Wei Xu, Alan Ritter2026-06-02
💬 NLP

ODTQA-FoRe: An Open-Domain Tabular Question Answering Dataset for Future Data Forecasting and Reasoning

यह शोध पत्र ODTQA-FoRe को प्रस्तुत करता है, जो रियल एस्टेट डेटा का उपयोग करके भविष्य के डेटा पूर्वानुमान और तर्क पर केंद्रित पहला ओपन-डोमेन टेबुलर क्वेश्चन अनस्वर्सिंग डेटासेट है, साथ ही इसमें TimeFore भी शामिल है, जो एक LLM एजेंट फ्रेमवर्क है जो भविष्य-उन्मुख संख्यात्मक भविष्यवाणियों को संभालने में वर्तमान मॉडलों की सीमाओं को दूर करने के लिए डेटा रिट्रीवल, बाहरी टाइम-सीरीज फोरकास्टिंग और विश्लेषणात्मक संश्लेषण को एकीकृत करता है।

Zhensheng Wang, Xiaole Liu, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia2026-06-02
💬 NLP

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

यह शोध पत्र PaSBench-Video प्रस्तुत करता है, जो एक स्ट्रीमिंग वीडियो बेंचमार्क है और यह दर्शाता है कि वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स समय पर और सटीक प्रोएक्टिव सुरक्षा चेतावनियाँ प्रदान करने में विफल रहते हैं, क्योंकि उन्हें अत्यधिक फॉल्स पॉजिटिव्स को ट्रिगर किए बिना उभरते जोखिमों को सुरक्षित दृश्यों से अलग करने में कठिनाई होती है।

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He2026-06-02
🤖 AI

Food Noise & False Safety: A Systematic Evaluation of How LLMs Fail to Adapt to Eating Disorder Queries with Clinician Feedback

यह शोध पत्र व्यवस्थित रूप से इस बात का मूल्यांकन करता है कि कैसे लार्ज लैंग्वेज मॉडल्स (Large Language Models) ईटिंग डिसऑर्डर (खाने के विकार) से ग्रस्त उपयोगकर्ताओं के लिए बिना किसी आलोचनात्मक जांच के असुरक्षित प्रतिक्रियाओं को अनुकूलित करते हैं और उन्हें उत्पन्न करते हैं, जिसमें नैदानिक विशेषज्ञों के सहयोग के माध्यम से उन विशिष्ट भाषाई संकेतों की पहचान की गई है जो नुकसान के जोखिमों को बढ़ाते हैं।

Giulia Pucci, Emily Hemendinger, Ruizhe Li, Gavin Abercrombie, Tanvi Dinkar, Arabella Sinclair2026-06-02
💬 NLP

Learning When to Translate for Multilingual Reasoning

यह शोध पत्र Luar को प्रस्तुत करता है, जो एक लैंग्वेज अंडरस्टैंडिंग बाउंड्री-अवेयर रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो रीजनिंग लैंग्वेज मॉडल्स को केवल तभी अंग्रेजी अनुवाद का चयनत्मक रूप से आह्वान करने में सक्षम बनाता है जब गैर-अंग्रेजी इनपुट के प्रति उनकी सीधी समझ अविश्वसनीय हो, जिससे अनावश्यक अनुवाद से बचते हुए उनके बहुभाषी तर्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

Deokhyung Kang, Hyounghun Kim, Gary Geunbae Lee2026-06-02
💬 NLP

Ghost Tool Calls: Issue-Time Privacy for Speculative Agent Tools

यह शोध पत्र "घोस्ट टूल कॉल्स" (ghost tool calls) को एक गोपनीयता भेद्यता के रूप में पहचानता है जहाँ अनुमानित टूल इनवोकेशन्स (speculative tool invocations), किसी एजेंट द्वारा किसी शाखा (branch) को प्रतिबद्ध करने से पहले बाहरी पर्यवेक्षकों को उपयोगकर्ता के इरादे को लीक कर देते हैं, और "स्पेक्टिव टूल प्राइवेसी कॉन्ट्रैक्ट्स" (Speculative Tool Privacy Contracts) को एक रनटाइम एब्स्ट्रैक्शन के रूप में प्रस्तावित करता है जो डिस्पैच से पूर्व तर्कों (arguments) और गंतव्यों (destinations) को बदलने या दबाने के लिए इश्यू-टाइम नीतियों को लागू करके इस जोखिम को कम करता है।

Bardia Mohammadi, Lars Klein, Akhil Arora, Laurent Bindschaedler2026-06-02
💬 NLP

Towards Multidisciplinary Summarization of Hospital Stays: Efficient Sentence-Level Clinical Provenance Categorization

यह पायलट अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स), विशेष रूप से 70B पैरामीटर वेरिएंट का सुपरवाइज्ड फाइन-ट्यूनिंग, विविध विषयों में वाक्य-स्तरीय नैदानिक उत्पत्ति (क्लिनिकल प्रोवेनेंस) को प्रभावी ढंग से वर्गीकृत करता है ताकि जटिल अस्पताल प्रवासों के कुशल, संरचित सारांशीकरण को सक्षम बनाया जा सके, जिसमें क्वांटाइज्ड मॉडल फुल-प्रिसिजन बेसलाइनों के तुलनीय प्रदर्शन प्रदान करते हुए कम्प्यूटेशनल लागतों को काफी कम करते हैं।

Baris Karacan, Vaibhav Bhargava, Barbara Di Eugenio, Natalie Parde, Mary Khetani, Yu-Shan Tseng, Vanessa Barbosa, Julie (…)2026-06-02
💬 NLP

When Rating Scales Fall Short: LLM-Assisted Discovery of ADHD Signals in Turkish Teacher Narratives

यह अध्ययन प्रदर्शित करता है कि तुर्की शिक्षक वृत्तांतों का लार्ज लैंग्वेज मॉडल-सहायता प्राप्त विश्लेषण उन नैदानिक रूप से प्रासंगिक ADHD संकेतों को उजागर कर सकता है जो पारंपरिक संरचित रेटिंग स्केल द्वारा पकड़े गए संकेतों के पूरक हैं, जिससे पारंपरिक मानकीकृत उपकरणों द्वारा अकेले प्राप्त की जाने वाली सटीकता से परे ADHD का पता लगाने की सटीकता बढ़ जाती है।

Baris Karacan, Irem Aktar Songur, Ahmet Ozaslan, Elvan Iseri2026-06-02
💬 NLP

FigSIM: A Dataset for Fine-grained Suicide Severity and Figurative Language in Suicide Memes

यह शोधपत्र FigSIM को प्रस्तुत करता है, जो 1,049 एनोटेटेड (annotated) आत्महत्या संबंधी मीम्स का पहला डेटासेट है, जिसे आत्महत्या की गंभीरता, आलंकारिक भाषा और संबंधित सामग्री के सूक्ष्म विश्लेषण को सक्षम बनाने के लिए डिज़ाइन किया गया है, साथ ही इस प्रकार की हानिकारक सामग्री के मॉडरेशन को स्वचालित करने में आने वाली अनूठी चुनौतियों और पूर्वाग्रहों को उजागर करने के लिए कई मॉडलों का बेंचमार्किंग भी किया गया है।

Liuliu Chen, Elise R. Carrotte, Brian E. Chapman, Jo Robinson, Mike Conway2026-06-02