💬 NLP

Quantifying and Mitigating Premature Closure in Frontier LLMs

यह अध्ययन फ्रंटियर लार्ज लैंग्वेज मॉडल्स में "प्रीमैच्योर क्लोजर" (असमय निष्कर्ष) को परिभाषित और परिमाणित करता है, जो अनिश्चितता के तहत अनुचित उत्तर देने की उनकी प्रवृत्ति को दर्शाता है, जो मेडिकल बेंचमार्क में उच्च विफलता दर को प्रकट करता है और यह प्रदर्शित करता है कि हालांकि सुरक्षा प्रॉम्पटिंग कुछ शमन प्रदान करती है, फिर भी अत्यधिक आत्मविश्वास के महत्वपूर्ण जोखिम बने हुए हैं।

Rebecca Handler, Suhana Bedi, Nigam Shah2026-05-15
💬 NLP

The Scientific Contribution Graph: Automated Literature-based Technological Roadmapping at Scale

यह शोध पत्र साइंटिफिक कॉन्ट्रिब्यूशन ग्राफ (Scientific Contribution Graph) को प्रस्तुत करता है, जो 2,30,000 शोध पत्रों से निकाले गए 20 लाख योगदानों और 1.25 करोड़ पूर्ववर्ती किनारों (prerequisite edges) का एक बड़े पैमाने का संसाधन है, ताकि स्वचालित तकनीकी रोडमैपिंग को सक्षम बनाया जा सके और पूर्ववर्ती भविष्यवाणी (prerequisite prediction) के माध्यम से वैज्ञानिक खोज में सहायता प्रदान की जा सके।

Peter A. Jansen2026-05-15
💬 NLP

Small, Private Language Models as Teammates for Educational Assessment Design

यह शोध पत्र प्रदर्शित करता है कि लघु भाषा मॉडल (Small Language Models), शैक्षणिक मूल्यांकन डिजाइन के लिए प्रतिस्पर्धी और गोपनीयता-संरक्षण करने वाले साथियों के रूप में कार्य कर सकते हैं, जो शैक्षणिक रूप से संरेखित प्रश्न उत्पन्न करने में बड़े भाषा मॉडलों (Large Language Models) के समकक्ष हैं, जबकि यह स्वचालित मूल्यांकन में व्यवस्थित पूर्वाग्रहों के कारण मानवीय निरीक्षण की आवश्यकता को भी रेखांकित करता है।

Chris Davis Jaldi, Anmol Saini, Shan Zhang, Noah Schroeder, Cogan Shimizu, Eleni Ilkou2026-05-15
💬 NLP

AI Knows When It's Being Watched: Functional Strategic Action and Contextual Register Modulation in Large Language Models

यह अध्ययन प्रदर्शित करता है कि जब बड़े भाषा मॉडल सामाजिक अवलोकन को महसूस करते हैं, तो वे व्यवस्थित भाषाई अनुकूलन और रजिस्टर औपचारिकता प्रदर्शित करते हैं, जिसमें मानव निगरानी एआई निगरानी की तुलना में अधिक मजबूत व्यवहार परिवर्तन उत्पन्न करती है, जिससे सामाजिक रूप से संरचित संदर्भों में रणनीतिक संचार संबंधी कार्रवाई की उनकी क्षमता का पता चलता है।

Vinicius Covas, Jorge Alberto Hidalgo Toledo2026-05-15
💬 NLP

Orchard: An Open-Source Agentic Modeling Framework

यह शोध पत्र Orchard को प्रस्तुत करता है, जो एक हल्का एनवायरनमेंट लेयर (Orchard Env) और विशिष्ट प्रशिक्षण रेसिपी वाला एक ओपन-सोर्स फ्रेमवर्क है, जो कोडिंग, GUI और पर्सनल असिस्टेंट डोमेन में स्केलेबल, उच्च-प्रदर्शन वाले एजेंटिक मॉडलिंग को सक्षम बनाता है और ओपन-सोर्स मॉडलों के बीच अत्याधुनिक परिणाम प्राप्त करता है।

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen (…)2026-05-15
💬 NLP

On the Cultural Anachronism and Temporal Reasoning in Vision Language Models

यह शोध पत्र "सांस्कृतिक कालदोष" (cultural anachronism)—विज़न-लैंग्वेज मॉडल्स द्वारा ऐतिहासिक कलाकृतियों की समयानुसार अनुपयुक्त अवधारणाओं का उपयोग करके गलत व्याख्या करने की प्रवृत्ति—की पहचान और मात्रा निर्धारण करता है, जिसके लिए TAB-VLM बेंचमार्क पेश किया गया है, जो भारतीय सांस्कृतिक विरासत के बारे में तर्क करने के दौरान अत्याधुनिक मॉडल्स में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

Mukul Ranjan, Prince Jha, Khushboo Kumari, Zhiqiang Shen2026-05-15
💬 NLP

Concurrency without Model Changes: Future-based Asynchronous Function Calling for LLMs

यह शोधपत्र AsyncFC प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो बिना किसी मॉडल फाइन-ट्यूनिंग या प्रोटोकॉल परिवर्तन के एसिंक्रोनस और समानांतर टूल उपयोग को सक्षम करने के लिए मॉडल डिकोडिंग को फंक्शन निष्पादन से अलग करके LLM एजेंट लेटेंसी (विलंबता) को कम करता है।

Guangyu Feng, Huanzhi Mao, Prabal Dutta, Joseph E. Gonzalez2026-05-15
💬 NLP

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

यह शोध पत्र एक पुनरुत्पादक (reproducible), डेटासेट-अज्ञेय (dataset-agnostic) ढांचे को प्रस्तुत करता है जो बिना पुन: एनोटेशन के टेक्स्ट-आधारित टूल-कॉलिंग बेंचमार्क को ऑडियो मूल्यांकन में परिवर्तित करता है, जो टेक्स्ट और वॉयस के बीच महत्वपूर्ण मॉडल-निर्भर प्रदर्शन अंतराल को प्रकट करता है और प्रभावी, गोपनीयता-संरक्षण जज के रूप में ओपन-सोर्स LLMs को प्रमाणित करता है।

Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN2026-05-15
💬 NLP

Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

यह शोध पत्र 932 सुरक्षा अध्येशनों से व्युत्पन्न एक व्यापक 4×6 लक्ष्य × तकनीक (Target × Technique) वर्गीकरण और बेंचमार्क कवरेज ऑडिट फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान LLM अटैक बेंचमार्क सामूहिक रूप से अधिकतम 25% खतरे की सतह को कवर करते हैं और महत्वपूर्ण मूल्यांकन अंतराल एवं नामकरण विखंडन से ग्रस्त हैं।

Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray, Alexey A. Shvets2026-05-15