💬 NLP

Beyond Accuracy: Risk-Sensitive Evaluation of Hallucinated Medical Advice

यह शोध पत्र एक जोखिम-संवेदनशील मूल्यांकन ढांचे का प्रस्ताव करता है जो तथ्यात्मक सटीकता से ध्यान हटाकर काल्पनिक चिकित्सा सलाह के संभावित नुकसान पर केंद्रित है, जो जोखिम-युक्त भाषा को परिमाणित करता है, और यह प्रकट करता है कि मानक मेट्रिक्स मॉडलों के बीच महत्वपूर्ण सुरक्षा अंतरों को पकड़ने में विफल रहते हैं।

Savan Doshi2026-03-02
💬 NLP

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

यह शोध पत्र HLE-Verified को प्रस्तुत करता है, जो 'ह्यूमैनिटीज़ लास्ट एग्जाम' (Humanity's Last Exam) बेंचमार्क का एक व्यवस्थित रूप से संशोधित और प्रमाणित संस्करण है, जो शोर वाले आइटम्स (noisy items) को समाप्त करने के लिए एक कठोर दो-चरणीय विशेषज्ञ सत्यापन और मरम्मत वर्कफ़्लो का उपयोग करता है, जिससे फ्रंटियर लैंग्वेज मॉडल मूल्यांकनों की सटीकता और विश्वसनीयता में महत्वपूर्ण सुधार होता है।

Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li (…)2026-03-02
💬 NLP

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

यह शोध पत्र ओपन रूब्रिक सिस्टम (OpenRS) का परिचय देता है, जो ओपन-एंडेड रीइन्फोर्समेंट लर्निंग अलाइनमेंट में मजबूती और सामान्यीकरण में सुधार करने के लिए अपारदर्शी स्केलर रिवॉर्ड्स के स्थान पर स्पष्ट, अनुकूलन योग्य और निरीक्षण योग्य रूब्रिक्स को प्रतिस्थापित करता है।

Ruipeng Jia, Yunyi Yang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang2026-03-02
💬 NLP

Modeling Distinct Human Interaction in Web Agents

यह शोध पत्र नए एकत्रित किए गए CowCorpus डेटासेट का उपयोग करके वेब एजेंटों में विशिष्ट मानवीय हस्तक्षेप पैटर्न को मॉडल करने के लिए एक ढांचे का परिचय देता है, जो यह प्रदर्शित करता है कि उपयोगकर्ता की भागीदारी का पूर्वानुमान लगाने के लिए भाषा मॉडलों को प्रशिक्षित करना, हस्तक्षेप भविष्यवाणी सटीकता और उपयोगकर्ता द्वारा रेट की गई एजेंट उपयोगिता दोनों में महत्वपूर्ण सुधार करता है।

Faria Huq, Zora Zhiruo Wang, Zhanqiu Guo, Venu Arvind Arangarajan, Tianyue Ou, Frank Xu, Shuyan Zhou, Graham Neubig, Jef (…)2026-03-02
💰 quantitative finance

Forecasting Future Language: Context Design for Mention Markets

यह शोध पत्र मार्केट-कंडीशन्ड प्रॉम्प्टिंग (MCP) और इसके मिश्रण वेरिएंट (MixMCP) को पेश करते हुए मेंशन मार्केट्स में लार्ज लैंग्वेज मॉडल्स के लिए इनपुट कॉन्टेक्स्ट को अनुकूलित करने की जांच करता है, जो यह प्रदर्शित करता है कि समृद्ध प्रासंगिक जानकारी और मार्केट प्रोबेबिलिटीज को प्रायर्स (priors) के रूप में उपचारित करना कीवर्ड-मेंशन पूर्वानुमानों की सटीकता और अंशांकन (calibration) में महत्वपूर्ण सुधार करता है।

Sumin Kim, Jihoon Kwon, Yoon Kim, Nicole Kagan, Raffi Khatchadourian, Wonbin Ahn, Alejandro Lopez-Lira, Jaewon Lee, Yoon (…)2026-03-02
💬 NLP

Bridging Latent Reasoning and Target-Language Generation via Retrieval-Transition Heads

यह शोध पत्र बहुभाषी LLMs में 'रिट्रीवल-ट्रांज़िशन हेड्स' (RTHs) को एक विशिष्ट अटेंशन मैकेनिज्म के रूप में प्रस्तुत करता है जो लक्षित-भाषा आउटपुट की ओर संक्रमण को नियंत्रित करते हैं और क्रॉस-लिंगुअल चेन-ऑफ-थॉट रीजनिंग के लिए रिट्रीवल हेड्स की तुलना में अधिक महत्वपूर्ण हैं, जैसा कि कई बेंचमार्क और मॉडल परिवारों में उन्हें मास्क करने पर प्रदर्शन में होने वाली महत्वपूर्ण गिरावट से सिद्ध होता है।

Shaswat Patel, Vishvesh Trivedi, Yue Han, Yihuai Hong, Eunsol Choi2026-03-02
💬 NLP

Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?

यह शोध पत्र तर्क देता है कि डिफ्यूजन लैंग्वेज मॉडल्स में ऑटोरेग्रेसिव-जैसे डिकोडिंग की व्यापकता उनके उद्देश्यों और क्रमिक प्रशिक्षण डेटा के बीच एक बेमेल (mismatch) से उत्पन्न होती है, और NAP का प्रस्ताव करता है, जो एक डेटा-केंद्रित दृष्टिकोण है जो गणितीय तर्क बेंचमार्क पर बेहतर प्रदर्शन के साथ वास्तविक समानांतर, गैर-ऑटोरेग्रेसिव पीढ़ी को सक्षम करने के लिए स्वतंत्र तर्क प्रक्षेपवक्रों (reasoning trajectories) को क्यूरेट करता है।

Pengxiang Li, Dilxat Muhtar, Tianlong Chen, Lu Yin, Shiwei Liu2026-03-02
💬 NLP

Serendipity with Generative AI: Repurposing knowledge components during polycrisis with a Viable Systems Model approach

यह शोध पत्र यह प्रदर्शित करता है कि कैसे जनरेटिव एआई (generative AI) मौजूदा साहित्य से पुन: प्रयोज्य ज्ञान घटकों को निकालने और उन्हें एक 'विएबल सिस्टम्स मॉडल' (Viable Systems Model) के अनुरूप रिपॉजिटरी में व्यवस्थित करने के लिए एक 'सेरेंडिपिटी इंजन' (serendipity engine) के रूप में कार्य कर सकता है, जिससे संगठनों को केवल अभूतपूर्व नवाचार पर निर्भर रहने के बजाय व्यवस्थित ज्ञान पुनरुत्पादन के माध्यम से 'पॉलीक्राइसिस' (polycrisis) अनिश्चितता से निपटने के लिए एक रणनीतिक ढांचा प्रदान किया जा सके।

Gordon Fletcher, Saomai Vu Khan2026-03-02
💬 NLP

Reason to Contrast: A Cascaded Multimodal Retrieval Framework

यह शोध पत्र TTE-v2 को प्रस्तुत करता है, जो एक कैस्केड मल्टीमॉडल रिट्रीवल फ्रेमवर्क है जो MMEB-V2 बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए रीजनिंग-ड्रिवन टोकन स्केलिंग और रीरैंकिंग एवं रिट्रीवल के बीच एक फीडबैक लूप का लाभ उठाता है, जो पारंपरिक मॉडल-साइज स्केलिंग के लिए एक टोकन-कुशल विकल्प प्रदान करता है।

Xuanming Cui, Hong-You Chen, Hao Yu, Hao Yuan, Zihao Wang, Shlok Kumar Mishra, Hanchao Yu, Yonghuan Yang, Jun Xiao, Ser- (…)2026-03-02
💬 NLP

An Agentic LLM Framework for Adverse Media Screening in AML Compliance

यह शोध पत्र एक एजेंटिक एलएलएम (LLM) फ्रेमवर्क प्रस्तुत करता है जो एएमएल (AML) अनुपालन के लिए प्रतिकूल मीडिया स्क्रीनिंग को स्वचालित करने हेतु रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) का उपयोग करता है, जो फाल्स पॉजिटिव और मैन्युअल समीक्षा के प्रयासों को कम करने के लिए एक एडवर्स मीडिया इंडेक्स स्कोर उत्पन्न करके उच्च जोखिम वाले व्यक्तियों को स्वच्छ नामों से प्रभावी ढंग से अलग करता है।

Pavel Chernakov, Sasan Jafarnejad, Raphaël Frank2026-03-02