💬 NLP

Divide-Prompt-Refine: a Training-Free, Structure-Aware Framework for Biomedical Abstract Generation

यह शोध पत्र DPR-BAG को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), संरचना-जागरूक ढांचा है जो पूर्ण-पाठ लेखों को उनके अलंकारिक पहलुओं (rhetorical facets) में विभाजित करके, उन्हें समानांतर रूप से सारांशित करके, और वैश्विक सुसंगतता के लिए आउटपुट को परिष्कृत करके, उनसे सुसंगत और तथ्यात्मक रूप से सटीक बायोमेडिकल सारांश उत्पन्न करता है, और यह प्रदर्शित करता है कि जटिल रणनीतियों की तुलना में सरल प्रॉम्प्टिंग रणनीतियां अक्सर बेहतर तथ्यात्मक संरेखण प्रदान करती हैं।

Sylvey Lin, Joe Menke, Shufan Ming, Dongin Nam, Neil Smalheiser, Halil Kilicoglu2026-05-21
💬 NLP

Beyond Semantic Similarity: A Two-Phase Non-Parametric Retrieval Workflow for Corporate Credit Underwriting

यह शोध पत्र एक दो-चरणीय गैर-पैरामीट्रिक रिट्रीवल सिस्टम प्रस्तुत करता है जो विश्लेषणात्मक उपयोगिता को सिमेंटिक समानता पर प्राथमिकता देकर कॉर्पोरेट क्रेडिट अंडरराइटिंग में "समानता-उपयोगिता अंतराल" को संबोधित करता है, और 800 से अधिक विश्लेषकों के लिए दस्तावेज़ समीक्षा समय को घंटों से घटाकर मिनटों में सफलतापूर्वक कम करता है।

Linus Ng Junjia, Ezekiel Tee Kongquan, Kelvin Heng, Kenneth Zhu Ke, Zhao Jing Yuan2026-05-21
💬 NLP

Distributional Alignment as a Criterion for Designing Task Vectors in In-Context Learning

यह शोध पत्र लीनियर टास्क वेक्टर (LTV) प्रस्तुत करता है, जो एक ऐसी विधि है जो टास्क वेक्टर-आधारित और इन-कॉन्टेक्स्ट लर्निंग इन्फरेंस के बीच वितरण संबंधी विसंगति (distributional discrepancy) को न्यूनतम करके टास्क वेक्टर डिजाइन करती है, जिससे वर्गीकरण (classification), प्रतिगमन (regression) और क्रॉस-मॉडल ट्रांसफर कार्यों में सटीकता और दक्षता में महत्वपूर्ण सुधार होता है।

Jihoon Kwon, Jiwon Choi, Jy-yong Sohn2026-05-21
🤖 machine learning

Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression

यह शोध पत्र डिस्ट्रीब्यूशन-अवेयर रिवॉर्ड (Distribution-Aware Reward) का परिचय देता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) उद्देश्य है जो निरंतर रैंक की संभाव्यता स्कोर (Continuous Ranked Probability Score) के साथ कई डिकोड किए गए नमूनों का मूल्यांकन करके, बड़े भाषा मॉडलों को प्रतिगमन कार्यों (regression tasks) के लिए कैलिब्रेटेड प्रेडिक्टिव वितरण उत्पन्न करने हेतु अनुकूलित करता है, जिससे पारंपरिक पॉइंट-एस्टीमेट प्रशिक्षण विधियों की तुलना में अनिश्चितता अनुमान, रैंकिंग प्रदर्शन और मजबूती में सुधार होता है।

Jungsoo Park, Hyungjoo Chae, Ethan Mendes, Jay DeYoung, Varsha Kishore, Wei Xu, Alan Ritter2026-05-21
🤖 machine learning

The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering

यह शोध पत्र VerifySteer प्रस्तुत करता है, जो पैराग्राफ सीमाओं पर छिपे हुए-अवस्था संकेतों (hidden-state signals) का पता लगाकर और उन्हें चुनिंदा रूप से निर्देशित करके चरण-वार सत्यापनकर्ता की कठोरता को नियंत्रित और बेहतर बनाने की एक विधि है, जिससे यह काफी कम कम्प्यूटेशनल लागत के साथ मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Yefan Zhou, Yilun Zhou, Austin Xu, Soroush Vosoughi, Shafiq Joty, Jiang Gui2026-05-21
💬 NLP

Findings of the Counter Turing Test: AI-Generated Text Detection

यह शोध पत्र काउंटर ट्यूरिंग टेस्ट (CT2) के माध्यम से अत्याधुनिक एआई-जनरेटेड टेक्स्ट डिटेक्शन तकनीकों का मूल्यांकन करता है, जो यह प्रकट करता है कि जहाँ मानव बनाम एआई टेक्स्ट का बाइनरी क्लासिफिकेशन (द्विआधारी वर्गीकरण) लगभग पूर्ण सटीकता प्राप्त कर लेता है, वहीं फाइन-ट्यून्ड ट्रांसफॉर्मर्स और एन्सेम्बल लर्निंग जैसी उन्नत विधियों की सफलता के बावजूद, विशिष्ट जनरेटिंग मॉडल की पहचान करना काफी अधिक चुनौतीपूर्ण बना हुआ है।

Rajarshi Roy, Gurpreet Singh, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Shwetangshu Biswas, Kapil Wanaskar, Parth P (…)2026-05-21
💬 NLP

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

यह शोध पत्र चेतावनी देता है कि अवलोकन संबंधी डेटा (observational data) पर प्रशिक्षण के कारण LLM-सिम्युलेटेड प्रयोगों में "यूजर ड्रिफ्ट" (user drift) की समस्या होती है, जो कन्फाउंडिंग बायस (confounding bias) को जन्म देती है, और इस समस्या का पता लगाने के लिए नेगेटिव कंट्रोल आउटकम्स (negative control outcomes) का उपयोग करने तथा इसे कम करने के लिए परिष्कृत पर्सोना विनिर्देशों (refined persona specifications) का प्रस्ताव करता है।

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour2026-05-21
💬 NLP

Assessing socio-economic climate impacts from text data

यह शोध पत्र पाठ से सामाजिक-आर्थिक जलवायु प्रभाव डेटा प्राप्त करने के लिए एनएलपी (NLP) और बड़े भाषा मॉडलों के उपयोग में मौजूद पद्धतिगत विखंडन को संबोधित करता है, जो वर्तमान प्रथाओं को संश्लेषित करते हुए, प्रमुख चुनौतियों को रेखांकित करता है, और आपदा जोखिम प्रबंधन के लिए सुदृढ़, पारदर्शी और तुलनीय डेटासेट सुनिश्चित करने हेतु दिशा-निर्देश प्रस्तावित करता है।

Mariana Madruga de Brito, Brielen Madureira, Taís Maria Nunes Carvalho, Damien Delforge, Aglaé Jézéquel, Murathan Kurfal (…)2026-05-21
💬 NLP

Refining and Reusing Annotation Guidelines for LLM Annotation

यह शोध पत्र एक पुनरावृत्ति मॉडरेशन ढांचे (iterative moderation framework) का प्रस्ताव करता है और अनुभवजन्य रूप से उसे मान्य करता है जो बायोमेडिकल नेम एन्टिटी रिकग्निशन कार्यों में लार्ज लैंग्वेज मॉडल्स को गोल्ड-स्टैंडर्ड बेंचमार्क के साथ संरेखित करने के लिए एनोटेशन दिशानिर्देशों को व्यवस्थित रूप से परिष्कृत और पुन: उपयोग करता है, जो दिशानिर्देश एकीकरण, तर्क-अनुकूलित मॉडल्स और न्यूनतम पर्यवेक्षण के तहत मॉडरेशन की प्रभावकारिता की पुष्टि करता है।

Kon Woo Kim, Jin-Dong Kim, Akiko Aizawa2026-05-21
💬 NLP

Enhancing Scientific Discourse: Machine Translation for the Scientific Domain

यह शोध पत्र सामान्य और चार विशिष्ट वैज्ञानिक डोमेन में स्पेनिश-अंग्रेजी, फ्रेंच-अंग्रेजी और पुर्तगाली-अंग्रेजी भाषा युग्मों के लिए विशेष समानांतर और एकभाषी कॉर्पोरा के निर्माण को प्रस्तुत करता है, जो वैज्ञानिक विमर्श को बेहतर बनाने के लिए न्यूरल मशीन ट्रांसलेशन सिस्टम को फाइन-ट्यून करने में उनकी प्रभावशीलता को प्रदर्शित करता है।

Dimitris Roussis, Sokratis Sofianopoulos, Stelios Piperidis2026-05-21