💻 computer science

On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning

यह शोध पत्र प्रकट करता है कि DeepSeek-R1 के लंबे Chain-of-Thought प्रक्षेप पथों (trajectories) पर सुपरवाइज्ड फाइन-ट्यूनिंग करने से gpt-oss-120b डेटा की तुलना में कम प्रशिक्षण हानि (training loss) तो प्राप्त होती है, लेकिन अक्षम और विचलित तर्क पैटर्न के कारण सामान्यीकरण (generalization) खराब हो जाता है, और यह बार-बार शाखाओं में विभाजित होने वाले प्रक्षेप पथों को फ़िल्टर करने का प्रस्ताव देता है जिससे तर्क प्रदर्शन में उल्लेखनीय सुधार होता है।

Zhaoyi Li, Xiangyu Xi, Zhengyu Chen, Wei Wang, Gangwei Jiang, Ranran Shen, Linqi Song, Ying Wei, Defu Lian2026-04-03
💻 computer science

Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy

यह शोध पत्र EndoASR को प्रस्तुत करता है, जो एक डोमेन-अनुकूलित स्वचालित भाषण पहचान प्रणाली है जो गैस्ट्रोइंटेस्टाइनल एंडोस्कोपी में वास्तविक समय में मानव-AI सहयोग के लिए ट्रांसक्रिप्शन सटीकता और चिकित्सा शब्दावली की पहचान में महत्वपूर्ण सुधार करती है, जो मल्टी-सेंटर नैदानिक सेटिंग्स में मजबूत सामान्यीकरण और कुशल एज परिनियोजन का प्रदर्शन करती है।

Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang2026-04-03
💻 computer science

From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents

यह शोध पत्र एक बड़े पैमाने के वित्तीय टेक्स्ट-एंड-टेबल (पाठ-और-तालिका) QA डेटासेट पर दस रिट्रीवल रणनीतियों का बेंचमार्किंग करता है, जिससे यह पता चलता है कि न्यूरल रीरैंकिंग वाला एक हाइब्रिड रिट्रीवल पाइपलाइन सिंगल-स्टेज विधियों से बेहतर प्रदर्शन करता है और BM25 अक्सर वित्तीय दस्तावेजों के लिए डेंस रिट्रीवल से बेहतर होता है, साथ ही सटीक संख्यात्मक प्रश्नों के लिए क्वेरी एक्सपेंशन की सीमित उपयोगिता पर व्यावहारिक अंतर्दृष्टि भी प्रदान करता है।

Meftun Akarsu, Recep Kaan Karaman, Christopher Mierbach2026-04-03
💻 computer science

Taming CATS: Controllable Automatic Text Simplification through Instruction Fine-Tuning with Control Tokens

यह शोध पत्र कंट्रोल टोकन के साथ इंस्ट्रक्शन फाइन-ट्यूनिंग का उपयोग करके कंट्रोलेबल ऑटोमैटिक टेक्स्ट सिम्प्लीफिकेशन (CATS) के लिए एक डोमेन-अज्ञेय (domain-agnostic) ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जबकि छोटे मॉडल सुसंगत पठनीयता नियंत्रण प्राप्त कर सकते हैं, विश्वसनीय संपीड़न और मूल्यांकन मौजूदा कॉर्पोरा और मानक मूल्यांकन प्रथाओं की सीमाओं को संबोधित करने के लिए त्रुटि-आधारित मेट्रिक्स और प्रशिक्षण डेटा की परिवर्तनशीलता पर महत्वपूर्ण रूप से निर्भर करते हैं।

Hanna Hubarava, Yingqiang Gao2026-04-03
🤖 machine learning

Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks

यह शोध पत्र इस धारणा को चुनौती देता है कि भाषा-पूर्व-प्रशिक्षित मॉडल दृष्टि कार्यों के लिए अनुपयुक्त हैं, यह प्रदर्शित करते हुए कि एक सरल, लेबल-मुक्त "रैंडम लेबल ब्रिज ट्रेनिंग" चरण प्रभावी रूप से लार्ज लैंग्वेज मॉडल मापदंडों को विजुअल फाउंडेशन्स के साथ संरेखित कर सकता है, जो यह प्रकट करता है कि आंशिक अनुकूलन अक्सर विभिन्न मोडैलिटीज के बीच लाभकारी मौलिक गुणों को संरक्षित करता है।

Yaxin Luo, Zhiqiang Shen2026-04-03
💻 computer science

Is Clinical Text Enough? A Multimodal Study on Mortality Prediction in Heart Failure Patients

यह अध्ययन प्रदर्शित करता है कि एंटिटी-लेवल रिप्रजेंटेशन और स्ट्रक्चर्ड डेटा के साथ क्लिनिकल टेक्स्ट का सुपरवाइज्ड मल्टीमॉडल फ्यूजन, हार्ट फेलियर के रोगियों में अल्पकालिक मृत्यु दर की भविष्यवाणी के लिए टेक्स्ट-ओनली और वर्तमान लार्ज लैंग्वेज मॉडल दृष्टिकोणों दोनों से बेहतर प्रदर्शन करता है।

Oumaima El Khettari, Virgile Barthet, Guillaume Hocquet, Joconde Weller, Emmanuel Morin, Pierre Zweigenbaum2026-04-03
💻 computer science

ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues

यह शोधपत्र ImplicitBBQ प्रस्तुत करता है, जो विशेषता-आधारित संकेतों (characteristic-based cues) का उपयोग करने वाला एक नया बेंचमार्क है, जो यह प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स विविध जनसांख्यिकी (demographics) के प्रति स्पष्ट पूर्वाग्रहों की तुलना में काफी अधिक अंतर्निहित (implicit) पूर्वाग्रह प्रदर्शित करते हैं, एक ऐसा अंतर जिसे वर्तमान सुरक्षा और प्रॉम्पटिंग रणनीतियाँ पर्याप्त रूप से संबोधित करने में विफल रहती हैं।

Bhaskara Hanuma Vedula, Darshan Anghan, Ishita Goyal, Ponnurangam Kumaraguru, Abhijnan Chakraborty2026-04-03
💻 computer science

Reliable News or Propagandist News? A Neurosymbolic Model Using Genre, Topic, and Persuasion Techniques to Improve Robustness in Classification

यह शोध पत्र एक न्यूरोसिम्बोलिक मॉडल प्रस्तावित करता है जो मानक भाषा मॉडल दृष्टिकोणों की तुलना में प्रोपेगेंडा (प्रचार) का पता लगाने की मजबूती और सामान्यीकरण को बढ़ाने के लिए गैर-संदर्भगत टेक्स्ट एम्बेडिंग को शैली, विषय और अनुनय तकनीकों जैसे प्रतीकात्मक लक्षणों के साथ जोड़ता है।

Géraud Faye, Benjamin Icard, Morgane Casanova, Guillaume Gadek, Guillaume Gravier, Wassila Ouerdane, Céline Hudelot, Syl (…)2026-04-03
🤖 machine learning

RuleForge: Automated Generation and Validation for Web Vulnerability Detection at Scale

RuleForge एक AWS आंतरिक प्रणाली है जो एक नवीन LLM-as-a-judge कॉन्फिडेंस सिस्टम और इटरेटिव रिफाइनमेंट स्ट्रैटेजी का उपयोग करके Nuclei टेम्पलेट्स से वेब वल्नरेबिलिटी डिटेक्शन रूल्स के जनरेशन और वैलिडेशन को ऑटोमेट करती है, जो आधुनिक CVE डिस्क्लोजर के पैमाने को संबोधित करते हुए फॉल्स पॉजिटिव्स को काफी कम कर देती है।

Ayush Garg, Sophia Hager, Jacob Montiel, Aditya Tiwari, Michael Gentile, Zach Reavis, David Magnotti, Wayne Fullen2026-04-03
💻 computer science

SAFE: Stepwise Atomic Feedback for Error correction in Multi-hop Reasoning

यह शोध पत्र SAFE को प्रस्तुत करता है, जो एक गतिशील बेंचमार्किंग फ्रेमवर्क है जो अनग्राउंडेड चेन-ऑफ-थॉट रीजनिंग (Chain-of-Thought reasoning) को प्रशिक्षण के समय सत्यापन (train-time verification) और अनुमान के समय फीडबैक (inference-time feedback) के माध्यम से ग्राउंडेड संस्थाओं (grounded entities) के एक कड़ाई से सत्यापन योग्य अनुक्रम से प्रतिस्थापित करता है, जिससे मल्टी-हॉप क्यू-ए (multi-hop QA) में स्प्यूरियस करेक्टनेस (spurious correctness) समाप्त हो जाती है और मॉडल की सटीकता में महत्वपूर्ण सुधार होता है।

Daeyong Kwon, Soyoung Yoon, Seung-won Hwang2026-04-03