💬 NLP

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

यह शोधपत्र DataGovBench प्रस्तुत करता है, जो सरकारी ओपन डेटा से प्राप्त एक नया बेंचमार्क है जो जटिल टेबल QA और खोजपूर्ण अंतर्दृष्टि (exploratory insight) कार्यों पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे वर्तमान मॉडल्स और वास्तविक दुनिया के डेटा एनालिटिक्स की मांगों के बीच महत्वपूर्ण प्रदर्शन अंतराल का पता चलता है।

So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen2026-07-08
📊 statistics

Pitwall: Faithful Natural-Language Race-Strategy Briefings from a Calibrated Real-Time Monte Carlo Engine

यह शोधपत्र पिटवॉल (Pitwall) का परिचय देता है, जो एक ऐसी उत्पादन प्रणाली है जो एक आर्किटेक्चरल सत्यापन लूप को लागू करके निष्ठापूर्ण, बहुभाषी फॉर्मूला 1 रेस-रणनीति ब्रीफिंग तैयार करती है जहाँ प्रत्येक तथ्यात्मक दावे को एक कैलिब्रेटेड, वास्तविक समय के मोंटे कार्लो इंजन के विरुद्ध सत्यापित किया जाता है, जिससे जमीनी वास्तविकता सुनिश्चित होती है और फाइन-ट्यून्ड मॉडलों में जीवंतता और मतिभ्रम (hallucination) के बीच महत्वपूर्ण समझौतों का अनावरण होता है।

Juan S. Santillana (Independent Researcher)2026-07-08
💬 NLP

DynaKRAG: A Unified Framework for Learnable Evidence Control in Multi-Hop Retrieval-Augmented Generation

DynaKRAG एक एकीकृत ढांचा है जो मल्टी-हॉप रिट्रीवल-ऑगमेंटेड जनरेशन को एक स्टेट-कंडीशन्ड कंट्रोल समस्या के रूप में सूत्रबद्ध करता है, जिसमें रिट्रीवल और क्वेरी रीफॉर्म्युलेशन जैसे वैध एविडेंस ऑपरेशन्स में से गतिशील रूप से चयन करने के लिए एक सीखे गए पॉलिसी का उपयोग किया जाता है, जिससे यह HotpotQA, 2Wiki और MuSiQue जैसे बेंचमार्क पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Yaqi Wu, Xiaolei Guo, Chenyu Zhou, Jiaqi Huang, Xianfa Zhang, Junxu Zhang, Zhuo Yu, Zhubo Shi, Jianghao Lin, Dongdong Ge2026-07-08
💬 NLP

Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs

यह शोध पत्र Lychee-FD को प्रस्तुत करता है, जो एक नेटिव एंड-टू-एंड फुल-डुप्लेक्स स्पोकन लैंग्वेज मॉडल फ्रेमवर्क है, जो ध्वन्यात्मक और अर्थपूर्ण मॉडलिंग को अलग करने के लिए एक पदानुक्रमित पैरामीटर पृथक्करण रणनीति (hierarchical parameter separation strategy) का उपयोग करके अंतर्निहित मोडैलिटी इंटरफेरेंस को हल करता है और साथ ही अर्थपूर्ण सुसंगतता बनाए रखते हुए स्पीच इंटेलिजेंस और इंटरेक्शन फ्लूइडिटी में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zhenyu Liu, Yunxin Li, Xuanyu Zhang, Qixun Teng, Shenyuan Jiang, Haolan Chen, Minjun Zhao, Fanbo Meng, Yu Xu, Yancheng H (…)2026-07-08
🤖 AI

Rethinking Indic AI from a Lens of Cultural Heritage Preservation

यह शोध पत्र इंडिक एनएलपी (Indic NLP) के ऐतिहासिक विकास का सर्वेक्षण करके, अद्वितीय संरचनात्मक चुनौतियों का विश्लेषण करके, और अधिक न्यायसंगत एवं सांस्कृतिक रूप से अर्थपूर्ण फाउंडेशन मॉडल्स विकसित करने के लिए हर्मेन्यूटिक तर्क (hermeneutic reasoning) पर आधारित एक "कल्चर सेंसिंग" (Culture Sensing) अनुसंधान दिशा प्रस्तावित करके, भारत की भाषाई और सांस्कृतिक विरासत पर एआई (AI) के दोहरे प्रभाव का परीक्षण करता है।

Aparna Madva, Sharath Srivatsa, Srinath Srinivasa, Tulika Saha2026-07-08
💬 NLP

DrugAgent: Reliable Multi-Agent Integration of Conflicting Biomedical Evidence for Drug-Target Interaction Assessment

DrugAgent एक विश्वसनीय मल्टी-एजेंट सिस्टम है जो मशीन लर्निंग, नॉलेज ग्राफ और लिटरेचर रिट्रीवल से विषम और अक्सर विरोधाभासी बायोमेडिकल साक्ष्यों को एकीकृत करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे ड्रग-टारगेट इंटरेक्शन के आकलन में उच्च निष्ठा और जैविक संभाव्यता प्राप्त होती है।

Yoshitaka Inoue, Tianci Song, Xinling Wang, Rui Kuang, Tianfan Fu, Augustin Luna2026-07-07
💬 NLP

Memory-Efficient FastText: A Comprehensive Approach Using Double-Array Trie Structures and Mark-Compact Memory Management

यह शोध पत्र एक मेमोरी-कुशल FastText वेरिएंट प्रस्तुत करता है जो हैश बकेटों को टकराव-मुक्त (collision-free) डबल-एरे ट्राइ इंडेक्स से बदल देता है और वेक्टर गुणवत्ता एवं n-ग्राम व्याख्यात्मकता को बनाए रखते हुए मॉडल के आकार और लोड समय को नाटकीय रूप से कम करने के लिए मार्क-कॉम्पैक्ट मेमोरी प्रबंधन के साथ संरचनात्मक रूप से बाधित मर्जिंग का उपयोग करता है।

Yimin Du2026-07-07
🧬 biology

Leveraging Natural Language Processing to Unravel the Mystery of Life: A Review of NLP Approaches in Genomics, Transcriptomics, and Proteomics

यह समीक्षा इस बात का परीक्षण करती है कि कैसे वर्ड एम्बेडिंग्स से लेकर उन्नत ट्रांसफार्मर और हायना मॉडल्स तक, नेचुरल लैंग्वेज प्रोसेसिंग तकनीकों को जैविक अंतर्दृष्टि प्राप्त करने और जीवन प्रक्रियाओं की हमारी समझ को आगे बढ़ाने के लिए जीनोमिक, ट्रांसक्रिप्टोमिक और प्रोटिओमिक डेटा का विश्लेषण करने हेतु अनुकूलित किया जाता है।

Ella Rannon, David Burstein2026-07-07
💬 NLP

Curriculum-Guided Layer Scaling for Language Model Pretraining

यह शोध पत्र करिकुलम-गाइडेड लेयर स्केलिंग (CGLS) का प्रस्ताव करता है, जो एक कंप्यूट-कुशल प्रीट्रेनिंग फ्रेमवर्क है जो डेटा की बढ़ती कठिनाई के साथ प्रोग्रेसिव लेयर स्टैकिंग को सिंक्रोनाइज़ करता है ताकि रीजनिंग और नॉलेज-इंटेंसिव कार्यों पर लैंग्वेज मॉडल के जनरलाइजेशन और ज़ीरो-शॉट प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Karanpartap Singh, Neil Band, Ehsan Adeli2026-07-07
💬 NLP

Context Tuning for In-Context Optimization

यह शोधपत्र कॉन्टेक्स्ट ट्यूनिंग (Context Tuning) को प्रस्तुत करता है, जो एक वेट-फ्री (weight-free) विधि है जो इन-कॉन्टेक्स्ट लर्निंग के माध्यम से प्रदर्शनों (demonstrations) से एक प्रशिक्षण योग्य मेमोरी प्रतिनिधित्व को इनिशियलाइज़ करके और तत्पश्चात ग्रेडिएंट-आधारित अनुकूलन के माध्यम से इसे परिष्कृत करके बड़े भाषा मॉडलों में फ्यू-शॉट अनुकूलन को बढ़ाता है, जिससे यह मानक इन-कॉन्टेक्स्ट और प्रॉम्प्ट-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करता है और उच्च दक्षता के साथ टेस्ट-टाइम ट्रेनिंग के साथ प्रतिस्पर्धी सटीकता प्राप्त करता है।

Jack Lu, Ryan Teehan, Zhenbang Yang, Mengye Ren2026-07-07