💬 NLP

Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection

यह शोध पत्र प्रदर्शित करता है कि एम्बेडिंग स्पेस में क्रॉस-लिंगुअल निरंतरता का लाभ उठाना उच्च-संसाधन वाली भाषाओं को निम्न-संसाधन वाली भाषाओं के लिए गुणवत्ता फ़िल्टरिंग को सब्सिडी देने की अनुमति देता है, जिससे मोनोलिंगुअल बेसलाइन की तुलना में मल्टीलिंगुअल प्रीट्रेनिंग में बेहतर रैंक स्थिरता और सटीकता प्राप्त होती है, विशेष रूप से थर्ड क्वार्टाइल सैंपलिंग और रिटेंशन रेट ट्यूनिंग जैसी रणनीतियों के संयोजन के साथ।

Yassine Turki, Vinko Sabolčec, Bettina Messmer, Martin Jaggi2026-04-23
💬 NLP

LLM StructCore: Schema-Guided Reasoning Condensation and Deterministic Compilation

यह शोध पत्र LLM StructCore प्रस्तुत करता है, जो एक दो-चरणीय, स्कीमा-निर्देशित ढांचा है जो 134-आइटम वाले क्लिनिकल केस रिपोर्ट फॉर्म भरने के चुनौतीपूर्ण कार्य को एक भाषा-अज्ञेय (language-agnostic) LLM-आधारित रीजनिंग सारांश और उसके बाद एक नियत (deterministic) कंपाइलर में विभाजित करता है, जो शोर (noise) और सख्त आउटपुट बाधाओं को प्रभावी ढंग से प्रबंधित करते हुए CL4Health 2026 डिस्पनिया (Dyspnea) चुनौती पर मजबूत प्रदर्शन प्राप्त करता है।

Serhii Zabolotnii2026-04-23
💬 NLP

Where Reasoning Breaks: Logic-Aware Path Selection by Controlling Logical Connectives in LLMs Reasoning Chains

यह शोध पत्र एक बहु-स्तरीय ढांचे का प्रस्ताव करता है जो तार्किक संयोजकों (logical connectives) को उच्च-एन्ट्रॉपी वाले विफलता बिंदुओं के रूप में पहचानकर और ग्रेडिएंट-आधारित स्टीयरिंग, स्थानीयकृत ब्रांचिंग और लक्षित ट्रांज़िशन प्राथमिकता अनुकूलन के माध्यम से विशेष रूप से इन जंक्शनों पर हस्तक्षेप करके LLM तर्क सटीकता और दक्षता में सुधार करता है।

Seunghyun Park, Yuanyuan Lei2026-04-23
💬 NLP

Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents

यह शोध पत्र ProactAgent को प्रस्तुत करता है, जो एक लाइफलॉन्ग लर्निंग फ्रेमवर्क है जो एक्सपीरियंस-एन्हांस्ड ऑनलाइन इवोल्यूशन और एक प्रोएक्टिव रीइन्फोर्समेंट लर्निंग-आधारित रिट्रीवल मैकेनिज्म का उपयोग करता है ताकि एजेंटों को केवल आवश्यकता होने पर ही संरचित स्मृतियों और कौशलों को गतिशील रूप से और चयनात्मक रूप से पुनः प्राप्त करने में सक्षम बनाया जा सके, जिससे विविध वातावरणों में कार्य प्रदर्शन और दक्षता में महत्वपूर्ण सुधार होता है।

Yuxuan Cai, Jie Zhou, Qin Chen, Liang He2026-04-23
💬 NLP

Self-Aware Vector Embeddings for Retrieval-Augmented Generation: A Neuroscience-Inspired Framework for Temporal, Confidence-Weighted, and Relational Knowledge

यह शोध पत्र SmartVector को प्रस्तुत करता है, जो एक तंत्रिका विज्ञान (न्यूरोसाइंस) से प्रेरित ढांचा है जो स्थिर एम्बेडिंग को टेम्पोरल (सामयिक), कॉन्फिडेंस (विश्वास) और रिलेशनल (संबंधात्मक) गुणों के साथ संवर्धित करके रिट्रीवल-ऑगमेंटेड जनरेशन को बेहतर बनाता है, जिससे पारंपरिक RAG प्रणालियों की तुलना में सटीकता में उल्लेखनीय सुधार होता है, पुराने उत्तरों में कमी आती है और कम्प्यूटेशनल लागत कम होती है।

Naizhong Xu2026-04-23
💬 NLP

Self-Guided Plan Extraction for Instruction-Following Tasks with Goal-Conditional Reinforcement Learning

यह शोधपत्र SuperIgor को प्रस्तुत करता है, जो एक स्व-निर्देशित ढांचा (self-guided framework) है जो लक्ष्य-सशर्त सुदृढीकरण शिक्षण (goal-conditional reinforcement learning) और पुनरावृत्ति सह-प्रशिक्षण (iterative co-training) का उपयोग करता है ताकि भाषा मॉडलों को निर्देश-अनुपालन कार्यों के लिए उच्च-स्तरीय योजनाओं को स्वायत्त रूप से उत्पन्न करने और परिष्कृत करने में सक्षम बनाया जा सके, जिससे मैनुअल एनोटेशन पर निर्भरता कम होती है और अनुपालन एवं सामान्यीकरण में सुधार होता है।

Zoya Volovikova, Nikita Sorokin, Dmitriy Lukashevskiy, Aleksandr Panov, Alexey Skrynnik2026-04-23
🤖 machine learning

COMPASS: COntinual Multilingual PEFT with Adaptive Semantic Sampling

COMPASS एक नवीन डेटा-केंद्रित ढांचा है जो वितरण-जागरूक क्लस्टरिंग के आधार पर सहायक बहुभाषी डेटा चुनने के लिए एडेप्टिव सिमेंटिक सैंपलिंग के साथ पैरामीटर-कुशल फाइन-ट्यूनिंग का उपयोग करता है, जिससे सकारात्मक क्रॉस-लिंगुअल ट्रांसफर को अधिकतम और हस्तक्षेप को न्यूनतम करते हुए गतिशील डेटा वितरणों के प्रति निरंतर अनुकूलन सक्षम होता है।

Noah Flynn2026-04-23
💬 NLP

Can "AI" Be a Doctor? A Study of Empathy, Readability, and Alignment in Clinical LLMs

यह अध्ययन नैदानिक लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है और पाता है कि जबकि वे बिना हस्तक्षेप के अर्थपूर्ण निष्ठा और पठनीयता में चिकित्सकों से मेल खाने में संघर्ष करते हैं, वे सहयोगात्मक उपकरणों के रूप में सबसे प्रभावी ढंग से कार्य करते हैं जो, जब पुनर्गठित या पुनर्गठित किए जाते हैं, तो रोगियों के लिए संचार की स्पष्टता और भावनात्मक स्वर को महत्वपूर्ण रूप से बढ़ाते हैं।

Mariano Barone, Francesco Di Serio, Roberto Moio, Marco Postiglione, Giuseppe Riccio, Antonio Romano, Vincenzo Moscato2026-04-23
💬 NLP

Convergent Evolution: How Different Language Models Learn Similar Number Representations

यह शोधपत्र प्रदर्शित करता है कि विविध भाषा मॉडल आर्किटेक्चर समान आवधिक संख्या निरूपणों को सीखकर अभिसारी विकास (convergent evolution) प्रदर्शित करते हैं, फिर भी केवल डेटा, आर्किटेक्चर और प्रशिक्षण संकेतों के विशिष्ट संयोजन ही इन विशेषताओं को मॉड्यूलर अंकगणित कार्यों के लिए ज्यामितीय रूप से विभाज्य बनाने में सक्षम करते हैं।

Deqing Fu, Tianyi Zhou, Mikhail Belkin, Vatsal Sharan, Robin Jia2026-04-23
💬 NLP

AVISE: Framework for Evaluating the Security of AI Systems

यह शोध पत्र AVISE को पेश करता है, जो एआई प्रणालियों की कमजोरियों को व्यवस्थित रूप से पहचानने और उनकी सुरक्षा का मूल्यांकन करने के लिए एक मॉड्यूलर ओपन-सोर्स फ्रेमवर्क है, जिसे एक संवर्धित रेड क्वीन हमले (Red Queen attack) का उपयोग करते हुए एक स्वचालित सुरक्षा मूल्यांकन परीक्षण के माध्यम से प्रदर्शित किया गया है जिसने नौ विविध भाषा मॉडलों में जेलब्रेक कमजोरियों का सफलतापूर्वक पता लगाया।

Mikko Lempinen, Joni Kemppainen, Niklas Raesalmi2026-04-23