💻 computer science

HealthCraft: A Reinforcement Learning Safety Environment for Emergency Medicine

HealthCraft एक नवीन सार्वजनिक सुदृढीकरण शिक्षण (reinforcement learning) वातावरण है जिसे आपातकालीन चिकित्सा में फ्रंटियर भाषा मॉडलों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो एक सख्त द्वि-स्तरीय सुरक्षा रूपरेखा के साथ यथार्थवादी नैदानिक वर्कफ़्लो का अनुकरण करता है, जिससे यह पता चलता है कि वर्तमान मॉडल बहु-चरणीय कार्यों पर लगभग पूर्ण प्रदर्शन पतन से जूझ रहे हैं और सुरक्षा मूल्यांकनों में बुनियादी ढांचे की निष्ठा के महत्वपूर्ण महत्व को रेखांकित करता है।

Brandon Dent2026-05-22
💻 computer science

From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment

यह शोध पत्र 'फ्रॉम पैरामीटर्स टू डेटा' (P2D) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो डेटा चयन और पैरामीटर-कुशल फाइन-ट्यूनिंग को एक साथ निर्देशित करने के लिए टास्क-सेंसिटिव अटेंशन हेड्स का लाभ उठाता है, जिससे पैरामीटर अपडेट को उच्च-एफिनिटी डेटा उपसमूहों के साथ सिंक्रोनाइज़ करके महत्वपूर्ण प्रदर्शन लाभ और 7.0x की गति वृद्धि प्राप्त होती है।

Hao Chen, Qi Zhang, Liyao Li, Zhanming Shen, Wentao Ye, Lirong Gao, Ningtao Wang, Xing Fu, Xiaoyu Shen, Junbo Zhao2026-05-22✓ Author reviewed
💻 computer science

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

यह शोध पत्र फ्लैट-पैक बेंच (Flat-Pack Bench) का परिचय देता है, जो फर्नीचर असेंबली कार्यों के माध्यम से लार्ज विजन-लैंग्वेज मॉडल्स की सूक्ष्म स्थानिक-कालिक तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल टेम्पोरल ऑर्डरिंग (क्रमबद्धता), स्टेट लोकलाइजेशन (अवस्था स्थानीयकरण), पार्ट मेटिंग (पुर्जों के मिलान) और ट्रैकिंग में काफी संघर्ष करते हैं।

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath H (…)2026-05-22
💬 NLP

EntmaxKV: Support-Aware Decoding for Entmax Attention

EntmaxKV एक सपोर्ट-अवेयर स्पार्स डिकोडिंग फ्रेमवर्क है जो इन्फरेंस से पहले KV कैश पेजों को चुनिंदा रूप से लोड करने के लिए α\alpha-entmax अटेंशन की सटीक स्पर्सिटी का लाभ उठाता है, जिससे मेमोरी ट्रैफिक काफी कम हो जाता है और फुल-कैश बेसलाइन्स के समान सटीकता बनाए रखते हुए लॉन्ग-कॉन्टेक्स्ट जनरेशन में पर्याप्त स्पीडअप प्राप्त होता है।

Gonçalo Duarte, Miguel Couceiro, Marcos V. Treviso2026-05-22
💬 NLP

Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction

यह शोध पत्र तर्क देता है कि एआई टेक्स्ट डिटेक्टर एक अलग एआई-बनाम-मानव सीमा सीखने के बजाय मुख्य रूप से कच्चे एनकोडर्स (raw encoders) में अंतर्निहित एक पूर्व-प्रशिक्षित विशिष्टता अक्ष (pretrained typicality axis) को बढ़ाते हैं, जो एक ऐसा तंत्र है जो गैर-नेटिव लेखन पर उनकी विफलता, सरल हस्तक्षेपों के प्रति उनकी संवेदनशीलता, और इस तथ्य की व्याख्या करता है कि न्यूनतम प्रोब्स (minimal probes) पूर्ण फाइन-ट्यूनिंग प्रदर्शन के बराबर हो सकते हैं।

Alexander Smirnov2026-05-22
💬 NLP

Value-Gradient Hypothesis of RL for LLMs

यह शोध पत्र LLM पोस्ट-ट्रेनिंग में PPO और GRPO जैसे क्रिटिक-मुक्त सुदृढीकरण शिक्षण (reinforcement learning) विधियों की प्रभावकारिता को समझाने के लिए एक वैल्यू-ग्रेडिएंट परिकल्पना प्रस्तावित करता है, जो यह प्रदर्शित करता है कि एक्टर अपडेट्स ऑटोडिफरेंशिएशन के माध्यम से वैल्यू ग्रेडिएंट्स को अनुमानित करते हैं और एक मानदंड स्थापित करता है कि कब वैल्यू सिग्नल और रिवॉर्ड हेडरूम के आधार पर RL सबसे अधिक लाभ प्रदान करता है।

Arip Asadulaev, Daniil Ognev, Karim Salta, Martin Takac2026-05-22
💬 NLP

X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation

यह शोध पत्र X-Token का प्रस्ताव करता है, जो एक प्रोजेक्शन-गाइडेड क्रॉस-टोकनाइज़र नॉलेज डिस्टिलेशन फ्रेमवर्क है जो लॉजिट-आधारित डिस्टिलेशन में वोकैबुलरी असंगति और टोकन-मैचिंग सीमाओं को दूर करने के लिए स्पार्स प्रोजेक्शन मैट्रिसेस का उपयोग करता है, जिससे छात्र मॉडल विषम वोकैबुलरी वाले शिक्षकों से प्रभावी ढंग से "डार्क नॉलेज" सीख पाते हैं और अत्याधुनिक प्रदर्शन प्राप्त करते हैं।

Sharath Turuvekere Sreenivas, Adithyakrishna Venkatesh Hanasoge, Mingyu Yang, Ali Taghibakhshi, Saurav Muralidharan, Ash (…)2026-05-22
💬 NLP

Probabilistic Attribution For Large Language Models

यह शोध पत्र एक मॉडल-अज्ञेय (model-agnostic) संभाव्य एट्रिब्यूशन फ्रेमवर्क प्रस्तुत करता है जो टोकन महत्व और एंट्रॉपी को मापने के लिए LLM टोकन संभावनाओं पर बेयस नियम (Bayes' rule) का लाभ उठाता है, जिससे व्याख्यात्मकता में वृद्धि होती है और विभिन्न प्रॉम्प्ट्स के माध्यम से मॉडल की स्थिरता और व्यवहार में अंतर्दृष्टि प्राप्त होती है।

Shilpika Shilpika, Carlo Graziani, Bethany Lusch, Venkatram Vishwanath, Michael E. Papka2026-05-22
💬 NLP

BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model

यह शोध पत्र BEiTScore को प्रस्तुत करता है, जो एक संदर्भ-मुक्त (reference-free) इमेज कैप्शनिंग मूल्यांकन मीट्रिक है जो संवेदनशीलता और संरचनात्मक सामान्यीकरण (compositional generalization) में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एडवरसेरियल LLM-संवर्धित डेटा के साथ प्रशिक्षित एक हल्के क्रॉस-एनकोडर मॉडल का लाभ उठाता है और साथ ही गणनात्मक दक्षता बनाए रखता है।

Gonçalo Gomes, Bruno Martins, Chrysoula Zerva2026-05-22
💬 NLP

Reflective Prompt Tuning through Language Model Function-Calling

यह शोध पत्र रिफ्लेक्टिव प्रॉम्प्ट ट्यूनिंग (RPT) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो पूरे डेटासेट में व्यवस्थित विफलता मोड (failure modes) का पुनरावृत्ति के माध्यम से निदान करने और संचित अंतर्दृष्टि का उपयोग करके प्रॉम्प्ट को परिष्कृत करने के लिए LLM फंक्शन कॉलिंग का लाभ उठाता है ताकि मानव प्रॉम्प्ट इंजीनियरों का अनुकरण किया जा सके, जिससे जटिल तर्क कार्यों और आत्मविश्वास अंशांकन (confidence calibration) पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka2026-05-22