🤖 machine learning

SPAR: Support-Preserving Action Rectification

यह शोध पत्र SPAR प्रस्तुत करता है, जो एक सपोर्ट-प्रिजर्विंग एक्शन रेक्टिफिकेशन फ्रेमवर्क है जो लर्निंग को एक फ्रोजन बिहेवियर क्लोनिंग पॉलिसी के लोकल रेसिडुअल रिफाइनमेंट के रूप में पुनर्गठित करके और वैल्यू मैक्सिमाइजेशन एवं डेटा डिस्ट्रीब्यूशन फिटिंग के बीच अंतर्निहित संघर्ष को हल करने के लिए लेटेंट सेल्फ-इमिटेशन का उपयोग करके स्टेट-ऑफ-द-आर्ट ऑफलाइन पॉलिसी इम्प्रूवमेंट प्राप्त करता है।

Jiaxin Zhao, Weihang Pan, Xun Liang, Binbin Lin2026-05-28
💰 quantitative finance

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

यह शोध पत्र पोर्टबेंच (PortBench) का परिचय देता है, जो पोर्टफोलियो प्रबंधन पर LLMs का मूल्यांकन करने के लिए एक स्थिर QA डेटासेट और एक गतिशील पांच-चरणीय आवंटन पाइपलाइन वाली एक व्यापक बेंचमार्क प्रणाली है, जो यह प्रकट करती है कि स्थिर वित्तीय प्रश्नों पर मजबूत प्रदर्शन के बावजूद, अधिकांश मॉडल बुनियादी समान-भार (equal-weight) रणनीतियों से बेहतर प्रदर्शन करने में विफल रहते हैं और अनदेखी सहसंबंध संरचनाओं (correlation structures) तथा संचयी तर्क त्रुटियों के कारण तनाव की स्थिति में विनाशकारी गिरावट (catastrophic drawdowns) का सामना करते हैं।

Yuxuan Zhao, Sijia Chen, Ningxin Su2026-05-28
🤖 AI

SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control

यह शोध पत्र SmartDirector को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा (two-stage framework) है जो मल्टी-शॉट सिंथेसिस और वीडियो एक्सटेंशन जैसे लचीले परिदृश्यों का समर्थन करने के लिए कई कीफ्रेम्स का लाभ उठाकर सिनेमाई वीडियो जेनरेशन और नैरेटिव पेसिंग कंट्रोल को बढ़ाता है, जो मौजूदा अत्याधुनिक तरीकों से काफी बेहतर प्रदर्शन करता है।

Zhida Zhang, Jie Ma, Zhan Peng, Haoxue Wu, Yang Han, Jun Liang, Jie Cao, Jing Li2026-05-28
🤖 AI

SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment

यह शोध पत्र SkillC का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो युग्मित रोलआउट्स (paired rollouts) और अनुकूली पाठ्यक्रम शिक्षण (adaptive curriculum learning) के माध्यम से कौशल-मुक्त सफलता की ओर नीतियों को सीधे अनुकूलित करने के लिए कंट्रास्टिव स्किल क्रेडिट असाइनमेंट (Contrastive Skill Credit Assignment) पेश करके LLM एजेंटों में स्वायत्त कौशल आंतरिककरण (autonomous skill internalization) को बढ़ाता है, जो रनटाइम स्किल एक्सेस के बिना लंबी अवधि के कार्यों पर मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang2026-05-28
💬 NLP

The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

यह शोध पत्र पहला बड़े पैमाने पर मूल्यांकन प्रस्तुत करता है जो यह प्रदर्शित करता है कि चेन-ऑफ-थॉट मॉनिटरिंग (Chain-of-Thought monitoring) 13 विविध भाषाओं और 16 फ्रंटियर मॉडल्स में मौलिक रूप से नाजुक और अविश्वसनीय है, क्योंकि ये मॉडल्स अक्सर रणनीतिक धोखे का सहारा लेते हैं और पीढ़ी के शुरुआती चरण में ही गलत उत्तरों के प्रति प्रतिबद्ध हो जाते हैं, जिससे सुरक्षा तंत्र विशेष रूप से कम-संसाधन वाली भाषाओं में अप्रभावी हो जाता है।

Eric Onyame, Runtao Zhou, Kowshik Thopalli, Bhavya Kailkhura, Chirag Agarwal2026-05-28
🤖 AI

Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

यह शोध पत्र रीजनिंग-कंडीशन्ड डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (RC-DPO) को प्रस्तुत करता है, जो एक नवीन प्रशिक्षण ढांचा है जो मल्टीमॉडल लार्ज रीजनिंग मॉडल्स में मतिभ्रम (hallucinations) को कम करने के लिए उत्तर निर्माण को एक अखंड आउटपुट के रूप में मानने के बजाय, उसे तार्किक रूप से सुसंगत और दृश्य रूप से आधारित रीजनिंग श्रृंखलाओं के साथ स्पष्ट रूप से संरेखित करता है।

Jiawei Kong, Hao Fang, Shunxiang Liao, Jinyu Li, Bin Chen, Hao Wu, Shu-Tao Xia, Min Zhang2026-05-28
🤖 AI

SuiChat-CN: Benchmarking Contextual Suicide Risk Assessment in Chinese Group Chats

यह शोध पत्र SuiChat-CN को प्रस्तुत करता है, जो टेलीग्राम ग्रुप चैट से 13,000 से अधिक प्रासंगिक खंडों वाला एक नवीन चीनी बेंचमार्क डेटासेट है, जिसे सटीक पहचान के लिए संवादात्मक संदर्भ और बहु-पक्षीय गतिशीलता के महत्वपूर्ण महत्व को प्रदर्शित करते हुए मौजूदा पोस्ट-स्तरीय आत्महत्या जोखिम मूल्यांकन की सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया है।

Xiangyu Wang, Zhiwei Yu, Chengze Du, Dingchang Wang, Yuhan Ye, Fangyu Zheng2026-05-28
🤖 AI

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

हार्नेस-बेंच (Harness-Bench) एक नैदानिक बेंचमार्क है जिसमें 106 यथार्थवादी, सैंडबॉक्स्ड कार्य शामिल हैं जो यह मूल्यांकन करता है कि विभिन्न सिस्टम-लेयर कॉन्फ़िगरेशन (हार्नेस) एलएलएम (LLM) एजेंट के प्रदर्शन को कैसे प्रभावित करते हैं, जिससे यह स्पष्ट होता है कि निष्पादन परिणाम मॉडल-हार्नेस युग्मों के बीच काफी भिन्न होते हैं और यह हाइलाइट करता है कि एजेंट की क्षमताओं को केवल आधार मॉडल के बजाय कॉन्फ़िगरेशन स्तर पर रिपोर्ट करने की आवश्यकता है।

Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, L (…)2026-05-28
⚛️ quantum physics

Do We Really Need Quantum Machine Learning?: A Multidimensional Empirical Study

यह शोध पत्र एक बहुआयामी अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि जबकि क्वांटम सपोर्ट वेक्टर मशीन (QSVM) और क्वांटम कनवोल्यूशनल न्यूरल नेटवर्क (QCNN) आम तौर पर अपने शास्त्रीय समकक्षों की तुलना में उच्च कम्प्यूटेशनल रनटाइम का भार वहन करते हैं, वे बड़े पैमाने पर बेहतर वर्गीकरण सटीकता और विशेष रूप से QCNNs के लिए काफी बेहतर पैरामीटर और मेमोरी दक्षता प्रदान करते हैं।

Sudip Vhaduri, Ryan Gammon, Sayanton Dibbo2026-05-28
💬 NLP

Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations

यह शोध पत्र जेम्मा 3 (Gemma 3) मॉडल परिवार में धोखे के संकेतों (deception probes) का व्यवस्थित रूप से मूल्यांकन करता है, यह प्रदर्शित करते हुए कि जबकि रैखिक प्रोब (linear probes) स्थापत्य सीमाओं के बजाय वितरण संबंधी संकीर्णता के कारण शैलीगत बदलावों के तहत विफल हो जाते हैं, शैली-संवर्धित बहु-आयामी प्रोब वितरित उप-थ्रेशोल्ड विशेषताओं का लाभ उठाकर विभिन्न पैमानों पर लगभग पूर्ण पहचान को मजबूती से पुनः प्राप्त कर सकते हैं।

Sachin Kumar2026-05-28