🤖 AI

PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data

यह शोध पत्र PuzzleClone को प्रस्तुत करता है, जो एक DSL-संचालित फ्रेमवर्क है जो बड़े भाषा मॉडल (LLM) की तर्क क्षमता को बढ़ाने के लिए 83,000 से अधिक विविध और सत्यापन योग्य लॉजिक पहेलियों को संश्लेषित करता है, और पोस्ट-ट्रेनिंग के बाद कई गणितीय और तार्किक बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।

Kai Xiong, Yanwei Huang, Rongjunchen Zhang, Kun Chen, Haipang Wu, Yingcai Wu2026-05-29
🤖 AI

GRPO is Secretly a Process Reward Model

यह शोध पत्र सैद्धांतिक रूप से सिद्ध करता है कि आउटकम रिवॉर्ड मॉडल के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO), एक प्रोसेस रिवॉर्ड मॉडल के समान है, असंतुलित स्टेप्स (imbalanced steps) को संभालने में इसकी एक खामी की पहचान करता है, और एक सरल संशोधन (λ\lambda-GRPO) प्रस्तावित करता है जो स्पष्ट प्रोसेस रिवॉर्ड मॉडल्स की आवश्यकता के बिना, रीजनिंग प्रदर्शन और प्रशिक्षण दक्षता में महत्वपूर्ण सुधार करता है।

Michael Sullivan, Alexander Koller2026-05-29
🤖 AI

Estimating the Empowerment of Language Model Agents

यह शोध पत्र EELMA को प्रस्तुत करता है, जो एक सूचना-सैद्धांतिक ढांचा (information-theoretic framework) है जो बहु-चरण टेक्स्ट इंटरैक्शन के माध्यम से लैंग्वेज मॉडल एजेंट सशक्तिकरण (empowerment) का अनुमान लगाता है, और यह प्रदर्शित करता है कि यह लक्ष्य-अज्ञेय (goal-agnostic) मीट्रिक विविध वातावरणों में सामान्य क्षमताओं के लिए महत्वपूर्ण क्षणों की पहचान करने और कार्य प्रदर्शन के साथ प्रभावी ढंग से सह-संबंध स्थापित करने में सक्षम है।

Jinyeop Song, Jeff Gore, Max Kleiman-Weiner2026-05-29
🤖 AI

Benchmarking LLM-Assisted Blue Teaming via Standardized Threat Hunting

यह शोध पत्र CyberTeam को प्रस्तुत करता है, जो एक बेंचमार्क फ्रेमवर्क है जो ब्लू टीम थ्रेट हंटिंग को 30 कार्यों और 9 परिचालन मॉड्यूल के एक संरचित, मॉड्यूलर वर्कफ़्लो में मानकीकृत करता है ताकि LLMs का मार्गदर्शन किया जा सके, जो यह प्रदर्शित करता है कि यह दृष्टिकोण ओपन-एंडेड रीजनिंग रणनीतियों की तुलना में थ्रेट एनालिसिस प्रदर्शन में महत्वपूर्ण सुधार करता है।

Yuqiao Meng, Luoxi Tang, Feiyang Yu, Xi Li, Guanhua Yan, Ping Yang, Zhaohan Xi2026-05-29
🤖 AI

Uncovering Vulnerabilities of LLM-Assisted Cyber Threat Intelligence

यह शोध पत्र एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रकट करता है कि साइबर थ्रेट इंटेलिजेंस में एलएलएम (LLM) की प्राथमिक कमजोरियां जेनेरिक मॉडल दोषों के बजाय डोमेन की अंतर्निहित विषमता और अस्थिरता से उत्पन्न होती हैं, जो लक्षित सुरक्षा उपायों के माध्यम से तीन विशिष्ट संज्ञानात्मक विफलता मोड की पहचान करने और उन्हें कम करने के लिए एक मानव-इन-द-लूप फ्रेमवर्क पेश करता है।

Yuqiao Meng, Luoxi Tang, Feiyang Yu, Jinyuan Jia, Guanhua Yan, Ping Yang, Zhaohan Xi2026-05-29
🤖 AI

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

यह शोध पत्र SafeSearch प्रस्तुत करता है, जो एक स्वचालित रेड-टीमिंग फ्रेमवर्क है जो अविश्वसनीय खोज परिणामों के प्रति महत्वपूर्ण कमजोरियों को उजागर करके और यह प्रदर्शित करके कि सामान्य सुरक्षा उपाय सीमित सुरक्षा प्रदान करते हैं, LLM-आधारित खोज एजेंटों की सुरक्षा का व्यवस्थित रूप से मूल्यांकन करता है।

Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu2026-05-29
🤖 AI

Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting

यह शोध पत्र एक नवीन दृष्टिकोण प्रस्तावित करता है जो हानिकारक संदर्भों को लार्ज लैंग्वेज मॉडल के प्रदर्शन को ज़ीरो-शॉट बेसलाइन से नीचे गिराने से रोकने के लिए डिस्ट्रीब्यूशन-फ्री रिस्क कंट्रोल को डायनेमिक अर्ली-एग्जिटिंग के साथ जोड़ता है, और साथ ही सहायक इनपुट्स पर दक्षता और सटीकता में सुधार करता है।

Andrea Wynn, Metod Jazbec, Charith Peris, Rinat Khaziev, Anqi Liu, Daniel Khashabi, Eric Nalisnick2026-05-29
🔬 materials science

AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials

यह शोध पत्र AtomWorld को प्रस्तुत करता है, जो क्रिस्टलीय सामग्री संरचना संशोधनों पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने वाला एक बेंचमार्क है, जो यह प्रकट करता है कि जबकि Claude Opus 4.6 जैसे मॉडल बुनियादी कार्यों पर अच्छा प्रदर्शन करते हैं, उनकी सफलता जटिल स्थानिक तर्क (spatial reasoning) के साथ काफी कम हो जाती है, जो यह सुझाव देता है कि वे स्वायत्त एजेंटों के बजाय वैज्ञानिक सह-पायलट (scientific copilots) के रूप में अधिक उपयुक्त हैं।

Taoyuze Lv, Alexander Chen, Fengyu Xie, Chu Wu, Jeffrey Meng, Dongzhan Zhou, Yingheng Wang, Bram Hoex, Zhicheng Zhong, T (…)2026-05-29
🤖 machine learning

The Impact of Semantic Pairs on Self-Supervised Representation Learning

यह शोध पत्र एक नियंत्रित अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्व-पर्यवेक्षित प्रीट्रेनिंग (self-supervised pretraining) के लिए मैन्युअल रूप से क्यूरेट किए गए सिमेंटिक पॉजिटिव पेयर्स (एक ही क्लास के विभिन्न इंस्टेंस) का उपयोग करना, मानक ऑगमेंटेड पॉजिटिव पेयर्स की तुलना में निरंतर सामान्यीकरण (generalization) में सुधार करता है और व्यापक इनवेरियंस (invariances) को प्रेरित करता है, जिसमें SimCLR जैसी कंट्रास्टिव लर्निंग विधियों को सर्वाधिक लाभ मिलता है।

Mohammad Alkhalefi, Georgios Leontidis, Mingjun Zhong2026-05-29
🤖 AI

Obfuscation Rules for Detecting and Detoxifying Korean Toxicity

यह शोध पत्र KOTOX को प्रस्तुत करता है, जो पहला कोरियाई डेटासेट और ओपन ट्रांसफॉर्मेशन फ्रेमवर्क है जिसे भाषाई रूप से आधारित अस्पष्टता पैटर्न को वर्गीकृत करके और मानक टेक्स्ट पर प्रदर्शन से समझौता किए बिना छद्म अभिव्यक्तियों को संभालने के लिए मॉडलों को प्रशिक्षित करके, अस्पष्ट विषाक्त सामग्री का एक साथ पता लगाने और उसे विषमुक्त करने के लिए डिज़ाइन किया गया है।

Yejin Lee, Su-Hyeon Kim, Hyundong Jin, Dayoung Kim, Yeonsoo Kim, Yo-Sub Han2026-05-29