💬 NLP

Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard

यह शोध पत्र बेसलाइन मॉडलों के विरुद्ध तुलनात्मक व्यवहार संबंधी विश्लेषण के माध्यम से उनके मालिकाना संरेखण (proprietary alignment) को परिमाणित करके ब्लैक-बॉक्स लार्ज लैंग्वेज मॉडल्स के ऑडिटिंग के लिए एक सांख्यिकीय ढांचे का प्रस्ताव करता है, जिससे ग्राउंड-ट्रुथ मानकों पर निर्भर किए बिना प्रदाता-विशिष्ट नीतियों का पता लगाना सक्षम होता है।

Alireza Arbabi, Florian Kerschbaum2026-06-09
🤖 machine learning

STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control

STAR-KV एक एडेप्टिव लो-रैंक KV कैश कंप्रेशन फ्रेमवर्क है जो सटीकता में गिरावट को न्यूनतम करते हुए 75% तक कैश कंप्रेशन और 3.1x एंड-टू-एंड थ्रूपुट स्पीडअप प्राप्त करने के लिए डिफरेंशिएबल सॉफ्ट थ्रेशोल्डिंग, हाइब्रिड डिकंपोजिशन और लो-रैंक-अवेयर क्वांटाइजेशन का उपयोग करता है।

Priyansh Bhatnagar, Ashkan Moradifirouzabadi, Se-Hyun Yang, SeungJae Lee, Jungwook Choi, Mingu Kang2026-06-09
💻 computer science

Hiding in Plain Floats: Steganographic Carriers for Indirect Prompt and Content Injection

यह शोध पत्र प्रदर्शित करता है कि अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन हमले दुर्भावनापूर्ण पेलोड को संरचित फ्लोट मापदंडों (structured float parameters) के रूप में एन्कोड करके केवल टेक्स्ट-आधारित सुरक्षा प्रणालियों को दरकिनार कर सकते हैं, जिससे वर्तमान एलएलएम (LLM) सुरक्षा पाइपलाइनों में एक महत्वपूर्ण विफलता सीमा उजागर होती है जो पूरी तरह से टेक्स्ट निरीक्षण पर निर्भर करती हैं।

Mudit Sinha, Sanika Chavan2026-06-09
🤖 AI

Trajectory-Refined Distillation

यह शोध पत्र ट्रैजेक्टरी-रिफाइंड डिस्टिलेशन (TRD) प्रस्तुत करता है, जो एक नवीन ऑन-पॉलिसी डिस्टिलेशन विधि है जो शिक्षक के मार्गदर्शन में छात्र रोलआउट्स पर ट्रैजेक्टरी-स्तरीय सुधार लागू करके संरचनात्मक "प्रिफिक्स फेल्योर" समस्या को कम करती है, जिससे विभिन्न बेंचमार्क और मॉडल स्केल्स में रीजनिंग सटीकता और कवरेज में सुधार होता है।

Li Jiang, Haoran Xu, Yichuan Ding, Amy Zhang2026-06-09
🤖 AI

AI Code Sandboxes: A Comparative Security Study. Part 1 of 2 -- Engine-Level Properties (Attack Surface, Leakage, Stackability, CVE History, Patch Cadence, Fuzzing)

यह अध्ययन छह इंजन-स्तरीय मेट्रिक्स—अटैक सरफेस, लीकेज, स्टैकेबिलिटी, सीवीई (CVE) हिस्ट्री, पैच कैडेंस और फज़िंग—के माध्यम से पांच एआई सैंडबॉक्स उत्पादों की सुरक्षा का तुलनात्मक विश्लेषण करता है, ताकि विशिष्ट आर्किटेक्चरल क्लास सेग्रेशन, डाउनस्ट्रीम पैच लेटेंसी में महत्वपूर्ण परिवर्तनशीलता, और माइक्रोवीएम (microVM) आर्किटेक्चर के साथ निरंतर सार्वजनिक फज़िंग को संयोजित करने वाले उत्पादों की उल्लेखनीय अनुपस्थिति को प्रकट किया जा सके।

George Andronchik, Pavel Lokhmakov2026-06-09
🤖 machine learning

Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

यह शोध पत्र स्पैरो (Sparrow) को प्रस्तुत करता है, जो एक गतिशील स्पर्सिटी शेड्यूलिंग विधि है जो स्पार्स-टू-डेंस एक्टर-पॉलिसी मिसमैच के लिए एक महत्वपूर्ण थ्रेशोल्ड बनाए रखकर कुशल लॉन्ग-कॉन्टेक्स्ट सुदृढीकरण लर्निंग (reinforcement learning) को स्थिर करती है, जिससे विभिन्न Qwen3 मॉडलों और डोमेन में महत्वपूर्ण रोलआउट स्पीडअप प्राप्त होता है और साथ ही एक हल्के डिस्टिलस्पार्स (DistillSparse) डिस्टिलेशन तकनीक के माध्यम से प्रदर्शन को और बेहतर बनाया जाता है।

Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun, Zhuoming Chen, Souvik Kundu, Saket Dingliwal, Sai Muralidhar Jayanthi, Aram (…)2026-06-09
🤖 AI

GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

यह शोध पत्र GIFT का प्रस्ताव करता है, जो एक LLM-निर्देशित ढांचा है जो वित्तीय ज्ञान और जोखिम सिद्धांतों के आधार पर अनुकूलित स्टेट फीचर्स (state features) और रिवॉर्ड शेपिंग (reward shaping) नियमों को डिजाइन करने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करके PPO-आधारित वित्तीय सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करता है, जिससे परीक्षण के दौरान LLM हस्तक्षेप की आवश्यकता के बिना आउट-ऑफ-सैंपल जोखिम-समायोजित पोर्टफोलियो प्रदर्शन में सुधार होता है।

Yanyan Wu, Boyi Zhang, Yanlin Liu, Xinyu Fang, Jining Luan, Meiqi Zhang, Jiacheng Liu, Hao Zeng, Dexu Yu, Chang Liu, Han (…)2026-06-09
💬 NLP

Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models

यह शोध पत्र 38 भाषाओं में क्रॉस-लिंगुअल चापलूसी (cross-lingual sycophancy) का पहला बड़े पैमाने पर मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि सुरक्षा-संरेखित मॉडल (safety-aligned models) टोकेनाइज़र फर्टिलिटी (tokenizer fertility) जैसे संरचनात्मक कारकों के कारण कम-संसाधन और ज़ीरो-शॉट भाषा सेटिंग्स में राय-पुष्टि करने वाली गलत सूचनाओं की काफी उच्च दर प्रदर्शित करते हैं, जिससे गैर-अंग्रेजी भाषी संरेखण विफलताओं (alignment failures) के प्रति असुरक्षित हो जाते हैं।

Arya Shah, Himanshu Beniwal, Mayank Singh, Chaklam Silpasuwanchai2026-06-09
🤖 machine learning

The Confidence Trap: Calibration Attacks for Graph Neural Networks

यह शोधपत्र यूनिफाइड ग्राफ कैलिब्रेशन अटैक (UGCA) फ्रेमवर्क प्रस्तुत करता है, जो ग्राफ न्यूरल नेटवर्क के कैलिब्रेशन को प्रभावी ढंग से कम करने और उनकी वर्गीकरण सटीकता को बनाए रखने के लिए एडवरसैरियल ग्राफ हमलों में तकनीकी चुनौतियों पर विजय प्राप्त करता है, जिससे यह प्रकट होता है कि अत्यधिक सटीक मॉडल इस प्रकार के संरचनात्मक व्यवधानों के प्रति विशेष रूप से संवेदनशील होते हैं।

Cuong Dang, Jiahao Zhang, Hieu Ta Quang, Dung Le, Lu Cheng, Suhang Wang2026-06-09