🤖 machine learning

Quality Is Not a Safety Proxy Under Quantization

यह शोध पत्र यह प्रदर्शित करता है कि क्वांटाइज्ड लैंग्वेज मॉडल्स में गुणवत्ता मेट्रिक्स सुरक्षा के लिए एक अविश्वसनीय प्रॉक्सी हैं, क्योंकि गुणवत्ता स्थिर रह सकती है या सुधर सकती है जबकि सुरक्षा महत्वपूर्ण रूप से घट सकती है, जिससे केवल गुणवत्ता स्क्रीनिंग पर निर्भर रहने के बजाय प्रस्तावित रिफ्यूज़ल टेम्पलेट स्टेबिलिटी इंडेक्स (RTSI) जैसे प्रत्यक्ष सुरक्षा मूल्यांकनों की आवश्यकता होती है।

Sahil Kadadekar2026-06-10
🤖 machine learning

Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning

यह शोध पत्र Dropout-GRPO का प्रस्ताव करता है, जो एक ऐसी विधि है जो निरंतर लेटेंट-रीजनिंग (latent-reasoning) मॉडल्स में आवश्यक ट्राजेक्टरी वेरिएंस (trajectory variance) उत्पन्न करने के लिए स्ट्रक्चर्ड ड्रॉपआउट को पेश करती है, जिससे प्रभावी ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) सक्षम होता है और GSM8K पर बेहतर प्रदर्शन प्रदर्शित होता है।

Wooil Jung2026-06-10
🤖 machine learning

MMClima: A Framework for Multimodal Climate Science Data and Evaluation

यह शोध पत्र MMClima को प्रस्तुत करता है, जो एक बड़े पैमाने का, विशेषज्ञ-सत्यापित मल्टीमॉडल जलवायु विज्ञान ढांचा है जिसमें टेक्स्ट, वीडियो और चित्रों के माध्यम से 104,000 से अधिक प्रश्न-उत्तर युग्म शामिल हैं, जिसे विविध जलवायु डेटा मोडैलिटीज में एआई (AI) मॉडलों की तर्क करने की क्षमता को बेंचमार्क करने और सुधारने के लिए डिज़ाइन किया गया है।

Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad, Ufaq Khan, Muhammad Haris Khan2026-06-10
🤖 machine learning

Density Ridge Selective Prediction for LLM and VLM Hallucination Detection under Calibration Label Scarcity

यह शोध पत्र एक डेंसिटी रिज-आधारित चयनात्मक भविष्यवाणी पद्धति प्रस्तुत करता है जो LLM और VLM रिस्पॉन्स मैनिफोल्ड्स को छह-आयामी हिडन स्टेट स्पेस में ज्यामितीय कंकालों (geometric skeletons) के रूप में मॉडल करता है, जो गंभीर कैलिब्रेशन लेबल की कमी के बावजूद मौजूदा अनसुपरवाइज्ड और सुपरवाइज्ड बेसलाइन्स की तुलना में काफी बेहतर हैल्यूसिनेशन डिटेक्शन प्रदर्शन प्राप्त करता है।

Nina I. Shamsi2026-06-10
💬 NLP

A Continuous-Time Markov Chain Framework for Insertion Language Models

यह शोध पत्र इवेंशन लैंग्वेज मॉडल्स (Insertion Language Models) के लिए एक सिद्धांतपूर्ण डिफ्यूजन-शैली का डिनोइजिंग ऑब्जेक्टिव प्राप्त करने हेतु एक निरंतर-समय मार्कोव चेन फ्रेमवर्क स्थापित करता है, जो यह प्रदर्शित करता है कि पूर्व विधियाँ इस दृष्टिकोण के विशेष मामले हैं और साथ ही प्रतिस्पर्धी प्रदर्शन और उन्नत सैंपलिंग लचीलापन भी प्राप्त करती हैं।

Dhruvesh Patel, Benjamin Rozonoyer, Soumitra Das, Tahira Naseem, Tim G. J. Rudner, Andrew McCallum2026-06-10
🤖 AI

An Improved Generative Adversarial Network for Micro-Resistivity Imaging Logging Restoration

यह शोध पत्र एक उन्नत जेनेरेटिव एडवरसैरियल नेटवर्क प्रस्तुत करता है जो आंशिक रूप से लुप्त माइक्रो-रेसिस्टिविटी इमेजिंग लॉगिंग छवियों को प्रभावी ढंग से पुनर्स्थापित करने के लिए FCN, डेप्थ-सेपरेबल रेसिडुअल ब्लॉक्स, इनसेप्शन मॉड्यूल्स और ड्यूल ग्लोबल-लोकल डिस्क्रिमिनेटर्स को एकीकृत करता है, जिससे संरचनात्मक सुसंगतता और बनावट विवरणों में महत्वपूर्ण वृद्धि होती है।

Ahmed Faizul Haque, S. M. Riaz Rahman Antu, Saif Ahmed, Asadullah Hil Galib, Souvik Pramanik, Mohammad Ashrafuzzaman Kha (…)2026-06-10
🤖 machine learning

Alignment Defends LLMs from Property Inference Attacks

यह शोध पत्र मूल प्रशिक्षण डेटा या मॉडल पुनप्रशिक्षण की आवश्यकता के बिना, मॉडल आउटपुट वितरण को नया आकार देने के लिए पोस्ट-ट्रेनिंग अलाइनमेंट तकनीकों, विशेष रूप से डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) और ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) का लाभ उठाकर, लार्ज लैंग्वेज मॉडल्स में प्रॉपर्टी इन्फरेंस हमलों के विरुद्ध एक नवीन रक्षा प्रस्तावित करता है।

Pengrun Huang, Chhavi Yadav, Ruihan Wu, Kamalika Chaudhuri2026-06-10
🤖 machine learning

Fast Exact Nearest-Neighbor Learning for High-Frequency Financial Time Series

यह शोध पत्र प्रदर्शित करता है कि एक Mojo-आधारित सटीक SIMD k-d ट्री का कार्यान्वयन उच्च-आवृत्ति वाले वित्तीय समय श्रृंखला (high-frequency financial time series) के लिए गति और स्केलेबिलिटी में मौजूदा scikit-learn विधियों से काफी बेहतर प्रदर्शन करता है, जो सटीकता से समझौता किए बिना वास्तविक समय में निकटतम-पड़ोसी शिक्षण (nearest-neighbor learning) और बेहतर डेरिवेटिव प्राइसिंग मॉडल को सक्षम बनाता है।

Henry Han, Diane Li2026-06-10
🤖 machine learning

SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration

यह शोध पत्र SHAPO को प्रस्तुत करता है, जो सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक सुरक्षित अन्वेषण विधि है जो कम-अन्वेषित क्षेत्रों में रूढ़िवादी व्यवहार की ओर सीखने के लिए शार्पनेस-अवेयर पॉलिसी अपडेट्स को लागू करके एपिस्टेमिक अनिश्चितता (epistemic uncertainty) का लाभ उठाती है, जिससे निरंतर-नियंत्रण कार्यों (continuous-control tasks) में सुरक्षा और कार्य प्रदर्शन दोनों में सुधार होता है।

Kaustubh Mani, Yann Pequignot, Vincent Mai, Liam Paull2026-06-10
🤖 machine learning

What Demonstration Curation Metrics Do to Your Policy

यह शोध पत्र प्रकट करता है कि दोषों का पता लगाने (defect detection) के लिए अनुकूलित प्रदर्शन-क्यूरेशन मेट्रिक्स अक्सर एपिसोड की लंबाई जैसे भ्रमित करने वाले कारकों के कारण डाउनस्ट्रीम पॉलिसी प्रदर्शन को सुधारने में विफल रहते हैं, और यह तर्क देता है कि क्यूरेशन विधियों का मूल्यांकन उनकी दोष-फ्लैगिंग सटीकता के बजाय परिणामी पॉलिसी की गुणवत्ता द्वारा किया जाना चाहिए।

Aarav Bedi2026-06-10