🤖 machine learning

Physics-Guided Policy Optimization with Self-Distillation

यह शोध पत्र फिजिक्स-गाइडेड पॉलिसी ऑप्टिमाइज़ेशन (PGPO) का प्रस्ताव करता है, जो विस्कस-फ्लुइड डायनेमिक्स (viscous-fluid dynamics) से प्रेरित एक सेल्फ-डिस्टिलेशन विधि है जो स्टेप साइज़ को नियंत्रित करने के लिए म्यूचुअल इंफॉर्मेशन का उपयोग करती है, जिससे प्रशिक्षण स्थिर होता है और साइंस-QA डेटासेट पर मानक SDPO से बेहतर प्रदर्शन करता है।

Ke Wang, Yuning Wu, Haoran Liu, Chaoqun Jia, Devin Chen, Kai Wei2026-06-03
🤖 AI

Bridging Auxiliary Constraints to Resolve Instruction Following in Large Reasoning Models

यह शोधपत्र कंस्ट्रेंट रिलेशनशिप ग्राफ कम्प्लीशन (CRGC) प्रस्तुत करता है, जो एक नवीन ढांचा है जो निर्देशों के ज्ञान ग्राफ का निर्माण करके 'ब्रिज कंस्ट्रेंट्स' की पहचान और सृजन करता है ताकि प्रतिस्पर्धी आवश्यकताओं के बीच सामंजस्य बिठाया जा सके, जिससे तर्क क्षमताओं से समझौता किए बिना बाधा उल्लंघन (constraint violations) में 39% की कमी आती है और बड़े तर्क मॉडलों (Large Reasoning Models) में कंस्ट्रेंट एडहेरेंस समस्या का समाधान होता है।

Zhengyi Zhao, Shubo Zhang, Huimin Wang, Zezhong Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Yulan He, Kam-Fai Wong, Xia (…)2026-06-03
🤖 AI

TSQAgent: Rating Time Series Data Quality via Dedicated Agentic Reasoning

यह शोध पत्र TSQAgent को प्रस्तुत करता है, जो एक नवीन एजेंटिक रीजनिंग फ्रेमवर्क है जो प्रासंगिक आयामों की गतिशील रूप से पहचान करके और आधारित मात्रात्मक तुलना करके बड़े भाषा मॉडलों की टाइम सीरीज़ डेटा गुणवत्ता का आकलन करने की क्षमता को बढ़ाता है, जिससे डाउनस्ट्रीम डेटा चयन और मॉडल प्रदर्शन में सुधार होता है।

Shunyu Wu, Dan Li, Haozheng Ye, Weibin Feng, Jian Lou, Bo Zhang, Wenjie Feng, Chenjuan Guo, See-Kiong Ng2026-06-03
🤖 machine learning

AnchorMoE: Interpretable Time Series Classification via Anchor-Routed MoE

यह शोध पत्र AnchorMoE का प्रस्ताव करता है, जो एक मल्टीवेरिएट टाइम सीरीज़ क्लासिफिकेशन के लिए 'इंटरप्रिटेबल-बाय-कंस्ट्रक्शन' फ्रेमवर्क है, जो प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए ज्यामितीय ऑर्थोगोनैलिटी बाधाओं (geometric orthogonality constraints) और एक अनिश्चितता-जागरूक गेट (uncertainty-aware gate) के साथ 'मिक्सचर-ऑफ-एक्सपर्ट्स' आर्किटेक्चर का लाभ उठाता है, जबकि कच्चे सिग्नल सेगमेंट पर आधारित पारदर्शी, योगात्मक निर्णय लेने की प्रक्रिया सुनिश्चित करता है।

Tao Xie, Zexi Tan, Haoyi Xiao, Mengke Li, Yiqun Zhang, Yang Lu, Cuie Yang, Yiu-ming Cheung2026-06-03
🤖 AI

Gender-Dependent Diagnostic Substitution in LLM Medical Triage: Same Symptoms, Unequal Urgency

यह अध्ययन प्रकट करता है कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) चिकित्सा ट्राइएज में एक व्यवस्थित लैंगिक पूर्वाग्रह प्रदर्शित करते हैं, जिसमें वे पुरुषों की तुलना में गंभीर न्यूरोलॉजिकल लक्षणों वाली युवा महिलाओं के आपातकालीन रेफरल को असमान रूप से कम प्राथमिकता देते हैं, एक ऐसा अंतर जो मॉडलों की लिंग-आधारित नैदानिक पूर्वग्रहों (जेंडरेड डायग्नोस्टिक प्रायर्स) पर निर्भरता से प्रेरित है जो तत्काल स्थितियों को कम गंभीर, महामारी विज्ञान संबंधी रूप से जुड़ी निदानों से प्रतिस्थापित कर देते हैं।

Qi Han Wong2026-06-03
🤖 machine learning

The Shape of Addition: Geometric Structures of Arithmetic in Large Language Models

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स की अंकगणितीय त्रुटियां 'आइसो-रॉ-सम ट्रैजेक्टरी' (Iso-Raw-Sum Trajectory) नामक एक निरंतर लेटेंट स्पेस के भीतर "ज्यामितीय फिसलन" (geometric slippages) से उत्पन्न होती हैं, जो यह समझाने के लिए एक 'नॉयजी क्वांटाइजेशन मॉडल' (Noisy Quantization Model) का प्रस्ताव देता है कि कैसे न्यूरल शोर कैरी प्रोपेगेशन (carry propagation) को बाधित करता है और इन विफलताओं का पता लगाने तथा उन्हें सुधारने के लिए एक ज्यामितीय ढांचा प्रदान करता है।

Liuyuan Wen, Xun Zhu, Lihao Huang, Wenbin Li, Yang Gao2026-06-03
🤖 machine learning

Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs

यह शोध पत्र इनडायरेक्ट हार्म ऑप्टिमाइज़ेशन (IHO) को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स, एडेप्टिव और कुशल जेलब्रेक अटैक विधि है जो विभिन्न सुरक्षा प्रणालियों के विरुद्ध लार्ज लैंग्वेज मॉडल्स की एडवरसैरियल रोबस्टनेस का आकलन करने के लिए एक मानकीकृत मूल्यांकन बेसलाइन के रूप में कार्य करता है।

Vincent Limbach, Jonas Dornbusch, David Lüdke, Stephan Günnemann, Leo Schwinn2026-06-03
💬 NLP

Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability

यह शोध पत्र यह तर्क देता है कि फाइन-ट्यून किए गए लार्ज लैंग्वेज मॉडल्स की सुरक्षा का मूल्यांकन करने के लिए आकलन को मनमाने सेटिंग्स के बजाय विशिष्ट क्षमता लक्ष्यों में निहित करना आवश्यक है, क्योंकि यह दृष्टिकोण विसंगत मॉडल आउटपुट, ऐसे मामलों के लिए स्वचालित सुरक्षा निर्णयों की अविश्वसनीयता, और बेंचमार्क एवं मूल्यांकनकर्ता के चयन के आधार पर सुरक्षा निष्कर्षों की महत्वपूर्ण परिवर्तनशीलता जैसे महत्वपूर्ण मुद्दों को प्रकट करता है।

Krishnapriya Vishnubhotla, Hillary Dawkins, Isar Nejadgholi, Svetlana Kiritchenko2026-06-03
💬 NLP

CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks

CoEval एक ओपन-सोर्स फ्रेमवर्क है जो बिना लेबल किए गए डेटा की आवश्यकता के या सार्वजनिक बेंचमार्क पर भरोसा किए बिना, कस्टम कार्यों के लिए भाषा मॉडलों को विश्वसनीय रूप से रैंक करने हेतु कंटैमिनेशन-मुक्त (contamination-free), एट्रिब्यूट-कंट्रोल्ड बेंचमार्क उत्पन्न करता है और जज मॉडल्स के एक विविध एन्सेम्बल का उपयोग करता है।

Alexander Apartsin, Yehudit Aperstein2026-06-03
🤖 AI

Towards Non-Monotonic Entailment in Propositional Defeasible Standpoint Logic

यह शोधपत्र प्रोपोज़िशनल डिफ़ीज़ेबलल स्टैंडपॉइंट लॉजिक (PDSL) को सिचुएटेड स्टैंडपॉइंट कंडिशनल्स के साथ विस्तारित करने की एक विधि प्रस्तावित करता है ताकि पारंपरिक KLM-शैली के तर्क से नॉन-मोनोटोनिक रेशनल एंटेलमेंट संबंधों को ऊपर उठाया जा सके, जिससे प्रोपोज़िशनल कॉम्प्लेक्सिटी बाउंड्स को सुरक्षित रखते हुए रेशनल और लेक्सिकोग्राफिक क्लोजर जैसी इन्फरेंस विधियों का निष्ठापूर्ण अनुवाद सक्षम हो सके।

Nicholas Leisegang, Thomas Meyer, Ivan Varzniczak2026-06-03