🤖 machine learning

Fuzzing Large Language Models to Elicit Hidden Behaviours

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में छिपे हुए "स्लीपर एजेंट" व्यवहारों को उजागर करने के लिए वेट्स (weights) या एक्टिवेशन्स (activations) में शोर (noise) इंजेक्ट करके एक व्यवस्थित फज़िंग दृष्टिकोण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह टेम्परेचर सैंपलिंग से बेहतर प्रदर्शन करता है और एक सस्ते प्रॉक्सी कार्य के माध्यम से हाइपरपैरामीटर चयन, यूनिफॉर्म स्वीप की तुलना में इलिकिटेशन रेट (elicitation rates) में महत्वपूर्ण सुधार करता है।

Mohammed Abu Baker, Lakshmi Babu-Saheer2026-06-30
💻 computer science

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

यह शोध पत्र मल्टी-एजेंट एलएलएम (LLM) विचार-विमर्श के लिए एक बजटेड 'एक्ट-ऑर-डिफर' (act-or-defer) ढांचे को प्रस्तुत करता है जो k-निकटतम पड़ोसी (k-nearest-neighbor) विश्वास अनुमानों के माध्यम से स्थानीय विश्वसनीयता सीमाओं की गणना करके गतिशील रूप से यह निर्णय लेता है कि कार्य करना है या मानव समीक्षा के लिए भेजना है, जिससे विविध कार्यों में उपयोगकर्ता द्वारा निर्दिष्ट गलत-कार्य बजट के भीतर ऑडिट योग्य सुरक्षा सुनिश्चित की जा सके।

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo2026-06-30
💻 computer science

Diversity is the Strength of the AI Crowd

यह शोध पत्र यह प्रदर्शित करता है कि एआई पूर्वानुमान एंसेम्बल्स (AI forecasting ensembles) की सटीकता को अधिकतम करने के लिए समान उच्च-प्रदर्शन वाले एलएलएम (LLMs) से कई पूर्वानुमानों को केवल एकत्रित करने के बजाय, पूरक त्रुटियों वाले विविध मॉडलों को रणनीतिक रूप से संयोजित करना आवश्यक है।

Matthew Aitchison, Scott Jeen, Toby Shevlane, Ben Day2026-06-30
⚛️ quantum physics

A Machine-Verified Proof of a Quantum-Optimization Conjecture

यह शोध पत्र क्लॉड फेबल 5 भाषा मॉडल और लीन 4 प्रूफ़ असिस्टेंट के बीच एक सहयोगात्मक फीडबैक लूप के माध्यम से प्राप्त 'रिंग ऑफ डिसएग्रीज़' पर QAOA एप्रोक्सिमेशन रेशियो के संबंध में दशक पुराने फारी-गोल्डस्टोन-गुटमैन अनुमान के मशीन-सत्यापित समाधान की रिपोर्ट करता है, जिसने प्रमाण को निर्मित करने के लिए एक छिपे हुए डायनेमिकल सिमिट्री (गतिशील समरूपता) का अनावरण किया।

Uri Kol, Maor Ben-Shahar, Kfir Sulimany, Dirk Englund2026-06-30
💻 computer science

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

यह शोध पत्र प्रदर्शित करता है कि OpenVLA के आंतरिक फीडफॉरवर्ड एक्टिवेशन्स (feedforward activations) पर प्रशिक्षित हल्के प्रोब्स (lightweight probes), बिना मूल पॉलिसी में किसी बदलाव के, ऑक्लूजन (occlusion) जैसे विजुअल डिस्ट्रीब्यूशन शिफ्ट के कारण होने वाली निकट-अवधि की कार्य विफलताओं की प्रभावी ढंग से भविष्यवाणी कर सकते हैं और उच्च सटीकता प्राप्त कर सकते हैं।

Dipesh Tharu Mahato, Rachel Ren2026-06-30✓ Author reviewed
💬 NLP

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

GUICrafter एक वीकली-सुपरवाइज्ड (weakly-supervised) GUI एजेंट है जो विशाल अनएनोटेटेड स्क्रीनशॉट्स और उच्च गुणवत्ता वाले डेटा की एक छोटी मात्रा पर प्रशिक्षित होने के लिए एक टू-स्टेज करिकुलम लर्निंग फ्रेमवर्क का लाभ उठाता है, जिससे यह UI-TARS जैसे उन्नत सिस्टम द्वारा उपयोग किए गए एनोटेटेड डेटा के केवल 0.1% की आवश्यकता के साथ बेहतर प्रदर्शन और क्रॉस-डिवाइस सामान्यीकरण प्राप्त करता है।

Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu2026-06-30
💬 NLP

ARMOR: Adaptive Retriever Optimization for Low-Resource Telecom Question Answering

यह शोध पत्र ARMOR को पेश करता है, जो एक एडेप्टिव रिट्रीवर ऑप्टिमाइज़ेशन विधि है जो कम-संसाधन वाले टेलीकॉम प्रश्न उत्तर (question answering) को बेहतर बनाने के लिए जनरेटर के बजाय क्वेरी एनकोडर को ट्यून करने हेतु लेटेंट-डॉक्यूमेंट RAG लाइकलीहुड और InfoNCE कॉन्ट्रास्टिव ऑब्जेक्टिव्स को रेगुलराइजेशन के साथ संयुक्त रूप से उपयोग करता है।

Heshan Fernando, Quan Xiao, Yan Xin, Tianyi Chen2026-06-30
💬 NLP

SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

यह शोध पत्र SEVA को प्रस्तुत करता है, जो एक स्व-विकसित सत्यापन एजेंट (self-evolving verification agent) है, जो एक संरचित, बहु-घटक आउटपुट सिस्टम को प्रशिक्षित करने के लिए प्रोसेस रिवॉर्ड मैकेनिज्म का उपयोग करके अपारदर्शी बाइनरी फैक्ट-चेकिंग की सीमाओं को दूर करता है, जिससे निरंतर स्व-सुधार संभव होता है जो ऑडिट योग्य तर्क और GPT-4o-mini के तुलनीय प्रदर्शन वाले बेंचमार्क-विशेषज्ञ मॉडल प्रदान करता है।

Aojie Yuan, Yi Nian, Haiyue Zhang, Zijian Su, Yue Zhao2026-06-30
💬 NLP

Diagnosing and Mitigating Context Rot in Long-horizon Search

यह शोध पत्र लंबी अवधि के डीप सर्च कार्यों में "कॉन्टेक्स्ट रॉट" (context rot) की घटना की जांच करता है, जहाँ विस्तृत संदर्भ बड़े भाषा मॉडलों को समय से पहले हार मानने या अनिश्चित उत्तर देने के लिए प्रेरित करता है, और व्यवस्थित कॉन्टेक्स्ट प्रबंधन तथा रॉट-अवेयर रिजेक्शन सैंपलिंग के माध्यम से प्रभावी शमन रणनीतियों का प्रस्ताव करता है।

Shijie Xia, Yikun Wang, Zhen Huang, Pengfei Liu2026-06-30
🤖 machine learning

Redefining Maritime Anomaly Detection via Equation-Grounded Synthetic Anomalies

यह शोध पत्र एक समीकरण-आधारित वर्गीकरण और एक एकीकृत पाइपलाइन का प्रस्ताव करके समुद्री विसंगति डेटा की कमी को संबोधित करता है, जो टाइमस्टैम्प-स्तर के लेबल वाले विसंगतियों को संश्लेषित करता है, जिससे एकल-पोत और अंतर-पोत परिदृश्यों में विविध पहचान मॉडलों के व्यवस्थित मूल्यांकन को सक्षम बनाया जा सके।

Youngseok Hwang, Sungho Bae, Dohun Lee, Jaeeun Seo, Jeehong Kim, Wonhee Lee, Hyunwoo Park2026-06-30