💻 computer science

Mythos and the Unverified Cage: Z3-Based Pre-Deployment Verification for Frontier-Model Sandbox Infrastructure

यह शोध पत्र COBALT को प्रस्तुत करता है, जो एक Z3-आधारित औपचारिक सत्यापन इंजन (formal verification engine) है जो काल्पनिक 2026 मिथोस (Mythos) घटना जैसे सैंडबॉक्स एस्केप्स को रोकने के लिए C/C++ इंफ्रास्ट्रक्चर में अंकगणितीय कमजोरियों का पता लगाता है, और साथ ही एक चार-स्तरीय रोकथाम ढांचे (four-layer containment framework) का प्रस्ताव देता है ताकि यह सुनिश्चित किया जा सके कि फ्रंटियर-मॉडल सुरक्षा केवल व्यवहार संबंधी सुरक्षा उपायों के बजाय सत्यापित इंफ्रास्ट्रक्चर पर निर्भर करती है।

Dominik Blain2026-04-23
🤖 machine learning

CHASM: Unveiling Covert Advertisements on Chinese Social Media

यह शोध पत्र CHASM को प्रस्तुत करता है, जो चीनी सोशल मीडिया प्लेटफॉर्म रेडनोट (Rednote) से लगभग 5,000 वास्तविक दुनिया के गुप्त विज्ञापनों का एक नया डेटासेट है, ताकि यह प्रदर्शित किया जा सके कि वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स इन भ्रामक पोस्टों का पता लगाने में संघर्ष करते हैं और इस उभरते खतरे के विरुद्ध बेहतर फाइन-ट्यूनिंग और रक्षा तंत्र की आवश्यकता पर प्रकाश डाला जा सके।

Jingyi Zheng, Tianyi Hu, Yule Liu, Zhen Sun, Zongmin Zhang, Zifan Peng, Wenhan Dong, Xinlei He2026-04-23
💻 computer science

Early-Stage Product Line Validation Using LLMs: A Study on Semi-Formal Blueprint Analysis

यह अध्ययन प्रदर्शित करता है कि रीजनिंग-ऑप्टिमाइज़्ड लार्ज लैंग्वेज मॉडल्स, सॉफ्टवेयर प्रोडक्ट लाइन के प्रारंभिक सत्यापन के लिए अर्ध-औपचारिक टेक्स्टुअल ब्लूप्रिंट्स का विश्लेषण करने में, पारंपरिक सॉल्वर-आधारित दृष्टिकोणों के एक हल्के विकल्प के रूप में (88–89%) लगभग सॉल्वर सटीकता प्राप्त कर सकते हैं, बावजूद इसके कि व्यवस्थित पार्सिंग और रीजनिंग त्रुटियों की पहचान की गई है।

Viet-Man Le, Thi Ngoc Trang Tran, Sebastian Lubos, Alexander Felfernig, Damian Garber2026-04-23
💻 computer science

Evian: Towards Explainable Visual Instruction-tuning Data Auditing

यह शोध पत्र EVIAN को प्रस्तुत करता है, जो एक स्वचालित ढांचा है जो इमेज-टेक्स्ट निरंतरता, तार्किक सुसंगतता और तथ्यात्मक सटीकता के माध्यम से विजुअल इंस्ट्रक्शन-ट्यूनिंग डेटा का ऑडिट करने के लिए "डीकंपोजिशन-देन-इवैल्यूएशन" प्रतिमान (पैराडाइम) का उपयोग करता है, यह प्रदर्शित करते हुए कि इसके क्यूरेटेड उच्च-गुणवत्ता वाले उपसमूह पर फाइन-ट्यूनिंग करने से काफी बड़े, अनक्यूरेटेड डेटासेट्स पर प्रशिक्षण की तुलना में बेहतर मॉडल प्रदर्शन प्राप्त होता है।

Zimu Jia, Mingjie Xu, Andrew Estornell, Jiaheng Wei2026-04-23
💬 NLP

Enhancing Research Idea Generation through Combinatorial Innovation and Multi-Agent Iterative Search Strategies

यह शोध पत्र दोहरावपूर्ण और उथले LLM-जनित अनुसंधान विचारों की सीमाओं को दूर करने के लिए कॉम्बिनेटोरियल इनोवेशन थ्योरी से प्रेरित एक मल्टी-एजेंट इटरेटिव प्लानिंग सर्च स्ट्रैटेजी प्रस्तावित करता है, जो NLP प्रयोगों के माध्यम से यह प्रदर्शित करता है कि यह फ्रेमवर्क विचार विविधता और नवीनता में महत्वपूर्ण सुधार करता है, तथा शीर्ष स्तरीय मशीन लर्निंग सम्मेलनों में स्वीकृत शोध पत्रों के तुल्य गुणवत्ता प्राप्त करता है।

Shuai Chen, Chengzhi Zhang2026-04-23
💬 NLP

Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection

यह शोध पत्र प्रदर्शित करता है कि एम्बेडिंग स्पेस में क्रॉस-लिंगुअल निरंतरता का लाभ उठाना उच्च-संसाधन वाली भाषाओं को निम्न-संसाधन वाली भाषाओं के लिए गुणवत्ता फ़िल्टरिंग को सब्सिडी देने की अनुमति देता है, जिससे मोनोलिंगुअल बेसलाइन की तुलना में मल्टीलिंगुअल प्रीट्रेनिंग में बेहतर रैंक स्थिरता और सटीकता प्राप्त होती है, विशेष रूप से थर्ड क्वार्टाइल सैंपलिंग और रिटेंशन रेट ट्यूनिंग जैसी रणनीतियों के संयोजन के साथ।

Yassine Turki, Vinko Sabolčec, Bettina Messmer, Martin Jaggi2026-04-23
💬 NLP

Self-Guided Plan Extraction for Instruction-Following Tasks with Goal-Conditional Reinforcement Learning

यह शोधपत्र SuperIgor को प्रस्तुत करता है, जो एक स्व-निर्देशित ढांचा (self-guided framework) है जो लक्ष्य-सशर्त सुदृढीकरण शिक्षण (goal-conditional reinforcement learning) और पुनरावृत्ति सह-प्रशिक्षण (iterative co-training) का उपयोग करता है ताकि भाषा मॉडलों को निर्देश-अनुपालन कार्यों के लिए उच्च-स्तरीय योजनाओं को स्वायत्त रूप से उत्पन्न करने और परिष्कृत करने में सक्षम बनाया जा सके, जिससे मैनुअल एनोटेशन पर निर्भरता कम होती है और अनुपालन एवं सामान्यीकरण में सुधार होता है।

Zoya Volovikova, Nikita Sorokin, Dmitriy Lukashevskiy, Aleksandr Panov, Alexey Skrynnik2026-04-23
💻 computer science

Beyond ZOH: Advanced Discretization Strategies for Vision Mamba

यह शोध पत्र विज़न मम्बा (Vision Mamba) फ्रेमवर्क के भीतर छह विविक्तकरण योजनाओं (discretization schemes) का व्यवस्थित रूप से मूल्यांकन करता है और यह प्रदर्शित करता है कि जहाँ बहुपद अंतर्वेशन (polynomial interpolation) और उच्च-क्रम होल्ड (higher-order hold) जैसी उच्च-क्रम विधियाँ उच्चतम सटीकता प्रदान करती हैं, वहीं द्विरेखीय (टस्टिन) रूपांतरण (bilinear/Tustin transform) परिशुद्धता और दक्षता के बीच सबसे अनुकूल संतुलन प्रदान करता है, जो इसे मानक शून्य-क्रम होल्ड (zero-order hold) की तुलना में एक बेहतर डिफ़ॉल्ट विकल्प बनाता है।

Fady Ibrahim, Guangjun Liu, Guanghui Wang2026-04-23
💻 computer science

RSRCC: A Remote Sensing Regional Change Comprehension Benchmark Constructed via Retrieval-Augmented Best-of-N Ranking

यह शोध पत्र RSRCC प्रस्तुत करता है, जो 126k सूक्ष्म-स्तरीय परिवर्तन-विशिष्ट प्रश्नों वाला एक बड़े पैमाने का रिमोट सेंसिंग बेंचमार्क है, जो उच्च-गुणवत्ता वाले, स्थानीयकृत अर्थपूर्ण तर्क (localized semantic reasoning) को सुनिश्चित करने के लिए रिट्रीवल-ऑगमेंटेड बेस्ट-ऑफ-N रैंकिंग के साथ एक नवीन पदानुक्रमित अर्ध-पर्यवेक्षित क्यूरेशन पाइपलाइन का उपयोग करके मौजूदा डेटासेट की सीमाओं को संबोधित करता है।

Roie Kazoom, Yotam Gigi, George Leifman, Tomer Shekel, Genady Beryozkin2026-04-23
💰 quantitative finance

Large Language Models Outperform Humans in Fraud Detection and Resistance to Motivated Investor Pressure

सात बड़े भाषा मॉडलों की 1,201 मानव प्रतिभागियों के साथ तुलना करने वाला एक पूर्व-पंजीकृत अध्ययन यह प्रकट करता है कि एआई सिस्टम धोखाधड़ी का पता लगाने में मनुष्यों से काफी बेहतर प्रदर्शन करते हैं, जो प्रेरित निवेशक के दबाव में भी धोखाधड़ी वाले निवेशों के विरुद्ध निरंतर चेतावनियाँ बनाए रखते हैं, जबकि मानव सलाहकार अक्सर धोखाधड़ी का समर्थन करते हैं और दबाव पड़ने पर चेतावनियों को दबा देते हैं।

Nattavudh Powdthavee2026-04-23