💬 NLP

Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment

यह शोध पत्र प्रदर्शित करता है कि बाइट-पेयर एनकोडिंग (BPE) टोकनाइजेशन महत्वपूर्ण शब्दों को उप-शब्द टुकड़ों में विभाजित करके एलएलएम (LLM) सुरक्षा संरेखण (safety alignment) में शोषण योग्य अंतराल पैदा करता है, जो एक ऐसी भेद्यता है जो कई मॉडल परिवारों में इनकार तंत्र (refusal mechanisms) को दरकिनार कर देती है और जिसे वैश्विक प्रदर्शन पतन (global performance collapse) का कारण बने बिना वर्तमान संरेखण डेटासेट या मानक प्रशिक्षण विन्यासों द्वारा मजबूती से ठीक नहीं किया जा सकता है।

Tung-Ling Li, Hongliang Liu, Yuhao Wu2026-07-03
💬 NLP

Office Comprehension Benchmark

यह शोध पत्र ऑफिस कॉम्प्रिहेंशन बेंच (OCB) को प्रस्तुत करता है, जो वर्ड, एक्सेल और पावरपॉइंट बोध के मूल्यांकन के लिए डिज़ाइन किया गया पहला सार्वजनिक बेंचमार्क है, जो दो ट्रैक्स—फाइल फिडेलिटी Q&A और डोमेन Q&A—के माध्यम से यह प्रकट करता है कि शीर्ष स्तर के मॉडल भी जटिल दस्तावेज़ तर्क करने में संघर्ष करते हैं, और डोमेन कार्यों पर केवल 59.3% सटीकता प्राप्त करते हैं।

Firoz Shaik, Mateus Picanço Lima Gomes, Tanvir Aumi, Jingci Wang, Milos Milunovic, Filip Basara, Ivana Jovanovic, Vishwa (…)2026-07-03
💻 computer science

Collaborative Disagreement Resolution for Scalable Oversight

यह शोध पत्र एक "असहमति समाधान" (Disagreement Resolution) ढांचे का प्रस्ताव करता है जो एआई (AI) निगरानी को शत्रुतापूर्ण बहस से हटाकर सहयोगात्मक सत्य-खोज की ओर ले जाता है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण मानक बहस की तुलना में गैर-विशेषज्ञ मॉडलों की सत्य को पहचानने की क्षमता में महत्वपूर्ण रूप से सुधार करता है।

Yuyang Jiang, Chacha Chen, Teng Wu, Liwen Sun, Han Liu, Shi Feng, Chenhao Tan2026-07-03
💻 computer science

AI Assistance for Human Review of Default Judgments

यह शोध पत्र "डिफ़ॉल्ट असिस्टेंट" प्रस्तुत करता है, जो एक ऐसा एआई टूल है जो ग्राउंडेड साइटेशन्स (आधारित उद्धरणों) के साथ लार्ज लैंग्वेज मॉडल्स का उपयोग करता है ताकि न्यायालय समीक्षकों को डिफ़ॉल्ट निर्णयों में त्रुटियों की पहचान करने में मदद मिल सके, और एक नियंत्रित अध्ययन के माध्यम से यह प्रदर्शित करता है कि यह बिना सहायता वाले मानवीय प्रयास की तुलना में कानूनी समीक्षाओं की सटीकता और गति दोनों में महत्वपूर्ण रूप से सुधार करता है।

Theodora Worledge, Othman Bensouda Koraichi, Daniel Bernal, Aviv Caspi, Tatsunori Hashimoto, Carlos Guestrin, David Free (…)2026-07-03
💻 computer science

Artificial Intelligence-Enabled Accounting Information Systems and Fraud Detection in Nigeria's Financial Services Sector: The Moderating Role of Natural Language Processing

यह अध्ययन प्रदर्शित करता है कि आर्टिफिशियल इंटेलिजेंस-सक्षम लेखा सूचना प्रणाली नाइजीरिया के वित्तीय सेवा क्षेत्र में धोखाधड़ी का पता लगाने और ऑडिटिंग प्रभावशीलता को महत्वपूर्ण रूप से बढ़ाती है, जिसमें नेचुरल लैंग्वेज प्रोसेसिंग एक सकारात्मक मॉडरेटर के रूप में कार्य करती है जो सिमेंटिक व्याख्या और विश्लेषणात्मक स्पष्टीकरण में सुधार करती है।

Timothy Oluwapelumi Adeyemi, Abigail Omotola Ojogbede2026-07-03
💻 computer science

The Rising Unsustainability of AI Graphics Cards Production

यह अध्ययन 2013 से 2025 तक एआई ग्राफिक्स कार्ड उत्पादन के बढ़ते पर्यावरणीय नुकसान का अनुमान लगाता है, जो यह प्रकट करता है कि परिचालन दक्षता में सुधार के बावजूद, विनिर्माण से होने वाली बढ़ती संसाधन रिक्ति और कार्बन उत्सर्जन संरचनात्मक नीतिगत परिवर्तनों, टिकाऊ हार्डवेयर डिजाइन और निरंतर विकास से दूर एक सांस्कृतिक बदलाव की आवश्यकता को अनिवार्य बनाते हैं।

Clément Morand, Aurélie Névéol, Anne-Laure Ligozat2026-07-03
💻 computer science

Benchmarking Federated Learning and Knowledge Distillation for Point Cloud Classification

यह शोध पत्र 3D पॉइंट क्लाउड वर्गीकरण के लिए 130 फेडरेटेड लर्निंग और नॉलेज डिस्टिलेशन संयोजनों का एक व्यापक बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि नॉलेज डिस्टिलेशन मॉडलों को प्रभावी ढंग से संकुचित करता है, मानक मूल्यांकन विधियाँ निजी प्रॉक्सी लेबल लीक करके प्रदर्शन को भ्रामक रूप से बढ़ा सकती हैं, जिससे फेडरेटेड टीचर की गुणवत्ता को सटीक रूप से दर्शाने के लिए लेबल-मुक्त डिस्टिलेशन मेट्रिक्स की आवश्यकता होती है।

Aizierjiang Aiersilan2026-07-03
🤖 machine learning

Domain Knowledge Based Temporal-Spatial Graph Convolution Network for ECG Recognition

यह शोध पत्र एक डोमेन ज्ञान-आधारित टेम्पोरल-स्पेशियल ग्राफ कनवल्शन नेटवर्क प्रस्तावित करता है जो इंट्रा- और इंटर-साइकिल संबंधों को प्रभावी ढंग से मॉडल करने के लिए एक डबल-स्ट्रीम निर्देशित ग्राफ में प्रमुख ईसीजी लैंडमार्क्स (PRQST) को शामिल करता है, जिससे मल्टी-क्लास ईसीजी रिकग्निशन, विशेष रूप से दुर्लभ श्रेणियों के लिए, अत्याधुनिक प्रदर्शन प्राप्त होता है।

Wenting Ma, Zhipeng Zhang, Xiaohang Yuan, Ningwei Xie, Yuxin Xie, Xiaolin Wang, Meng Guo, Xingang Chai, Zhenjie Yao2026-07-03
🤖 machine learning

Scaling Laws for Grid-Based Approximate Nearest Neighbor Search in High Dimensions

यह शोध पत्र मल्टीप्रोब ग्रिड-आधारित ANN खोज का एक व्यवस्थित विश्लेषण प्रस्तुत करता है, जो ग्राफ, ट्री और विभाजन विधियों की तुलना में उच्च आयामों में इसकी बेहतर स्केलेबिलिटी और कम इंडेक्सिंग लागत को प्रकट करता है, जिससे पुनर्गठन-प्रधान (rebuild-heavy) अनुप्रयोगों और कुशल ट्रांसफार्मर आर्किटेक्चर को अनुकूलित करने के लिए इसकी क्षमता का सुझाव मिलता है।

Matthew J Liu, Wei Hang Zheng, Vidhan Purohit, Siqi Xie, Chieh-En Li, Jerry Li, Noah Flynn2026-07-03
💻 computer science

CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection

यह शोध पत्र CPG-PAD का प्रस्ताव करता है, जो एक नवीन ढांचा (framework) है जो प्रॉम्प्ट लर्निंग में XAI-व्युत्पन्न हीटमैप्स के माध्यम से मॉडल-स्तरीय अवधारणा मार्गदर्शन को एकीकृत करके क्रॉस-डोमेन प्रेजेंटेशन अटैक डिटेक्शन को बढ़ाता है, जिससे विविध डेटासेट्स में हस्तांतरणीय हमले के संकेतों को कैप्चर करते हुए और डोमेन-विशिष्ट पूर्वाग्रहों को दबाते हुए अत्याधुनिक सामान्यीकरण (generalization) प्राप्त किया जाता है।

Haoyuan Zhang, Xiangyu Zhu, Li Gao, Ajian Liu, Siran Peng, Zhen Lei2026-07-03