💬 NLP

Towards Robustness against Typographic Attack with Training-free Concept Localization

यह शोध पत्र एक नवीन, प्रशिक्षण-मुक्त मैकेनिस्टिक इंटरप्रिटेबिलिटी विधि प्रस्तावित करता है जो लेक्सिकल (शब्दकोशीय) जानकारी को एनकोड करने के लिए जिम्मेदार विशिष्ट विजन ट्रांसफॉर्मर सर्किटों की पहचान करती है और उनमें हस्तक्षेप करती है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के टाइपोग्राफिक हमलों के विरुद्ध CLIP-आधारित लार्ज विजन लैंग्वेज मॉडल्स की मजबूती को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang2026-07-03
💬 NLP

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

यह शोध पत्र प्रोग्राम-एज़-वेट्स (PAW) को प्रस्तुत करता है, जो एक ऐसा प्रतिमान (पैराडाइम) है जो प्राकृतिक-भाषा विनिर्देशों (नेचुरल-लैंग्वेज स्पेसिफिकेशन्स) को संक्षिप्त, स्थानीय रूप से निष्पादित होने वाले न्यूरल एडेप्टर में संकलित करता है, जिससे एक छोटे, फ्रोजन इंटरप्रेटर को बहुत बड़े फाउंडेशन मॉडल्स के प्रदर्शन के बराबर पहुँचने में सक्षम बनाया जाता है और साथ ही इन्फरेंस लागतों को नाटकीय रूप से कम करने और ऑफलाइन निष्पादन को सक्षम करने में मदद मिलती है।

Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng2026-07-03
💬 NLP

LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning

यह शोध पत्र LACUNA को प्रस्तुत करता है, जो LLM अनलर्निंग (unlearning) का मूल्यांकन करने के लिए ग्राउंड-ट्रुथ पैरामीटर-स्तरीय लोकलाइजेशन (localization) वाला पहला टेस्टबेड है, जो यह प्रकट करता है कि जबकि वर्तमान अत्याधुनिक विधियाँ आउटपुट स्तर पर अच्छा प्रदर्शन करती हैं, उनमें विशिष्ट ज्ञान-वहन करने वाले मापदंडों (parameters) को लक्षित करने में सटीकता का अभाव है और वे रिसर्फेसिंग हमलों (resurfacing attacks) के प्रति संवेदनशील बनी रहती हैं।

Matteo Boglioni, Thibault Rousset, Siva Reddy, Marius Mosbach, Verna Dankers2026-07-03
💻 computer science

GPTKB v1.5: A Massive Knowledge Base for Exploring Factual LLM Knowledge

यह शोध पत्र GPTKB v1.5 को प्रस्तुत करता है, जो GPT-4.1 के माध्यम से व्यापक-रिकर्सिव मटेरियलाइजेशन (massive-recursive materialization) द्वारा निर्मित एक लागत प्रभावी, 100-मिलियन-ट्रिपल ज्ञान आधार है, जो तथ्यात्मक LLM ज्ञान के व्यवस्थित अन्वेषण, संरचित क्वेरी और तुलनात्मक विश्लेषण को सक्षम बनाता है।

Yujia Hu, Tuan-Phong Nguyen, Shrestha Ghosh, Moritz Müller, Simon Razniewski2026-07-02
💬 NLP

Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review

यह टिप्पणी जुलाई 2025 की उस घटना का विश्लेषण करती है जहाँ 18 arXiv पांडुलिपियों में एआई-सहायता प्राप्त सहकर्मी समीक्षाओं (पीयर रिव्यू) को हेरफेर करने के लिए डिज़ाइन किए गए छिपे हुए प्रॉम्प्ट इंजेक्शन शामिल थे, जो इस प्रथा को अनुसंधान कदाचार के एक नए रूप के रूप में वर्णित करती है जो स्वचालित विद्वत्तापूर्ण प्रणालियों में महत्वपूर्ण कमजोरियों को उजागर करती है और समन्वित तकनीकी स्क्रीनिंग एवं सामंजस्यपूर्ण एआई नीतियों की तत्काल आवश्यकता को रेखांकित करती है।

Zhicheng Lin2026-07-02
💻 computer science

Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions

यह शोध पत्र एक डिज़ाइन स्पेस और प्रोटोटाइप सिस्टम प्रस्तुत करता है जो कई MLLM-जनित छवि विवरणों के बीच विविधताओं को उजागर करता है, और 15 दृष्टिबाधित और अल्पदृष्टि वाले प्रतिभागियों के साथ एक अध्ययन के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण अविश्वसनीय जानकारी का पता लगाने में महत्वपूर्ण सुधार करता है और एकल विवरणों की तुलना में अत्यधिक पसंदीदा है।

Meng Chen, Akhil Iyer, Amy Pavel2026-07-02
🤖 AI

Toward Cybersecurity-Expert Small Language Models

यह शोध पत्र साइबरपैल (CyberPal) 2.0 का परिचय देता है, जो साइबर सुरक्षा-विशेषज्ञ लघु भाषा मॉडलों (4B–20B पैरामीटर्स) का एक परिवार है, जिन्हें सेकनॉलेज (SecKnowledge) 2.0 पाइपलाइन के माध्यम से एक समृद्ध डेटासेट पर प्रशिक्षित किया गया है, जो काफी छोटे आकार के होने के बावजूद प्रमुख थ्रेट इन्वेस्टिगेशन और इंटेलिजेंस कार्यों पर GPT-4o और o1 जैसे फ्रंटियर मॉडलों को पीछे छोड़ देता है या उनके बराबर प्रदर्शन करता है।

Matan Levi, Daniel Ohayon, Ariel Blobstein, Ravid Sagi, Ian Molloy, Yair Allouche2026-07-02
💻 computer science

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

यह शोध पत्र OpenRM को प्रस्तुत करता है, जो एक टूल-ऑगमेंटेड रिवॉर्ड मॉडल है जिसे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन के माध्यम से प्रशिक्षित किया गया है ताकि लंबे-फॉर्म एजेंटिक कार्यों का सटीक मूल्यांकन करने के लिए बाहरी साक्ष्य का लाभ उठाया जा सके, जिससे डाउनस्ट्रीम LLM अलाइनमेंट और मूल्यांकन प्रदर्शन में महत्वपूर्ण सुधार होता है।

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren2026-07-02
💻 computer science

Graded strength of comparative illusions is explained by Bayesian inference

यह अध्ययन यह प्रदर्शित करके भाषा प्रसंस्करण के नॉइज़ी-चैनलल बेयज़ियन अनुमान सिद्धांत (noisy-channel Bayesian inference theory) को मान्य और विस्तारित करता है कि एक नवीन मॉडल, जो सांख्यिकीय भाषा मॉडलों को मानव व्यवहार संबंधी डेटा के साथ संश्लेषित करता है, तुलनात्मक भ्रमों (comparative illusions) की क्रमिक शक्ति की सफलतापूर्वक भविष्यवाणी करता है और सर्वनाम बनाम पूर्ण संज्ञा वाक्यांश वाले विषयों से संबंधित पूर्व में अनकहे प्रभावों की व्याख्या करता है।

Yuhan Zhang, Erxiao Wang, Cory Shain2026-07-02
💻 computer science

Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

यह शोधपत्र गेवल (Gavel) को प्रस्तुत करता है, जो एक व्यापक मूल्यांकन ढांचा है जिसमें संदर्भ-आधारित और संदर्भ-मुक्त एजेंट घटक शामिल हैं, जो लंबे-संदर्भ वाले कानूनी सारांशीकरण पर 12 सीमांत (frontier) एलएलएम (LLMs) का आकलन करने के लिए है, जो यह प्रकट करता है कि मॉडल भ्रमित होने के बजाय महत्वपूर्ण जानकारी छोड़ने की प्रवृत्ति रखते हैं, संदर्भ की लंबाई बढ़ने के साथ जटिल विवरणों के लिए संघर्ष करते हैं, और एजेंट-आधारित दृष्टिकोण प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए टोकन के उपयोग को काफी कम कर देता है।

Yao Dou, Benjamin Mamut, Wei Xu2026-07-02