💬 NLP

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

यह शोध पत्र एक लर्निंग-ड्रिवन ऑटोमेटेड रेड-टीमिंग फ्रेमवर्क पेश करता है जो सुरक्षा मूल्यांकन को एक कंस्ट्रेंड एडवर्सरियल सर्च समस्या के रूप में मानता है, जो इवोल्यूशनरी प्रॉम्प्ट जनरेशन और हायरार्किकल डिटेक्शन को जोड़कर मैनुअल एक्सपर्ट विधियों की तुलना में काफी उच्च भेद्यता खोज दर और व्यापक श्रेणी कवरेज प्रदर्शित करता है।

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei (…)2026-07-14
💬 NLP

BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation

यह शोध पत्र BizFinBench.v2 को प्रस्तुत करता है, जो चीनी और अमेरिकी इक्विटी बाजारों के वास्तविक उपयोगकर्ता डेटा का उपयोग करने वाला एक व्यापक द्विभाषी बेंचमार्क है, जो यह प्रकट करता है कि DeepSeek-R1 के उत्कृष्ट प्रदर्शन के बावजूद, वर्तमान अत्याधुनिक मॉडल अभी भी व्यावहारिक व्यावसायिक आवश्यकताओं पर खरे नहीं उतरते हैं।

Xin Guo, Rongjunchen Zhang, Guilong Lu, Xuntao Guo, Shuai Jia, Zhi Yang, Liwen Zhang2026-07-14
💬 NLP

BiasLab: A Multilingual Dual-Framing Framework for LLM Bias Measurement, Applied to Workplace and HR Contexts

यह शोध पत्र BiasLab को प्रस्तुत करता है, जो एक बहुभाषी डुअल-फ्रेमिंग फ्रेमवर्क है जो कार्यस्थल और एचआर के छह विषयों में दस बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में दिशात्मक पूर्वाग्रहों को व्यवस्थित रूप से परिमाणित करता है, जो निरंतर असममित प्राथमिकता पैटर्न को प्रकट करता है जिन्हें एकल-फ्रेम मूल्यांकन का पता लगाने में विफल रहता है।

William Guey, Wei Zhang, Pei-Luen Patrick Rau, Pierrick Bougault, Vitor D. de Moura, Bertan Ucar, Jose O. Gomes2026-07-14
💬 NLP

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

यह शोध पत्र एंग्राम (Engram) को प्रस्तुत करता है, जो एक स्केलेबल कंडीशनल मेमोरी मॉड्यूल है जो NN-ग्राम एम्बेडिंग्स को O(1)O(1) लुकअप के लिए आधुनिक बनाता है, जो एक यू-आकार (U-shaped) की स्पर्सिटी एलोकेशन लॉ को प्रकट करता है जो न्यूरल कंप्यूटेशन और स्टैटिक मेमोरी के बीच के ट्रेड-ऑफ को अनुकूलित करता है ताकि लार्ज लैंग्वेज मॉडल्स में रीजनिंग, कोड और लॉन्ग-कॉन्टेक्स्ट रिट्रीवल प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।

Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi (…)2026-07-14
💬 NLP

Loci Similes: A Benchmark for Extracting Intertextualities in Latin Literature

यह शोध पत्र "लोकी सिमिलीज़" (Loci Similes) प्रस्तुत करता है, जो लेट एँटिक (Late Antique) और शास्त्रीय लैटिन लेखकों के बीच 545 विशेषज्ञ-सत्यापित समानताओं का एक बेंचमार्क डेटासेट है, जिसे इंटरटेक्स्टुअलिटी (intertextualities) का पता लगाने के लिए बड़े भाषा मॉडलों के प्रशिक्षण और मूल्यांकन हेतु मानकीकृत संसाधनों की कमी को दूर करने के लिए डिज़ाइन किया गया है।

Julian Schelb, Michael Wittweiler, Marie Revellio, Barbara Feichtinger, Andreas Spitz2026-07-14
💬 NLP

RegCheck: A tool for structured comparisons between study registrations and papers

यह शोध पत्र RegCheck को प्रस्तुत करता है, जो एक मॉड्यूलर, LLM-सहायता प्राप्त टूल है जिसे वैज्ञानिक पारदर्शिता और पुनरुत्पादकता (reproducibility) को बढ़ाने के लिए मानवीय विशेषज्ञता के साथ AI दक्षता को जोड़कर अध्ययन पंजीकरणों की प्रकाशित शोध पत्रों के साथ संरचित तुलना को सुगम बनाने के लिए डिज़ाइन किया गया है।

Jamie Cummins, Beth Clarke, Ian Hussey, Malte Elson2026-07-14
💬 NLP

FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale

यह शोध पत्र FineInstructions को प्रस्तुत करता है, जो प्री-ट्रेनिंग कॉर्पोरा से अरबों सिंथेटिक निर्देश-प्रतिक्रिया युग्मों को उत्पन्न करने की एक विधि है जो बड़े भाषा मॉडल (LLMs) को केवल एक इंस्ट्रक्शन-ट्यूनिंग उद्देश्य पर शून्य से प्री-ट्रेन करने में सक्षम बनाती है, जिसके परिणामस्वरूप मानक प्री-ट्रेनिंग दृष्टिकोणों की तुलना में फ्री-फॉर्म रिस्पॉन्स बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Ajay Patel, Colin Raffel, Chris Callison-Burch2026-07-14
💬 NLP

Learning from Lost Provenance: Multiple Instance Learning for Cancer Registry Tumor Group Classification

यह शोध पत्र एक अटेंशन-आधारित मल्टीपल इंस्टेंस लर्निंग (ABMIL) फ्रेमवर्क प्रस्तावित करता है जो खोए हुए रिपोर्ट-स्तरीय प्रोवेनेंस (provenance) को पुनः प्राप्त करने के लिए नियमित, रोगी-स्तरीय कैंसर रजिस्ट्री लेबल का लाभ उठाता है, जिससे एक उच्च-गुणवत्ता वाला प्रशिक्षण डेटासेट प्राप्त होता है जो डीप लर्निंग मॉडल्स को अतिरिक्त मैनुअल एनोटेशन की आवश्यकता के बिना उच्च-प्रदर्शन ट्यूमर समूह वर्गीकरण प्राप्त करने में सक्षम बनाता है।

Leonard Ruocco, Jonathan Simkin, Lovedeep Gondara, Gregory Arbour, Raymond Ng2026-07-14
💬 NLP

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

यह शोधपत्र SaMer का प्रस्ताव करता है, जो एक ऑब्जेक्ट-अवेयर टोकन मर्जिंग फ्रेमवर्क है जो प्रशिक्षण के दौरान महत्वपूर्ण ऑब्जेक्ट-लेवल साक्ष्य को संरक्षित करके विजन-लैंग्वेज रिट्रीवल के लिए इमेज-साइड टोकन को महत्वपूर्ण रूप से संकुचित करता है, जिससे बिना ग्राउंड-ट्रुथ बाउंडिंग बॉक्स की आवश्यकता के इन्फरेंस के दौरान स्टोरेज लागत कम होती है और रिट्रीवल प्रदर्शन में सुधार होता है।

Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang2026-07-14
🤖 AI

Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking

यह शोध पत्र फॉर्मेट सेंसिटिविटी इंडेक्स (FSI) और पारसेबिलिटी सेंसिटिविटी इंडेक्स (PSI) को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि प्रॉम्प्ट रैपर्स में मामूली स्वरूपण अंतर महत्वपूर्ण, मॉडल-निर्भर स्कोर भिन्नता और अनुपालन विफलता का कारण बनते हैं, और यह तर्क दिया जाता है कि इस भिन्नता को ध्यान में रखे बिना बेंचमार्किंग सटीकता सांख्यिकीय रूप से नाजुक है।

Deep Pankajbhai Mehta2026-07-14