💬 NLP

When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels

यह शोध पत्र ग्राउंड-ट्रुथ बेंचमार्क की अनुपस्थिति में नियंत्रित कंट्रास्ट और स्थिरता मेट्रिक्स पर आधारित एक इंस्ट्रुमेंटल-वैलिडिटी चेन स्थापित करके तुलनात्मक एलएलएम (LLM) सुरक्षा स्कोर को मान्य करने के लिए एक ढांचे का परिचय देता है, जो 'सिंपल ऑडिट' (SimpleAudit) टूल के माध्यम से यह प्रदर्शित करता है कि सुरक्षा रैंकिंग संदर्भ-निर्भर होती है और उन्हें एक एकल संकुचित स्कोर के बजाय उनकी विशिष्ट ऑडिट स्थितियों के साथ रिपोर्ट किया जाना चाहिए।

Sushant Gautam, Finn Schwall, Annika Willoch Olstad, Fernando Vallecillos Ruiz, Birk Torpmann-Hagen, Sunniva Maria Stord (…)2026-05-08
💬 NLP

Verifier-Backed Hard Problem Generation for Mathematical Reasoning

यह शोध पत्र VHG को प्रस्तुत करता है, जो एक सत्यापनकर्ता-समर्थित ढांचा है जो वैध, चुनौतीपूर्ण और नवीन गणितीय समस्याओं को उत्पन्न करने के लिए सेटर (setter), सॉल्वर (solver) और एक स्वतंत्र सत्यापनकर्ता (independent verifier) को शामिल करने वाले तीन-पक्षीय सेल्फ-प्ले तंत्र का उपयोग करता है, जो उन मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है जो अमान्यता या रिवॉर्ड हैकिंग (reward hacking) से ग्रस्त हैं।

Yuhang Lai, Jiazhan Feng, Yee Whye Teh, Ning Miao2026-05-08
💬 NLP

EMO: Pretraining Mixture of Experts for Emergent Modularity

EMO एक नवीन मिक्स्चर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) आर्किटेक्चर पेश करता है जो उभरती हुई, अर्थपूर्ण रूप से विशिष्ट विशेषज्ञ मॉड्यूलैरिटी को सक्षम करने के लिए प्रीट्रेनिंग के दौरान दस्तावेज़ सीमाओं का लाभ उठाता है, जिससे मानक मोनोलिथिक या पारंपरिक MoE मॉडलों की तुलना में न्यूनतम प्रदर्शन गिरावट के साथ चयनात्मक विशेषज्ञ परिनियोजन संभव हो पाता है।

Ryan Wang, Akshita Bhagia, Sewon Min2026-05-08
💬 NLP

Do Sentence Transformers Learn Quasi-Geospatial Concepts from General Text?

यह अध्ययन दर्शाता है कि सामान्य प्रश्न-उत्तर डेटा पर फाइन-ट्यून किए गए सेंटेंस-ट्रांसफॉर्मर मॉडल रूट प्रकार और कठिनाई स्तर जैसे अर्ध-भू-स्थानिक (quasi-geospatial) अवधारणाओं को समझने के लिए ज़ीरो-शॉट क्षमताओं से युक्त होते हैं, जो हाइकिंग ट्रेल अनुशंसा प्रणालियों के लिए उनकी संभावित उपयोगिता को इंगित करता है।

Ilya Ilyankou, Aldo Lipani, Stefano Cavazzi, Xiaowei Gao, James Haworth2026-05-07
💬 NLP

CC-GPX: Extracting High-Quality Annotated Geospatial Data from Common Crawl

यह शोध पत्र CC-GPX प्रस्तुत करता है, जो एक कुशल पाइपलाइन है जो आउटडोर गतिविधि पैटर्न, प्राकृतिक भाषा प्रसंस्करण और प्रक्षेपवक्र (ट्रैजेक्टरी) जनरेशन में अनुसंधान का समर्थन करने के लिए कॉमन क्रॉल GPX फाइलों से मल्टीलाइनस्ट्रिंग वेक्टर डेटा के साथ युग्मित 1,416 मानव-लिखित विवरणों का एक मल्टीमॉडल डेटासेट निकालता है।

Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth2026-05-07
🤖 AI

Quantifying Geospatial in the Common Crawl Corpus

यह कार्य कॉमन क्रॉल कॉर्पस में भू-स्थानिक (geospatial) जानकारी की व्यापकता को मापने के लिए जेमिनी 1.5 का लाभ उठाता है और यह अनुमान लगाता है कि 18.7% वेब दस्तावेज़ों में ऐसा डेटा मौजूद है, जिसमें अंग्रेजी और गैर-अंग्रेजी भाषाओं के बीच केवल न्यूनतम भिन्नता है, जिससे बड़े भाषा मॉडलों (large language models) में भू-स्थानिक पूर्वाग्रहों की जांच करने के लिए एक आधार स्थापित होता है।

Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth2026-05-07
💬 NLP

Beyond Public Access in LLM Pre-Training Data

ओ'रेली मीडिया की 34 कॉपीराइट वाली पुस्तकों के कानूनी रूप से प्राप्त डेटासेट का उपयोग करते हुए, यह अध्ययन DE-COP मेंबरशिप इन्फरेंस अटैक के माध्यम से यह प्रकट करता है कि OpenAI का GPT-4o मॉडल पे-वॉल वाले कंटेंट की सांख्यिकीय रूप से महत्वपूर्ण पहचान (AUROC 0.82) प्रदर्शित करता है, जबकि छोटा GPT-4o Mini मॉडल ऐसा नहीं करता है, जिससे AI प्रशिक्षण डेटा के लिए अधिक कॉर्पोरेट पारदर्शिता और औपचारिक लाइसेंसिंग ढांचे की आवश्यकता पर बल मिलता है।

Sruly Rosenblat, Tim O'Reilly, Ilan Strauss2026-05-07
💬 NLP

Beyond Exponential Decay: Rethinking Error Accumulation in Large Language Models

यह शोध पत्र यह प्रदर्शित करके बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में घातांकीय विश्वसनीयता क्षय (एक्सपोनेंशियल रिलायबिलिटी डिके) की प्रचलित धारणा को चुनौती देता है कि त्रुटियाँ विरल "प्रमुख टोकन" (की टोकन्स) पर केंद्रित होती हैं, और एक नया ढांचा प्रस्तावित करता है जो आनुपातिक स्केलिंग के बिना निरंतर दीर्घ-संदर्भ सुसंगतता प्राप्त करने के लिए महत्वपूर्ण निर्णय बिंदुओं पर रणनीतिक संरक्षण और गतिशील गणना को प्राथमिकता देता है।

Mikhail L. Arbuzov, Sisong Bei, Ziwei Dong, Dmitri Kalaev, Alexey A. Shvets2026-05-07
💬 NLP

Making Knowledge Accessible: Divergent Readability-Accuracy Strategies of Mistral and QWen in Biomedical Text Simplification

यह शोध पत्र बायोमेडिकल टेक्स्ट सरलीकरण में इंस्ट्रक्शन-ट्यून्ड मिस्ट्रल-स्मॉल 3 (Mistral-Small 3) और रीजनिंग-ऑगमेंटेड क्यूवेन 2.5 (QWen2.5) की अनुभवजन्य तुलना करता है, जो यह प्रकट करता है कि जबकि दोनों मॉडल पठनीयता में सुधार करते हैं, मिस्ट्रल मानव-स्तरीय विमर्श निष्ठा (discourse fidelity) के साथ एक बेहतर संतुलन प्राप्त करता है, जबकि क्यूवेन पठनीयता और सटीकता के बीच एक विच्छेद प्रदर्शित करता है।

P. Bilha Githinji, Aikaterini Melliou, Zeming Liang, Lian Zhang, Peiwu Qin2026-05-07
💬 NLP

DIAL: Direct Iterative Adversarial Learning for Realistic Multi-Turn Dialogue Simulation

यह शोध पत्र DIAL को प्रस्तुत करता है, जो एक जनरेटर-डिस्क्रिमिनेटर प्रतिस्पर्धा के माध्यम से उपयोगकर्ता सिम्युलेटर की यथार्थता में पुनरावृत्ति से सुधार करने वाला एक एडवरसेरियल फ्रेमवर्क है, जो मानसिक स्वास्थ्य संवाद प्रणालियों में लेक्सिकल विविधता को सफलतापूर्वक बहाल करने और विफलता मोड को सटीक रूप से मॉडल करने में सक्षम है ताकि तैनाती से पूर्व विश्वसनीय, लागत प्रभावी मूल्यांकन संभव हो सके।

Ziyi Zhu, Olivier Tieleman, Caitlin A. Stamatis, Luka Smyth, Thomas D. Hull, Daniel R. Cahn, Jinghong Chen, Matteo Malga (…)2026-05-07