💬 NLP

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

यह शोधपत्र नेचर-परिवार के प्रकाशनों से व्युत्पन्न नेचरबेंच (NatureBench) को प्रस्तुत करता है जो यह प्रकट करता है कि वर्तमान एआई कोडिंग एजेंट वास्तविक वैज्ञानिक खोज कार्यों में मौजूदा अत्याधुनिक (SOTA) स्तरों को पार करने के लिए संघर्ष कर रहे हैं, जो मुख्य रूप से वास्तविक आविष्कार के बजाय पद्धतिगत अनुवाद के माध्यम से सफल होते हैं और गलत विधि चयन एवं सीमित कंप्यूट बजट के कारण विफल हो जाते हैं।

Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng (…)2026-06-24
💬 NLP

Cross-Lingual Exploration for Parametric Knowledge

यह शोध पत्र क्रॉस-लिंगुअल एक्सप्लोरेशन (cross-lingual exploration) को एक कुशल इन्फरेंस-टाइम रणनीति के रूप में प्रस्तावित करता है जो 17 विविध भाषाओं में लार्ज लैंग्वेज मॉडल्स (Large Language Models) के पैरामीट्रिक नॉलेज रिट्रीवल (parametric knowledge retrieval), तथ्यात्मक रिकॉल (factual recall) और क्रॉस-लिंगुअल कंसिस्टेंसी (cross-lingual consistency) को महत्वपूर्ण रूप से बढ़ाता है, जो नेटिव-लैंग्वेज स्केलिंग (native-language scaling) से बेहतर प्रदर्शन करता है।

Elisha Diskind, Itamar Trainin, Uri Shaham, Leshem Choshen, Idan Szpektor, Omri Abend2026-06-24
🤖 AI

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench एक स्वचालित रेड-टीमिंग पाइपलाइन है जो संरचित उत्परिवर्तन ऑपरेटरों (mutation operators) के माध्यम से प्रतिकूल प्रॉम्प्ट (adversarial prompts) उत्पन्न करती है और एक मल्टी-जज पुष्टिकरण प्रणाली के माध्यम से विफलताओं को मान्य करती है, जिससे यह पता चलता है कि उत्परिवर्तन की प्रभावशीलता कार्य श्रेणी के अनुसार भिन्न होती है जबकि प्रतिकूल प्रॉम्प्ट मजबूत क्रॉस-मॉडल स्थानांतरणीयता प्रदर्शित करते हैं।

Khanak Khandelwal (Indian Institute of Technology Jodhpur)2026-06-24
💬 NLP

To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias

यह शोध पत्र एक एकीकृत ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि जहाँ पृथक मूल्यांकन पूर्वाग्रहों को सीमित कर सकते हैं, वहीं तुलनात्मक मूल्यांकन परिवेश बड़े भाषा मॉडलों (Large Language Models) में अंतर्निहित सामाजिक पूर्वाग्रहों को व्यवस्थित रूप से बढ़ा देते हैं—एक ऐसी घटना जिसे चेन-ऑफ-थॉट (Chain-of-Thought) तर्क और मॉडल के पैमाने द्वारा और अधिक बढ़ा दिया जाता है—जिससे छिपे हुए पूर्वाग्रहों के ऑडिटिंग के लिए तुलनात्मक विधियों का उपयोग करने बनाम अस्पष्ट वास्तविक दुनिया के अनुप्रयोगों में उनसे बचने के बीच एक महत्वपूर्ण अंतर स्पष्ट करना आवश्यक हो जाता है।

Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych2026-06-24
💬 NLP

Measuring User's Mental Models of Speech Translation in Human-AI Collaboration

यह शोध पत्र एक क्रॉस-लिंगुअल प्रश्न उत्तर फ्रेमवर्क प्रस्तुत करता है ताकि यह अध्ययन किया जा सके कि उपयोगकर्ता स्पीच ट्रांसलेशन सिस्टम के मानसिक मॉडल (मेंटल मॉडल्स) कैसे विकसित करते हैं, जो यह प्रकट करता है कि अभ्यास और स्रोत भाषा का ज्ञान उपयोगकर्ताओं को सतही संकेतों पर निर्भर करके सिस्टम की त्रुटियों का बेहतर पूर्वानुमान लगाने में मदद करता है।

HyoJung Han, Nishant Balepur, Jordan Boyd-Graber, Marine Carpuat2026-06-24
⚡ electrical engineering

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

यह शोध पत्र ParaPairAudioBench प्रस्तुत करता है, जो पांच पैरालिंग्विस्टिक आयामों में 5,175 ऑडियो युग्मों वाला एक व्यापक युग्मवार बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान लार्ज ऑडियो-लैंग्वेज मॉडल सूक्ष्म भाषण मूल्यांकन में मानव निर्णय से काफी पीछे हैं और गंभीर कैलिब्रेशन विफलताओं से जूझ रहे हैं, विशेष रूप से टाई (समानता) के मामलों में।

Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung, Hwiyeol Jo, Jeonghoon Kim, Jonghyun Choi, Soyoon Kim2026-06-24
💬 NLP

Harmonic: Hierarchical State Space Models for Efficient Long-Context Language Modeling

यह शोध पत्र Harmonic को प्रस्तुत करता है, जो एक पदानुक्रमित (hierarchical) स्टेट स्पेस मॉडल है जो ट्रांसफॉर्मर्स और मंबा की तुलना में लॉन्ग-कॉन्टेक्स्ट लैंग्वेज मॉडलिंग में बेहतर दक्षता और प्रदर्शन प्राप्त करने के लिए तीन आवर्ती टाइमस्केल्स (recurrent timescales) पर प्रेडिक्शन एरर्स को प्रोसेस करता है, जबकि 1B-पैरामीटर वाले मॉडल्स में लीनियर कम्प्यूटेशनल कॉम्प्लेक्सिटी के साथ 64K टोकन्स तक सफलतापूर्वक स्केल करता है और पोजीशनल एनकोडिंग की सीमाओं को समाप्त करता है।

Petr Nyoma2026-06-24
💬 NLP

CANDLE: Character-level Arabic Noise Deduplication using Lightweight Encoder

यह शोध पत्र CANDLE को प्रस्तुत करता है, जो एक हल्का सिस्टम है जो हस्तनिर्मित नियमों पर निर्भर हुए बिना कैरेक्टर-लेवल अरबी शोर डिडुप्लिकेशन के लिए कनेक्शनिस्ट टेम्पोरल क्लासिफिकेशन (CTC) का उपयोग करता है, जो उच्च सटीकता प्राप्त करता है, दक्षता के लिए मॉडल डिस्टिलेशन को सक्षम बनाता है, और डाउनस्ट्रीम टोकेनाइज़र लागत को कम करता है।

Faris Alasmary, Taif Nono, Orjuwan Zaafarani, Kholood Al Tabash, Ahmad Ghannam, Anas Salamah, Shouq Sadah, Lahouari Ghou (…)2026-06-24
💬 NLP

Posterior Refinement: Fast Language Generation via Any-Order Flow Maps

यह शोध पत्र FMLM+ प्रस्तुत करता है, जो एक नवीन ढांचा है जो फ्लो मैप लैंग्वेज मॉडल्स के जॉइंट सीक्वेंस ट्रांसपोर्ट को मास्किंग-शैली के नॉइज़ शेड्यूल्स के साथ जोड़ता है ताकि पोस्टीरियर रिफाइनमेंट (Posterior Refinement) को सक्षम किया जा सके, जो एक ऐसी रणनीति है जो टोकन निरंतरता को अनुकूल रूप से स्व-सुधारने के माध्यम से काफी कम इन्फरेंस स्टेप्स के साथ तेज़ और उच्च-सटीकता वाली भाषा पीढ़ी को सक्षम बनाती है।

Manan Agarwal, Sheel Shah, Chanhyuk Lee, Jaehoon Yoo, Jerry Huang, Seunghoon Hong, Aditi Raghunathan, Jinwoo Kim, Nichol (…)2026-06-24