💬 NLP

UnBias-Plus: Detect, Explain, and Rewrite Bias

UnBias-Plus एक ओपन-सोर्स टूलकिट है जो सेगमेंट-स्तरीय मल्टी-क्लास क्लासिफिकेशन, बायस्ड स्पैन लोकलाइजेशन, न्यूट्रल टेक्स्ट रीराइटिंग और रीजनिंग एक्सप्लेनेशन्स को एक ही सुलभ प्लेटफॉर्म में एकीकृत करके मौजूदा बायस डिटेक्शन विधियों की सीमाओं को संबोधित करता है।

Ahmed Y. Radwan, Ahmed ElKady, Sindhuja Chaduvula, Mohamed Hafez, Amrit Krishnan, Shaina Raza2026-06-23
💬 NLP

War in the Abstract: The Rise and Consequences of Militarized Language in Scientific Communication

यह अध्ययन प्रकट करता है कि 2010 और 2025 के बीच वैज्ञानिक सारांशों में सैन्यवादी भाषा का उपयोग तेजी से बढ़ा है, जो वैश्विक संघर्षों के साथ सह-संबंधित है, फिर भी प्रयोगात्मक साक्ष्य दर्शाते हैं कि इस प्रकार का युद्ध-फ्रेमिंग अंततः वैज्ञानिक विश्वसनीयता, वित्त पोषण की इच्छा और नीतिगत समर्थन को कमजोर करता है।

Sovesh Mohapatra, David Lydon-Staley, Dani S. Bassett2026-06-23
💬 NLP

Self-Compacting Language Model Agents

यह शोध पत्र SelfCompact को पेश करता है, जो एक प्रशिक्षण-मुक्त स्कैफोल्डिंग फ्रेमवर्क है जो एजेंट ट्रेसेस के अनुकूली (adaptive), संदर्भ-जागरूक सारांश के लिए एक मॉडल-इवोक्ड कॉम्पेक्शन टूल को एक हल्के रूब्रिक के साथ जोड़ता है, जो फिक्स्ड-इंटरवल दृष्टिकोणों की तुलना में गणित और सर्च बेंचमार्क पर प्रदर्शन में सुधार करते हुए टोकन लागत को काफी कम कर देता है।

Tianjian Li, Jingyu Zhang, William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi2026-06-23
🤖 AI

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol एक पुनरावृत्ति ढांचा (iterative framework) है जो टाइप-अवेयर इवोल्यूशन ऑपरेटर्स के माध्यम से प्रॉम्प्ट कठिनाई विस्तार को, मल्टी-सोर्स हाइपोथेसिस-टेस्ट फाल्सिफिकेशन के माध्यम से उत्तर विश्वसनीयता प्रवर्तन से अलग करके मल्टीमॉडल गणितीय तर्क को स्केल करता है, जिससे उच्च-गुणवत्ता वाला सत्यापित डेटा उत्पन्न होता है जो विजुअल-मैथ बेंचमार्क पर मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang2026-06-23
💬 NLP

The Energy Consumption of Transformer Fine-Tuning: A Roofline-Inspired Scaling Model

यह शोध पत्र एक रूफलाइन-प्रेरित स्केलिंग मॉडल प्रस्तुत करता है जो नियंत्रित आर्किटेक्चरल स्वीप्स से प्राप्त कंप्यूट, मेमोरी ट्रैफिक और हार्डवेयर दक्षता कारकों को मापे गए ऊर्जा से जोड़कर विषम मल्टी-जीपीयू कॉन्फ़िगरेशन में ट्रांसफॉर्मर प्रशिक्षण की ऊर्जा खपत का सटीक अनुमान लगाता है।

Mansour Zoubeirou a Mayaki2026-06-23
💬 NLP

SVD-Surgeon: Optimal Singular-Value Surgery for Large Language Model Compression

SVD-Surgeon एक प्रशिक्षण-मुक्त (training-free) विधि है जो सिंगुलर वैल्यूज पर ऑप्टिमल ब्रेन सर्जन फ्रेमवर्क को लागू करके मौजूदा लो-रैंक LLM संपीड़न (compression) को बेहतर बनाती है, जिससे बिना पुन: प्रशिक्षण के परप्लेक्सिटी-कंप्रेशन ट्रेड-ऑफ को सुधारने के लिए सेकंड-ऑर्डर लॉस कंपनसेशन और सैलिएंसी-आधारित प्रूनिंग सक्षम होती है।

Mahmoud Safari, Frank Hutter2026-06-23
💬 NLP

Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

यह शोध पत्र ओपन लैंग्वेज मॉडल्स पर व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि "इवैल्यूएशन अवेयरनेस" (मूल्यांकन जागरूकता) कोई एकल क्षमता नहीं है, बल्कि एक बहुआयामी घटना है जिसमें डिटेक्शन (पहचान), व्यवहारिक अनुकूलन और आंतरिक प्रतिनिधित्व शामिल हैं जो स्वतंत्र रूप से भिन्न होते हैं, जिससे एक "बेंचमार्क इल्यूजन" (बेंचमार्क भ्रम) उत्पन्न होता है जहाँ मानक सुरक्षा स्कोर वास्तविक दुनिया की तैनाती की सुरक्षा का विश्वसनीय रूप से पूर्वानुमान लगाने में विफल रहते हैं।

Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal, Shivani Anilkumar, Sankaran Vaidyanathan, David A. Nader Palacio (…)2026-06-23
💬 NLP

EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions

यह शोध पत्र EnterpriseClawBench प्रस्तुत करता है, जो मालिकाना वास्तविक-दुनिया के एंटरप्राइज एजेंट सत्रों से प्राप्त एक बेंचमार्क है जो 852 पुनरुत्पादित कार्यों का मूल्यांकन करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान मॉडल सीमित सफलता (0.663) प्राप्त करते हैं और भविष्य के मूल्यांकनों को केवल एक एकल स्कोर पर निर्भर रहने के बजाय हार्नेस-मॉडल संयोजनों, आर्टिफैक्ट डिलीवरी, दृश्य गुणवत्ता, लागत, रनटाइम और कौशल-हस्तांतरण व्यवहार की रिपोर्ट करने वाले एक बहु-आयामी ढांचे को अपनाना चाहिए।

Jincheng Zhong, Weizhi Wang, Che Jiang, Kai Tian, Zhenzhao Yuan, Junlin Yang, Dianqiao Lei, Kaiyan Zhang2026-06-23
💬 NLP

Tapered Language Models

यह शोध पत्र टेपर्ड लैंग्वेज मॉडल्स (TLMs) को प्रस्तुत करता है, जो एक आर्किटेक्चर-अज्ञेय (architecture-agnostic) डिज़ाइन सिद्धांत है जो एक निश्चित पैरामीटर बजट के तहत शुरुआती से बाद की परतों तक MLP चौड़ाई को एकतत (monotonically) रूप से कम करके पर्प्लेक्सिटी और डाउनस्ट्रीम प्रदर्शन में सुधार करता है, यह प्रदर्शित करते हुए कि गैर-समान क्षमता आवंटन पारंपरिक समान-चौड़ाई वाले स्टैक्स की तुलना में बेहतर प्रदर्शन करता है।

Reza Bayat, Ali Behrouz, Aaron Courville2026-06-23
💬 NLP

Can LLMs Reliably Self-Report Adversarial Prefills, and How?

यह शोध पत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (large language models) विश्वसनीय रूप से स्वयं यह रिपोर्ट नहीं कर सकते कि उनके आउटपुट प्रतिकूल प्रीफिल्स (adversarial prefills) का परिणाम हैं, क्योंकि उनके आत्मनिरीक्षण संकेत (introspective signals) असंगत, प्रोब-निर्भर (probe-dependent) और कुछ विशिष्ट फाइन-ट्यूनिंग हस्तक्षेपों द्वारा संभावित रूप से और भी खराब हो जाते हैं।

Quang Minh Nguyen, Uzair Ahmed, Taegyoon Kim2026-06-23