💬 NLP

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

यह शोधपत्र WorldCupArena को पेश करता है, जो फुटबॉल पूर्वानुमान के लिए भाषा मॉडल (language models) और डीप-रिसर्च एजेंटों का मूल्यांकन करने के लिए एक गतिशील बेंचमार्क है, जो मैचों के होने से पहले वास्तविक समय की जानकारी का उपयोग करके मैच के परिणामों, स्कोर और घटनाओं की भविष्यवाणी करने की उनकी क्षमता का परीक्षण करता है, जिसमें प्रारंभिक परिणाम सटीक सटीकता (exact accuracy) में सट्टेबाजी और मानव बेसलाइन की तुलना में मामूली बढ़त दिखाते हैं, लेकिन विस्तृत स्कोरलाइन भविष्यवाणियों में स्पष्ट सुधार दर्शाते हैं।

Zhaokai Wang, Tianlin Gui, Jiayuan Rao, Shangzhe Di, Yihong Tang, Dingli Liang2026-07-21
💬 NLP

VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester Design

यह शोध पत्र VEHBench प्रस्तुत करता है, जो एक नवीन नैदानिक बेंचमार्क है जिसमें 763 साहित्य-आधारित कार्य शामिल हैं जो कंपन ऊर्जा हारवेस्टर (vibration energy harvester) डिजाइन के चार विशिष्ट चरणों में LLMs का मूल्यांकन करते हैं, जिससे यह पता चलता है कि मॉडल का प्रदर्शन अत्यधिक चरण-निर्भर है और इंजीनियरिंग AI के लिए एक वर्कफ़्लो-जागरूक दृष्टिकोण की आवश्यकता है।

Depeng Su, Yuyu Luo, Guobiao Hu2026-07-21
💬 NLP

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro एक हल्के हेड (lightweight head) का उपयोग करके कोडिंग एजेंटों के आंतरिक निरूपणों (internal representations) का लाभ उठाकर अप्रासंगिक टूल आउटपुट को सीधे काट देता है, जिससे बिना किसी अलग क्लासिफायर की आवश्यकता के महत्वपूर्ण टोकन बचत और बेहतर कार्य प्रदर्शन प्राप्त होता है।

Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye, Yuting Chen, Kai Cai, Xiaodong Gu2026-07-21
💬 NLP

Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes

यह शोध पत्र प्रदर्शित करता है कि सीखे गए सॉफ्ट प्रीफिक्स (soft prefixes) विशिष्ट तार्किक परिचालनों को लागू करने के बजाय एक व्यापक उत्तर प्राथमिकता को प्रेरित करके बड़े भाषा मॉडलों में सही तार्किक निर्णयों को व्यवस्थित रूप से ओवरराइड कर सकते हैं, जिससे विभिन्न मॉडल आर्किटेक्चर के बीच तार्किक स्थिरता में महत्वपूर्ण भिन्नताओं का पता चलता है।

Brian K Chen2026-07-21
💬 NLP

Domain Knowledge-Enhanced LLMs for Fraud and Concept Drift Detection

यह शोध पत्र एक डोमेन नॉलेज-एन्हांस्ड एलएलएम (LLM) फ्रेमवर्क प्रस्तावित करता है जो संरचित अंतर्दृष्टि को दो-चरणीय पहचान प्रणाली के साथ एकीकृत करता है ताकि भ्रामक बातचीत की प्रभावी ढंग से पहचान करने और कॉन्सेप्ट ड्रिफ्ट (concept drift) को सौहार्दपूर्ण या धोखाधड़ी वाले के रूप में वर्गीकृत करने के लिए, SEConvo डेटासेट पर 98% सटीकता प्राप्त करते हुए उच्च-जोखिम वाले एनएलपी (NLP) अनुप्रयोगों में ज़ीरो-शॉट बेसलाइन से बेहतर प्रदर्शन किया जा सके।

Ali Şenol, Garima Agrawal, Huan Liu2026-07-20✓ Author reviewed
💬 NLP

Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability

यह शोध पत्र प्रदर्शित करता है कि नोब प्रभाव (Knobe effect), जो कि इरादात्मकता के निर्णयों में एक नैतिक पूर्वाग्रह है, फाइनट्यून किए गए बड़े भाषा मॉडलों (large language models) में उभरता है, लेकिन इसे विशिष्ट परतों (layers) तक स्थानीयकृत किया जा सकता है और बिना पुनरप्रशिक्षण (retraining) के लक्षित लेयर-पैचिंग हस्तक्षेपों के माध्यम से कम किया जा सकता है।

Bianca Raimondi, Daniela Dalbagno, Maurizio Gabbrielli2026-07-20
💬 NLP

Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy

यह अध्ययन प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) ब्लूम के टैक्सोनॉमी (Bloom's Taxonomy) द्वारा परिभाषित संज्ञानात्मक जटिलता स्तरों को उनके आंतरिक निरूपणों (internal representations) के एक रैखिक रूप से विभाज्य उपस्थान (linearly separable subspace) में एनकोड करते हैं, जो उच्च वर्गीकरण सटीकता प्राप्त करता है और यह सुझाव देता है कि संज्ञानात्मक कठिनाई फॉरवर्ड पास (forward pass) के शुरुआती चरण में ही हल हो जाती है।

Bianca Raimondi, Maurizio Gabbrielli2026-07-20
💻 computer science

Empathy as Predictive Misalignment Tolerance: A Co-Regulation Framework and the Regime Structure of Dialogue Repair

यह शोध पत्र सहानुभूति को भावनात्मक अनुनाद से बदलकर "अनुमानित विसंगति सहिष्णुता" के रूप में पुनर्गठित करता है, यह प्रस्तावित करते हुए कि प्रभावी संवाद विसंगति को समाप्त करने के बजाय समय के साथ व्याख्यात्मक विचलन को विनियमित करने पर निर्भर करता है, एक ऐसी अवधारणा जिसे उन निष्कर्षों द्वारा मान्य किया गया है जो दिखाते हैं कि मरम्मत तंत्र शोर के स्तर के आधार पर सटीकता का सार संरक्षण के लिए व्यापार करते हैं।

Molood Arman2026-07-20
💻 computer science

Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior

यह शोध पत्र प्रदर्शित करता है कि समझौता किए गए मॉडलों से हानिकारक चेन-ऑफ-थॉट ट्रेसेस को पुन: प्रयोज्य जेलब्रेक प्रॉम्प्ट्स में स्थानांतरित और डिस्टिल किया जा सकता है, जो ओपन-सोर्स और क्लोज्ड-सोर्स दोनों मॉडलों पर हमले की सफलता दर को महत्वपूर्ण रूप से बढ़ा देता है और यह भी प्रकट करता है कि वर्तमान आउटपुट-साइड सुरक्षा उपाय ऐसे रीजनिंग-आधारित खतरों का पता लगाने में अक्सर विफल रहते हैं।

Ali khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, Golnoosh Farnadi2026-07-20
💬 NLP

Large Language Models as Unified Multimodal Learners for Clinical Prediction

यह शोध पत्र यह प्रदर्शित करता है कि विविध इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड मोडैलिटीज़ को एक एकल प्राकृतिक भाषा अनुक्रम में परिवर्तित करना और एक प्रीट्रेंड लार्ज लैंग्वेज मॉडल को एंड-टू-एंड फाइन-ट्यून करना, विशिष्ट मल्टीमॉडल आर्किटेक्चर और तैनात ग्रेडिएंट बूस्टिंग सिस्टम के समान या उनसे बेहतर क्लिनिकल प्रेडिक्शन प्रदर्शन प्राप्त करता है, जिससे जटिल, कार्य-विशिष्ट फ्यूजन डिजाइनों की आवश्यकता समाप्त हो जाती है।

Ajay Madhavan Ravichandran, Bilgin Osmandoja, Klemens Budde, Klaus Netter, Tobias Strapatsas, Aljoscha Burchardt, Sebast (…)2026-07-20