🤖 machine learning

Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

यह शोध पत्र "सुपरनोड्स" (supernodes) की पहचान करता है—जो कि ट्रांसफॉर्मर फीड-फॉरवर्ड नेटवर्क के भीतर नुकसान-महत्वपूर्ण (loss-critical) चैनलों का एक छोटा, अत्यधिक केंद्रित सेट है—और यह प्रदर्शित करता है कि स्ट्रक्चर्ड प्रूनिंग के दौरान इन चैनलों की सुरक्षा करना पारंपरिक तरीकों की तुलना में मॉडल के प्रदर्शन में महत्वपूर्ण सुधार करता है।

Audrey Cherilyn, Houman Safaai2026-04-28
💻 computer science

JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems

यह शोध पत्र JudgeSense को प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जिसे प्रॉम्प्ट्स को पैराफ्रेज़ (paraphrase) करने पर उनके निर्णयों में होने वाले बदलावों को मापकर LLM-as-a-judge सिस्टम की स्थिरता को मापने के लिए डिज़ाइन किया गया है, जो विभिन्न मॉडलों के बीच कार्य प्रदर्शन में महत्वपूर्ण विसंगतियों और अंतर्निहित पूर्वाग्रहों को प्रकट करता है।

Rohith Reddy Bellibatlu2026-04-28
💻 computer science

Your Students Don't Use LLMs Like You Wish They Did

यह शोध पत्र छात्र-एआई (student-AI) अंतःक्रियाओं में शैक्षणिक संरेखण का मूल्यांकन करने के लिए छह नए कम्प्यूटेशनल मेट्रिक्स प्रस्तुत करता है, जिससे यह पता चलता है कि छात्र मुख्य रूप से एलएलएम (LLM) का उपयोग त्वरित उत्तर निकालने के लिए करते हैं न कि उस निरंतर शिक्षण संवाद के लिए जिसे शिक्षक लक्षित करते हैं, और यह व्यवहार काफी हद तक इस बात से प्रेरित है कि इन उपकरणों को पाठ्यक्रम में कैसे एकीकृत किया गया है।

Sebastian Kobler, Matthew Clemson, Angela Sun, Jonathan K. Kummerfeld2026-04-28
💻 computer science

K-SENSE: A Knowledge-Guided Self-Augmented Encoder for Neuro-Semantic Evaluation of Mental Health Conditions on Social Media

K-SENSE सोशल मीडिया पर मानसिक स्वास्थ्य स्थितियों का पता लगाने के लिए एक नवीन ढांचा है जो बाहरी मनोवैज्ञानिक सामान्य ज्ञान (psychological commonsense knowledge) को एक स्व-संवर्धित एन्कोडिंग पाइपलाइन और पर्यवेक्षित कंट्रास्टिव लर्निंग (supervised contrastive learning) के साथ संयुक्त रूप से एकीकृत करके प्रदर्शन में सुधार करता है।

Vijay Yadav2026-04-28
💻 computer science

Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

Pref-CTRL एक नवीन टेस्ट-टाइम अलाइनमेंट फ्रेमवर्क है जो मानव प्राथमिकता डेटा की संरचना को बेहतर ढंग से कैप्चर करने के लिए डिज़ाइन किए गए मल्टी-ऑब्जेक्टिव वैल्यू फंक्शन का उपयोग करके मौजूदा रिप्रेजेंटेशन-एडिटिंग विधियों में सुधार करता है।

Imranul Ashrafi, Inigo Jauregi Unanue, Massimo Piccardi2026-04-28
🤖 machine learning

RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization

RouteNLP एक क्लोज्ड-लूप फ्रेमवर्क है जो उच्च गुणवत्ता और कम विलंबता बनाए रखते हुए, एक टियर्ड पोर्टफोलियो में सबसे कुशल मॉडल तक क्वेरी को रूट करने के लिए एक डिफिकल्टी-अवेयर राउटर, कॉन्फॉर्मल-प्रेडिक्शन-आधारित कैस्केडिंग, और एक डिस्टिलेशन-रूटिंग को-ऑप्टिमाइज़ेशन लूप को संयोजित करके LLM सर्विंग लागत को अनुकूलित करता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-28
💻 computer science

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval एक ऐसा फ्रेमवर्क है जो एजेंटिक वर्कफ़्लो को निर्देशित अचक्रीय ग्राफ़ (DAGs) के रूप में औपचारिक रूप देता है ताकि संरचित, चरण-स्तरीय मूल्यांकन और स्वचालित मूल कारण एट्रिब्यूशन को सक्षम किया जा सके, जो विफलता पहचान रिकॉल में एंड-टू-एंड विधियों से काफी बेहतर प्रदर्शन करता है और उत्पादन वातावरणों में डिबगिंग समय को कम करता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-28
🤖 machine learning

ComplianceNLP: Knowledge-Graph-Augmented RAG for Multi-Framework Regulatory Gap Detection

ComplianceNLP एक एंड-टू-एंड सिस्टम है जो नियामक निगरानी और गैप डिटेक्शन को स्वचालित करने के लिए नॉलेज-ग्राफ-ऑगमेंटेड RAG पाइपलाइन और मल्टी-टास्क ऑब्लिगेशन एक्सट्रैक्शन का उपयोग करता है, जो वास्तविक दुनिया के वित्तीय डिप्लॉयमेंट में विश्लेषक दक्षता को महत्वपूर्ण रूप से बढ़ाते हुए GPT-4o से बेहतर प्रदर्शन करता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-28
⚡ electrical engineering

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV एक ऑटोरेग्रेसिव डिफ्यूजन फ्रेमवर्क है जो ऑडियो-वीडियो के संयुक्त निर्माण के लिए उच्च-स्तरीय सिमेंटिक रीजनिंग हेतु एक साझा बैकबोन और निम्न-स्तरीय रिफाइनमेंट हेतु मोडैलिटी-विशिष्ट डिकोडर्स का उपयोग करके बेहतर क्रॉस-मोडल सुसंगतता और दक्षता प्राप्त करता है।

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, W (…)2026-04-28
💻 computer science

FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification

FinGround एक तीन-चरणीय "सत्यापन-फिर-आधारित" (verify-then-ground) पाइपलाइन है जिसे LLMs में वित्तीय मतिभ्रम (financial hallucinations) को कम करने के लिए डिज़ाइन किया गया है, जो उत्तरों को परमाणु दावों (atomic claims) में विभाजित करता है, विशेष सत्यापन रणनीतियों (अंकगणितीय पुन: गणना सहित) को लागू करता है, और सटीक उद्धरण प्रदान करता है, जिससे अंततः GPT-4o की तुलना में त्रुटियों में 78% की कमी आती है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-28