💬 NLP

FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback

यह शोध पत्र FronTalk प्रस्तुत करता है, जो मल्टी-मोडल फीडबैक को शामिल करने वाला संवादात्मक फ्रंट-एंड कोड जनरेशन के लिए एक बेंचमार्क और मूल्यांकन ढांचा है, जो फीचर फॉरगेटिंग (विशेषता विस्मृति) और विजुअल इंटरप्रिटेशन (दृश्य व्याख्या) जैसी महत्वपूर्ण चुनौतियों को उजागर करता है और यह प्रदर्शित करता है कि प्रस्तावित AceCoder विधि विस्मृति को काफी कम करती है और समग्र प्रदर्शन में सुधार करती है।

Xueqing Wu, Zihan Xue, Da Yin, Shuyan Zhou, Kai-Wei Chang, Nanyun Peng, Yeming Wen2026-06-11
💬 NLP

Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation

यह शोध पत्र प्रकट करता है कि LLM-आधारित जज अक्सर QA मूल्यांकन के दौरान प्रदान किए गए संदर्भ उत्तरों का पालन करने में विफल रहते हैं जब वे संदर्भ मॉडलों के आंतरिक पैरामीट्रिक ज्ञान के साथ संघर्ष करते हैं, जिससे अविश्वसनीय स्कोरिंग होती है जो सामान्य शमन रणनीतियों के बावजूद बनी रहती है।

Dongryeol Lee, Yerin Hwang, Taegwan Kang, Minwoo Lee, Younhyung Chae, Kyomin Jung2026-06-11
💬 NLP

Human-AI Co-design for Clinical Prediction Models

यह शोध पत्र HACHI को प्रस्तुत करता है, जो एक पुनरावृत्ति मानव-इन-द-लूप (human-in-the-loop) ढांचा है जो विशेषज्ञ फीडबैक के माध्यम से नैदानिक नोट्स (clinical notes) से व्याख्यात्मक अवधारणाओं (interpretable concepts) को तेजी से खोजने और परिष्कृत करने के लिए एआई एजेंटों का लाभ उठाता है, जिससे अधिक सटीक और सामान्यीकरण योग्य नैदानिक भविष्यवाणी मॉडल के विकास को गति मिलती है और साथ ही एआई को निर्देशित करने में मानवीय निरीक्षण की महत्वपूर्ण भूमिका पर प्रकाश डाला जाता है।

Jean Feng, Avni Kothari, Patrick Vossler, Andrew Bishara, Lucas Zier, Newton Addo, Aaron Kornblith, Yan Shuo Tan, Chanda (…)2026-06-11
💬 NLP

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

यह तकनीकी रिपोर्ट मिनिमम विएबल इवैल्यूएशन सूट (MVES) फ्रेमवर्क का परिचय देती है और स्थानीय एब्लेशन अध्ययनों के माध्यम से यह प्रदर्शित करती है कि सामान्य प्रॉम्प्ट सुधार विशिष्ट LLM एप्लिकेशन के प्रदर्शन को कम कर सकते हैं, जिससे तैनाती से पहले रिग्रेशन जोखिमों को कम करने के लिए मूल्यांकन-संचालित पुनरावृत्ति (इटरेशन) का समर्थन मिलता है।

Daniel Commey2026-06-11
💬 NLP

AI4SLT: Empirical Processes in Lean 4 for Formal Statistical Learning Theory

यह शोध पत्र एम्पिरिकल प्रोसेस (empirical processes) पर आधारित सांख्यिकीय शिक्षण सिद्धांत (statistical learning theory) का पहला व्यापक लीन 4 (Lean 4) औपचारिकीकरण प्रस्तुत करता है, जिसे एक मानव-एआई सहयोगात्मक वर्कफ़्लो के माध्यम से विकसित किया गया है ताकि एक पुन: प्रयोज्य औपचारिक आधार स्थापित किया जा सके जो मानक पाठ्यपुस्तकों में निहित धारणाओं को हल करता है और भविष्य के मशीन लर्निंग सिद्धांत विकास को सक्षम बनाता है।

Yuanhe Zhang, Jason D. Lee, Fanghui Liu2026-06-11
💬 NLP

Vector Quantized Latent Concepts: A Scalable Alternative to Clustering-Based Concept Discovery

यह शोध पत्र वेक्टर क्वांटाइज्ड लेटेंट कॉन्सेप्ट्स (VQLC) का प्रस्ताव करता है, जो एक स्केलेबल फ्रेमवर्क है जो फ्रोजन LLM हिडन स्टेट्स से व्याख्या योग्य, डिस्क्रीट लेटेंट कॉन्सेप्ट्स को सीखता है और K-मीन्स के तुलनीय कम्प्यूटेशनल दक्षता प्रदान करते हुए पदानुक्रमित क्लस्टरिंग (hierarchical clustering) की सिमेंटिक सुसंगतता प्राप्त करता है।

Xuemin Yu, Ankur Garg, Samira Ebrahimi Kahou, Hassan Sajjad2026-06-11
💬 NLP

On the Optimal Reasoning Length for RL-Trained Language Models

यह शोध पत्र प्रदर्शित करता है कि सुदृढीकरण अधिगम (reinforcement learning) द्वारा प्रशिक्षित भाषा मॉडलों के लिए, तर्क सटीकता (reasoning accuracy) आउटपुट लंबाई के साथ एक गैर-एकदिष्ट (non-monotonic) संबंध प्रदर्शित करती है, जो एक मध्यवर्ती मान पर चरम पर पहुँचती है क्योंकि यह बढ़ते हुए सटीक केंद्रीय प्रवृत्ति (central tendency) के आसपास बढ़ते हुए प्रसार (dispersion) के कारण होता है, भले ही विचार श्रृंखलाओं (chains of thought) के लंबा होने के साथ मोड सटीकता (mode accuracy) में सुधार जारी रहता है।

Daisuke Nohara, Taishi Nakamura, Rio Yokota2026-06-11
💬 NLP

SoftMatcha 2: A Fast and Soft Pattern Matcher for Trillion-Scale Corpora

SoftMatcha 2 एक अल्ट्रा-फास्ट, लचीला खोज एल्गोरिदम है जो ट्रिलियन-स्केल कॉर्पोरा पर सफिक्स एरेज़ (suffix arrays), वेक्टर-आधारित शब्द निरूपण और कॉम्बिनेटोरियल विस्फोट को कम करने के लिए डायनेमिक कॉर्पस-अवेयर प्रूनिंग का लाभ उठाकर 0.3-सेकंड से कम समय में सिमेंटिक पैटर्न मिलान सक्षम करता है।

Masataka Yoneda, Yusuke Matsushita, Go Kamoda, Kohei Suenaga, Takuya Akiba, Masaki Waga, Sho Yokoi2026-06-11
💬 NLP

PoQ-Judge: A Multi-Architecture Evaluation Framework for Cost-Aware Proof-of-Quality in Decentralized LLM Inference

यह शोध पत्र PoQ-Judge को प्रस्तुत करता है, जो एक मल्टी-आर्किटेक्चर फ्रेमवर्क है जो विकेंद्रीकृत LLM इन्फरेंस गुणवत्ता का मूल्यांकन करने के लिए रेफरेंस-फ्री जज मॉडल को प्रशिक्षित करता है, जो ऑनलाइन कैलिब्रेशन और कैस्केड इवैल्यूएशन के माध्यम से ग्राउंड-ट्रुथ प्रॉक्सी के साथ मजबूत सहसंबंध और महत्वपूर्ण लागत कटौती प्राप्त करता है।

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan2026-06-11
💬 NLP

The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content

यह शोध पत्र "स्ट्रक्चरल अटेंशन टैक्स" (structural attention tax) की पहचान और औपचारिकीकरण करता है, जो एक ऐसी घटना है जहाँ नॉलेज ग्राफ ट्रिपल्स का कठोर प्रारूप अर्थ संबंधी प्रासंगिकता के स्वतंत्र रूप से एलएलएम (LLM) के अटेंशन को हाईजैक कर लेता है, जिससे प्रदर्शन अटेंशन (demonstration attention) संकुचित हो जाता है और यह प्रकट होता है कि रिट्रीवल-ऑगमेंटेड इन-कॉन्टेक्स्ट लर्निंग को बढ़ाने के लिए रिट्रीवल फॉर्मेट को अनुकूलित करना, रिट्रीवल क्वालिटी में सुधार करने जितना ही महत्वपूर्ण है।

Yuqi Zhang, Di Zhang2026-06-11