💬 NLP

From Tokens to Faces: Investigating Discrete Speech Representations for 3D Facial Animation

यह शोध पत्र 3D फेशियल एनिमेशन के लिए चार प्रकार के डिस्क्रीट स्पीच रिप्रेजेंटेशन्स का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि ध्वन्यात्मक वर्गों (phonetic classes) को एनकोड करने से सटीक भविष्यवाणियाँ प्राप्त होती हैं और एक ऑडियो विजुअल टेक्स्ट-टू-स्पीच (AVTTS) पाइपलाइन को पेश करने में सक्षम बनाता है जो स्पीच और 3D फेशियल मोशन को एक साथ डिकोड करने के लिए साझा डिस्क्रीट रिप्रेजेंटेशन्स का उपयोग करता है।

Pedro Correa, Olivier Perrotin, Samir Sadok, Paula Costa, Thomas Hueber2026-06-12
💬 NLP

Operads for compositional reasoning in LLMs

यह शोध पत्र LLMs में प्रश्न विखंडन (question decomposition) को मॉडल करने के लिए एक कठोर गणितीय ढांचे के रूप में ऑपेरेड्स (operads) का प्रस्ताव करता है, जो "ऑपेरेडिक निरंतरता" (operadic consistency) की अवधारणा को एक नवीन इनवेरिएंट (invariant) के रूप में प्रस्तुत करता है जो तर्क संबंधी सटीकता के साथ दृढ़ता से सह-संबंधित है और मानक सेल्फ-कंसिस्टेंसी बेसलाइन्स से बेहतर प्रदर्शन करता है।

Nathaniel Bottman, Kyle Richardson2026-06-12
💬 NLP

Recursive Agent Harnesses

यह शोध पत्र रिकर्सिव एजेंट हार्नेस (RAH) को प्रस्तुत करता है, जो एक कोड-प्रथम फ्रेमवर्क है जहाँ पैरेंट एजेंट, फाइलसिस्टम और निष्पादन उपकरणों के साथ समानांतर सब-एजेंट हार्नेस उत्पन्न करते हैं, जो फिक्स्ड और अधिक शक्तिशाली बैकबोन मॉडल्स के साथ मूल्यांकन किए जाने पर पारंपरिक मॉडल-रिकर्सन बेसलाइन्स की तुलना में लॉन्ग-कॉन्टेक्स्ट रीजनिंग और कोडिंग कार्यों में महत्वपूर्ण सुधार प्रदर्शित करता है।

Elias Lumer, Sahil Sen, Kevin Paul, Vamse Kumar Subbiah2026-06-12
💬 NLP

Operadic consistency: a label-free signal for compositional reasoning failures in LLMs

यह शोध पत्र "ऑपेराडिक कंसिस्टेंसी" (operadic consistency) को प्रस्तुत करता है, जो एक लेबल-मुक्त नैदानिक संकेत है जो एक कंपोजिशनल क्वेरी के प्रति मॉडल के सीधे उत्तर और एक घोषित अपघटन (decomposition) से प्राप्त उसके उत्तर के बीच की सहमति को मापता है, यह प्रदर्शित करते हुए कि यह मीट्रिक विविध LLMs और डेटासेट्स में तर्क सटीकता के साथ दृढ़ता से सह-संबंधित है और विफलता का पता लगाने तथा चयनात्मक भविष्यवाणी में सुधार करने के लिए चेन-ऑफ-थॉट सेल्फ-कंसिस्टेंसी जैसे मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Nathaniel Bottman, Yinhong Liu, Kyle Richardson2026-06-12
🤖 AI

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

यह शोध पत्र EurekAgent को प्रस्तुत करता है, जो एक स्वायत्त वैज्ञानिक खोज प्रणाली है जो अनुसंधान के केंद्र को एजेंट वर्कफ़्लो डिज़ाइन से बदलकर "एनवायरनमेंट इंजीनियरिंग" (वातावरण इंजीनियरिंग) पर स्थानांतरित कर देती है—अर्थात उत्पादक व्यवहारों को बढ़ाने और हानिकारक व्यवहारों को दबाने के लिए अनुमतियों, आर्टिफ़ेक्ट्स, बजट और मानवीय निरीक्षण को संरचित करना, जिससे गणित, कर्नेल इंजीनियरिंग और मशीन लर्निंग कार्यों में अत्याधुनिक परिणाम प्राप्त किए जा सकें।

Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li2026-06-12
💬 NLP

HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents

HyperTool एक एकीकृत निष्पादन योग्य इंटरफ़ेस (unified executable interface) पेश करता है जो एजेंटों को जटिल, बहु-चरणीय टूल वर्कफ़्लो को एकल कोड-ब्लॉक इनवोकेशन में समाहित करने की अनुमति देता है, जिससे निष्पादन-स्तर के बेमेल (execution-granularity mismatches) का समाधान होता है और MCP-Universe जैसे बेंचमार्क पर बहु-चरणीय टूल-उपयोग की सटीकता में महत्वपूर्ण सुधार होता है।

Yaxin Du, Yifan Zhou, Yujie Ge, Jiajun Wang, Xianghe Pang, Shuo Tang, Tuney Zheng, Bryan Dai, Jian Yang, Siheng Chen2026-06-12
💬 NLP

Influcoder: Distilling Decoders' Gradient Influence Rankings into an Encoder for Data Attribution

यह शोध पत्र Influcoder को प्रस्तुत करता है, जो बड़े भाषा मॉडलों (LLMs) के लिए तेज़, लागत प्रभावी और स्केलेबल डेटा एट्रिब्यूशन को सक्षम करने के लिए डिकोडर्स से ग्रेडिएंट इन्फ्लुएंस रैंकिंग को एक एनकोडर में डिस्टिल करने की एक विधि है।

Dimitri Kachler, Damien Sileo, Pascal Denis2026-06-12
💬 NLP

EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

यह शोधपत्र गतिशील वातावरण में LLM एजेंटों के मूल्यांकन के लिए एक बेंचमार्क सुइट के रूप में EvoArena पेश करता है, और EvoMem का प्रस्ताव देता है, जो एक पैच-आधारित मेमोरी प्रतिमान (paradigm) है जो पर्यावरणीय विकास को ट्रैक करता है ताकि विकसित होते और मानक दोनों कार्यों पर एजेंट के प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Jundong Xu, Qingchuan Li, Jiaying Wu, Yihuai Lan, Shuyue Stella Li, Huichi Zhou, Bowen Jiang, Lei Wang, Jun Wang, Anh Tu (…)2026-06-12
💬 NLP

Debiased Automatic Speech Recognition for Dysarthric Speech via Sample Reweighting with Sample Affinity Test

यह शोध पत्र Re-SAT का प्रस्ताव करता है, जो एक नवीन सैंपल रीवेटिंग दृष्टिकोण है जो डिसार्थ्रिक वक्ताओं के लिए प्रदर्शन में सुधार करने और स्वस्थ वक्ताओं के परिणामों को खराब किए बिना, ऑटोमैटिक स्पीच रिकग्निशन सिस्टम में पूर्वाग्रह को व्यवस्थित रूप से मापने और कम करने के लिए सैंपल एफिनिटी टेस्ट का उपयोग करता है।

Eungbeom Kim, Yunkee Chae, Jaeheon Sim, Kyogu Lee2026-06-11
💬 NLP

Guiding Frame-Level CTC Alignments Using Self-knowledge Distillation

यह शोध पत्र एक स्व-ज्ञान आसवन (self-knowledge distillation) विधि प्रस्तावित करता है जो फ्रेम-स्तरीय CTC संरेखण (alignments) को निर्देशित करने के लिए एनकोडर परतों को साझा करता है, जिससे शिक्षक-छात्र असहमति कम होती है और ऑटोमैटिक स्पीच रिकग्निशन मॉडल के प्रदर्शन और संसाधन दक्षता दोनों में सुधार होता है।

Eungbeom Kim, Hantae Kim, Kyogu Lee2026-06-11