💬 NLP

Instrument Effects in Language-Model Honesty Evaluation: An Auditable Single-System Demonstration

यह शोध पत्र यह प्रदर्शित करता है कि भाषा-मॉडल की ईमानदारी का मूल्यांकन उपकरण डिजाइन के विकल्पों—जैसे कि निर्णय व्याकरण (verdict grammar), प्रकटीकरण स्पष्टता और रन स्थिरता—के प्रति अत्यधिक संवेदनशील है, न कि निश्चित मॉडल प्रवृत्तियों को दर्शाता है, जिससे भविष्य के आकलन के लिए एक कठोर, ऑडिट योग्य अखंडता प्रोटोकॉल का समर्थन मिलता है।

Justin Bronder (Corabo Inc.)2026-07-17
🔢 mathematics

Decision Making Needs Uncertainty Quantification [Lecture Notes]

यह व्याख्यान स्थापित करता है कि अनिश्चितता के तहत इष्टतम निर्णय लेने के लिए अनिश्चितता के प्रतिनिधित्व (जैसे कि पश्च वितरण, भविष्यवाणी सेट, या क्रेडलल सेट) को एजेंट के जोखिम प्रोफाइल और उनके पर्यावरण के ज्ञान, दोनों के साथ मिलाना आवश्यक है, जबकि वास्तव में प्राप्त होने वाले उपयोगिता पर गारंटी भी प्रदान करना आवश्यक है।

Osvaldo Simeone2026-07-17
🤖 AI

Reward-Free Evolving Agents via Pairwise Validator

यह शोध पत्र एक लागत प्रभावी स्व-विकसित एजेंट फ्रेमवर्क प्रस्तावित करता है जो एजेंट सुधार के मार्गदर्शन के लिए महंगे स्केलर रिवॉर्ड सिग्नल्स के स्थान पर एक फ्रोजन LLM-आधारित पेयरवाइज वैलिडेटर का उपयोग करता है, जिससे बिना किसी लेबल किए गए डेटा या अतिरिक्त प्रशिक्षण के कई इंजनों और सबस्ट्रेट्स में प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Minghao Liu, Yu Wang, Jiayun Wang, Wei Wei2026-07-17
🤖 machine learning

ConFlow: Constraints-Guided Learning with Flow Matching for Motion Generation

यह शोधपत्र ConFlow का प्रस्ताव करता है, जो एक बाधा-निर्देशित फ्लो मैचिंग फ्रेमवर्क (constraint-guided flow matching framework) है जो विभेद्य फलनों (differentiable functions) और सप्रतिबंध गाऊसी प्रक्रियाओं (conditional Gaussian processes) के माध्यम से कार्य-विशिष्ट बाधाओं को सीधे प्रशिक्षण उद्देश्य में एकीकृत करता है, जिससे केवल अनुमान-समय मार्गदर्शन (inference-time guidance) पर निर्भर रहे बिना, मोशन जनरेशन की गुणवत्ता और बाधा संतुष्टि में सुधार होता है और प्रशिक्षण-अनुमान अंतराल (training-inference gap) को कम किया जाता है।

Nutan Chen, Jianxiang Feng, Marvin Alles, Botond Cseke2026-07-17
🤖 AI

Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers

यह शोध पत्र प्रदर्शित करता है कि डेप्थ-रिकरेंट ट्रांसफॉर्मर फिक्स्ड पॉइंट्स (fixed points) की ओर टोकन-विशिष्ट अभिसरण (token-specific convergence) प्रदर्शित करते हैं, जो एक प्रशिक्षण-मुक्त, प्रति-टोकन अर्ली-स्टॉपिंग तंत्र को सक्षम बनाता है जो निश्चित-डेप्थ इन्फरेंस और सीखे गए रूटिंग रणनीतियों दोनों की तुलना में काफी कम औसत कम्प्यूटेशनल डेप्थ पर समान गुणवत्ता प्राप्त करता है।

Joe Logan2026-07-17
🤖 AI

Tactile: Giving Computer-Using Agents Hands and Feet

Tactile एक ओपन-सोर्स टूल लेयर है जो विषम (heterogeneous) UI साक्ष्यों को सिमेंटिक, सत्यापन योग्य एक्शन ऑब्जेक्ट्स में परिवर्तित करके कंप्यूटर-उपयोग करने वाले एजेंटों को बेहतर बनाता है, जिससे भंगुर (brittle) कोऑर्डिनेट-आधारित इंटरैक्शन के स्थान पर एक विश्वसनीय ऑब्जर्व-ग्राउंड-एक्ट-वेरिफाई लूप स्थापित होता है जो कई मॉडलों में कार्य सफलता दर को महत्वपूर्ण रूप से बढ़ाता है।

Yong Liu, Zhenyi Zhong, Zhanpeng Shi2026-07-17
🤖 AI

Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution

यह शोध पत्र प्रदर्शित करता है कि विशेषज्ञ एजेंटिक प्रणालियाँ (specialist agentic systems) BPMN आरेखों को निष्पादन योग्य वर्कफ़्लो में बदलने के मामले में सामान्यवादी LLMs की तुलना में काफी बेहतर प्रदर्शन करती हैं, जो औद्योगिक अनुप्रयोगों के लिए उच्च सटीकता, दक्षता और विश्वसनीयता प्रदान करते हुए लागत और त्रुटि दरों को भारी रूप से कम करती हैं।

Harris Borman, Herman Wandabwa, Fusun Yu, Sandeepa Kannangara, Justin Liu, Anna Leontjeva, Ritchie Ng2026-07-17
🤖 machine learning

Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026

यह शोध पत्र DS@GT ARC टीम के BirdCLEF+ 2026 सबमिशन को प्रस्तुत करता है, जो पेंटानल वेटलैंड्स में मल्टी-लेबल पक्षी स्वर पहचान (bird vocalization detection) के लिए एक प्रतिस्पर्धी सुपरवाइज्ड एनसेंबल बेसलाइन स्थापित करता है और विशेष बायोअकौस्टिक मॉडलों के विरुद्ध न्यूरल ऑडियो कोडेक्स और फाउंडेशनल एम्बेडिंग्स से प्राप्त टोकन-आधारित रिप्रेजेंटेशन्स की प्रभावकारिता की जांच करता है।

Anthony Miyaguchi, Murilo Gustineli, Adrian Cheung2026-07-17
🤖 AI

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

यह शोध पत्र CEDI को प्रस्तुत करता है, जो एक गतिशील, मल्टी-टर्न इंटरैक्शन फ्रेमवर्क है जो पारंपरिक मूल्यांकन विधियों की तुलना में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में काफी अधिक और अधिक यथार्थवादी विजुअल हैलुसिनेशन (दृश्य मतिभ्रम) को प्रकट करके, स्टैटिक बेंचमार्क और वास्तविक दुनिया के अनुप्रयोगों के बीच के अंतर को पाटता है।

Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao2026-07-17
🤖 machine learning

Multi-Scale ViT Inference with Habitat-Fit Priors and kNN Retrieval for Multi-Species Plant Identification

यह शोध पत्र प्लांटCLEF 2026 चुनौती के लिए DS@GT ARC के तीसरे स्थान वाले समाधान को प्रस्तुत करता है, जो एक मल्टी-स्केल DINOv2 ViT क्लासिफायर को FAISS kNN रिट्रीवल, भौगोलिक आवास प्रायोरिटीज़ (geographic habitat priors) और टेम्पोरल फ्यूजन के साथ जोड़कर उच्च-रिज़ॉल्यूशन वाले क्वाड्रैट इमेजेस में मजबूत बहु-प्रजाति पौधों की पहचान प्राप्त करता है, जबकि यह प्रदर्शित करता है कि वैकल्पिक प्रशिक्षण-केंद्रित दृष्टिकोणों से कोई प्रदर्शन लाभ नहीं हुआ।

Alper Erten, Murilo Gustineli, Adrian Cheung2026-07-17