🤖 AI

From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence

यह शोध पत्र एक भाषा-केंद्रित ढांचे को प्रस्तुत करता है जो एक वैश्विक अर्थ संबंधी कोडबुक (global semantic codebook) के माध्यम से विविध बहुविध डेटा (multimodal data) को परमाणु प्रस्थापनाओं (atomic propositions) के एक व्याख्या योग्य स्थान में एकीकृत करता है, जिससे स्वायत्त ड्राइविंग जैसे अनुप्रयोगों के लिए उन्नत तर्क, क्रॉस-मोडल रिट्रीवल और जटिल संयोजन सक्षम होता है।

Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose (…)2026-07-21
💻 computer science

ReqGenX: An Empirical Study of Atomic Decomposition, Artifact Regeneration, and Reconstruction for Legacy SRS Documents

यह शोधपत्र ReqGenX प्रस्तुत करता है, जो एक अनुभवजन्य अध्ययन है जो यह प्रदर्शित करता है कि लीगेसी सॉफ्टवेयर रिक्वायरमेंट्स स्पेसिफिकेशन (SRS) दस्तावेजों को ट्रैसेबल (traceable), परमाणु कथनों (atomic statements) में विघटित करना और उन्हें सिंथेटिक प्री-SRS आर्टिफैक्ट्स के रूप में पुनर्जीवित करना, LLM-आधारित SRS जनरेशन के सूक्ष्म मूल्यांकन को सक्षम बनाता है और साथ ही निष्ठा (faithfulness), सूचना प्रतिधारण (information retention) और आर्टिफैक्ट पूर्णता (artifact completeness) के बीच महत्वपूर्ण ट्रेड-ऑफ्स को उजागर करता है।

Ragib Shahariar Ayon, Rayed Fahmi, Sumon Biswas, Shibbir Ahmed2026-07-21
🤖 AI

Exact Network Surgery: Functional Invariance and Gradient Plasticity in Reactive Computational Graphs

यह शोध पत्र "एक्ज़ैक्ट नेटवर्क सर्जरी" (Exact Network Surgery) प्रस्तुत करता है, जो एक औपचारिक ढांचा और जूलिया-आधारित (Julia-based) कार्यान्वयन है जो संरचनात्मक स्थानीयता (structural locality) और ग्रेडिएंट एस्केप गुणों को सिद्ध करके लाइव कम्प्यूटेशनल ग्राफ्स में प्रशिक्षित रेसिडुअल ब्लॉक्स के बिट-एक्ज़ैक्ट, इन-प्लेस इंसर्शन को सक्षम बनाता है, जिससे सीखी गई कार्यात्मकताओं को बाधित किए बिना या पूर्ण प्रशिक्षण पुनर्गठन की आवश्यकता के बिना क्षमता विस्तार संभव हो पाता है।

Abdallah Khemais (ISITCOM, University of Sousse)2026-07-21
🤖 AI

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

यह शोध पत्र एक वीआर-आधारित मानव-रोबोट इंटरेक्शन फ्रेमवर्क प्रस्तुत करता है जो सिम्युलेटेड खतरनाक वातावरण में खतरों की पहचान करने और उन्हें एनोटेट करने के लिए विजन लैंग्वेज मॉडल्स का लाभ उठाता है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण बिना एनोटेशन वाले बेसलाइन की तुलना में ऑपरेटर की स्थितिजन्य जागरूकता, स्पष्टता और सहजता को महत्वपूर्ण रूप से बढ़ाता है।

Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek2026-07-21
🤖 AI

Just A Rather Very Intelligent Spoken Agent

यह शोध पत्र JarvisBench प्रस्तुत करता है, जो एक नया बेंचमार्क और मॉड्यूलर प्रोटोटाइप है जिसे ट्रेस-ग्राउंडेड प्रतिक्रियाओं और सक्रिय मार्गदर्शन के माध्यम से रीयल-टाइम उपयोगकर्ता संपर्क, कार्य पारदर्शिता और समग्र प्रदर्शन में सुधार करके लॉन्ग-होरिज़न AI एजेंट वर्कफ़्लो को बढ़ाने में 'ऑलवेज-ऑन', स्पोकन मीडिएटर्स की प्रभावशीलता का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Chen Chen, Zhehuai Chen2026-07-21
🤖 machine learning

Privacy Cost as Equity Input: A Group Fairness Criterion for Differentially Private Machine Learning

यह शोध पत्र प्राइवेसी-कॉस्ट इक्विटी रेश्यो (PCER) का प्रस्ताव करता है, जो एक व्यावहारिक पोस्ट-हॉक निष्पक्षता मीट्रिक है जो मशीन लर्निंग में डिफरेंशियल प्राइवेसी का मूल्यांकन करने के लिए एक समूह के भविष्य कहने वाले लाभों और उसके गोपनीयता जोखिम लागतों के बीच संतुलन बनाता है, जिससे उन छिपे हुए विसंगतियों का पता चलता है जैसे कि संरक्षित समूहों द्वारा सामना किया जाने वाला "दोहरा नुकसान" जिसे पारंपरिक परिणाम-आधारित मीट्रिक पहचानने में विफल रहते हैं।

Rakshit Naidu2026-07-21
🤖 AI

TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos

TellTale एक टेक्स्ट-ओनली दृष्टिकोण है जो साक्षात्कार वीडियो में द्वंद्व (ambivalence) और हिचकिचाहट (hesitancy) को पहचानने के लिए है, जो फाइन-ट्यून्ड मल्टी-इंस्टेंस LoRA टेक्स्ट एनकोडर को ज़ीरो-शॉट LLM जज के साथ जोड़कर अत्याधुनिक प्रदर्शन प्राप्त करता है, और BAH डेटासेट पर विज़न-आधारित बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Abdel-Karim Al-Tamimi, Ali Rodan2026-07-21
🤖 AI

TopoTuner: Topological Finetuning of Large Language Models

TopoTuner एक टोपोलॉजी-गाइडेड फाइन-ट्यूनिंग फ्रेमवर्क है जो पर्सिस्टेंस डायग्राम्स के बीच वासरस्टीन दूरियों (Wasserstein distances) का लाभ उठाकर अटेंशन प्रोजेक्शन मैट्रिसेस को पहचानने और चुनिंदा रूप से फ्रीज करने में सक्षम बनाता है, जिससे बड़े भाषा मॉडलों का कुशल और पुन: प्रयोज्य अनुकूलन संभव होता है जो केवल 1-2% पैरामीटर्स को प्रशिक्षित करते हुए LoRA से बेहतर प्रदर्शन करता है।

Abdulkadir Erol, Yash Mahajan, Vepaul Hariprashad, Baha Rababah, Santu Karmaker, Cuneyt G. Akcora, Mubarak Shah2026-07-21
🤖 AI

Position: Explanation Stability Is a Property of the Model Method Pair, Not the Model

यह स्थिति पत्र (position paper) तर्क देता है कि स्पष्टीकरण स्थिरता (explanation stability) किसी मॉडल का अंतर्निहित गुण नहीं है, बल्कि विशिष्ट मॉडल-विधि युग्म (model-method pair) की एक उभरती हुई विशेषता है, जिसके लिए सुरक्षा या विश्वसनीयता के भ्रामक दावों से बचने हेतु क्रॉस-मेथड सत्यापन (cross-method validation) आवश्यक है।

Kabilan Elangovan, Daniel Ting2026-07-21
🤖 AI

DS@GT ARC at eRisk 2026: Hybrid Multi-Agent LLM System with Structured Algorithmic Guidance for Conversational Depression Screening

DS@GT टीम ने एक हाइब्रिड मल्टी-एजेंट सिस्टम विकसित करके eRisk 2026 कन्वर्सेशनल डिप्रेशन स्क्रीनिंग चैलेंज में शीर्ष-3 रैंकिंग हासिल की, जो एक संरचित एल्गोरिद्मिक ढांचे को एक ओपन-सोर्स Gemma 27B मॉडल के साथ जोड़ता है ताकि सटीकता और लागत-दक्षता दोनों में अधिक महंगी प्रोप्रायटरी बेसलाइन से बेहतर प्रदर्शन किया जा सके।

Victor Gong, David Guecha2026-07-21