🤖 AI

Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment

यह शोध पत्र पल्मोनरी एम्बोलिज्म के निदान और पूर्वानुमान में उनके प्रदर्शन का मूल्यांकन करने के लिए INSPECT डेटासेट पर कुशल मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का उपयोग करते हुए एक बेंचमार्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि Gemma4 E4B और E2B जैसे मॉडल CTPA छवियों को इलेक्ट्रॉनिक हेल्थ रिकॉर्ड डेटा के साथ संयोजित करने पर बेहतर परिणाम प्राप्त करते हैं।

Xiangyuan Xue, Yang Yu, Yan Gao, Junyan Wang, Bin Chen, Lingyan Ruan, Ting Dang, Hong Jia2026-06-23
💻 computer science

DreamUV: Unwrap Artist-like UV by End-to-End Flow Matching

DreamUV एक फ्लो मैचिंग (Flow Matching) पर आधारित एंड-टू-एंड जनरेटिव फ्रेमवर्क है जो एक मेश-कंडीशन्ड ट्रांसपोर्ट प्रोसेस को सीखकर सीधे सीम (seams) और एक्सिस-अलाइन्ड आइलैंड्स (axis-aligned islands) उत्पन्न करता है, जिससे यह प्रोडक्शन-रेडी, आर्टिस्ट-लाइक UV लेआउट्स बनाता है और बाउंड्री-अवेयर ट्रेनिंग और मॉडल-इन-द-लूप फाइनट्यूनिंग के माध्यम से क्लासिकल ऑप्टिमाइज़ेशन विधियों की सीमाओं को दूर करता है।

Quanyuan Ruan, Jiabao Lei, Xingyi Du, Xifeng Gao2026-06-23
🤖 AI

A Differentiable Atari VCS:A Complex, Fully Known Ground Truth for Explainable AI

यह शोध पत्र जूलिया और जैक्स (JAX) में अटाारी 2600 वीडियो कंप्यूटर सिस्टम का एक डिफरेंशिएबल (differentiable), बिट-फॉर-बिट सटीक एमुलेशन पेश करता है, जो एक पूर्णतः ज्ञात, जटिल ग्राउंड ट्रुथ प्रदान करता है जो डीप रिइन्फोर्समेंट लर्निंग कार्यों के लिए एक्सप्लेनेबल एआई (XAI) के ग्रेडिएंट-आधारित तरीकों के अनुप्रयोग को सक्षम बनाता है।

Andreas Maier, Siming Bayer, Patrick Krauss2026-06-23
💬 NLP

CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories

यह शोध पत्र पात्र चित्रण के आठ जटिल आयामों का विश्लेषण करने के लिए कथाशास्त्रीय परिभाषाओं को लागू करते हुए, एलएलएम (LLM) द्वारा निर्मित और मानव-लिखित कहानियों के बीच समानताओं और अंतरों की जांच करता है, जिसका उद्देश्य यह निर्धारित करना है कि क्या एआई (AI) मॉडल मानव लेखकों के समान विविधता और गहराई वाले पात्र उत्पन्न करते हैं।

Anneliese Brei, Abhisheik Sharma, Nicholas Sanaie, Lu Wang, Snigdha Chaturvedi2026-06-23✓ Author reviewed
💻 computer science

Human and AI collaboration for pulmonary nodule segmentation

यह शोध पत्र Hi-Seg को प्रस्तुत करता है, जो सेगमेंट एनीथिंग मॉडल (SAM) का लाभ उठाने वाला एक ह्यूम-इन-द-लूप फ्रेमवर्क है, जो चिकित्सा और गैर-चिकित्सा दोनों प्रकार के कर्मियों को अत्याधुनिक डीप लर्निंग मॉडल्स और अकेले SAM वेरिएंट की तुलना में बेहतर पल्मोनरी नोड्यूल सेगमेंटेशन सटीकता और दक्षता प्राप्त करने में सक्षम बनाता है।

Hongqiao Dong, Wenhao Chi, Ruobing Liang, Xiaokui Yang, Wenhua Liang, Peng Hou, Wenjun Pu, Yipeng Zhao, Ping Chen, Haipi (…)2026-06-23
🤖 AI

Deep Learning-Based Sign Language Recognition from Videos and Cross-Lingual Translation to Indian Vernaculars

यह शोध पत्र एक दो-चरणीय डीप लर्निंग पाइपलाइन प्रस्तुत करता है जो वीडियो से अलग किए गए भारतीय सांकेतिक भाषा के संकेतों को पहचानने के लिए एक फाइन-ट्यून्ड VideoMAE ट्रांसफॉर्मर का उपयोग करता है और प्राप्त अंग्रेजी लेबल को NLLB-200 मॉडल का उपयोग करके हिंदी, तेलुगु और बंगाली में अनुवादित करता है, साथ ही एक Streamlit डेमो प्रदान करता है और एक छोटे पैमाने के डेटासेट पर प्रदर्शन की सीमाओं का विश्लेषण करता है।

Chandranath Adak, Ramesh Nandipalli2026-06-23
🤖 AI

Grounded Scaling: Why Agentic AI Needs Deterministic Environments

यह शोध पत्र तर्क देता है कि पर्यावरण नियतत्ववाद (environment determinism) एजेंटिक एआई (agentic AI) को स्केल करने के लिए एक महत्वपूर्ण, अक्सर अनदेखा किया जाने वाला बाध्यकारी अवरोध है, जो यह प्रस्तावित करता है कि गैर-नियतत्ववादी परिवेशों में लंबी श्रृंखला वाले कार्यों की सफलता तेजी से घटती है और वर्तमान स्केलिंग घर्षणों को दूर करने के लिए पर्यावरणीय निश्चितता को मापने और सुधारने हेतु एक ढांचा प्रस्तुत करता है।

Liang Ding, Xintong Wang2026-06-23
💻 computer science

Enabling Cloud-Level Accuracy in Edge AI through IoT Data Preprocessing

यह शोध पत्र यह प्रदर्शित करता है कि कच्चे IoT सेंसर डेटा को समृद्ध पाठ्य निरूपणों (textual representations) में संरचित प्रॉम्प्ट-पक्ष पूर्व-प्रसंस्करण (prompt-side preprocessing) के माध्यम से परिवर्तित करना, पर्यावरणीय निगरानी के लिए स्थानीय, एज-तैनातित लार्ज लैंग्वेज मॉडल्स की सटीकता को महत्वपूर्ण रूप से बढ़ाता है, जो क्लाउड-आधारित मॉडलों के साथ प्रदर्शन के अंतर को प्रभावी ढंग से कम करते हुए कम विलंबता (latency) बनाए रखता है।

Aygün Varol, Katarzyna Kołodziej, Łukasz Sobczak, Michał Romaszewski, Przemysław Głomb, Naser Hossein Motlagh, Mirka Lei (…)2026-06-23
🤖 machine learning

Fed-CausalDiff: Decoupled Synchronization for Federated Do-Simulation and Policy Evaluation

यह शोध पत्र Fed-CausalDiff का प्रस्ताव करता है, जो एक फेडरेटेड कॉज़ल डिफ्यूजन फ्रेमवर्क है जो वैश्विक कारण तंत्र (global causal mechanisms) को स्थानीय भ्रमकारकों (local confounders) से अलग करने के लिए डिकपल्ड सिंक्रोनाइज़ेशन का उपयोग करता है, जिससे विकेंद्रीकृत डेटा पर सटीक हस्तक्षेप संबंधी अनुमान (interventional inference) और नीति मूल्यांकन (policy evaluation) सक्षम होता है और संचार दक्षता के साथ अनुमान निष्ठा (inference fidelity) को संतुलित किया जाता है।

Pengfei Li, Mohammad Khalil2026-06-23
💬 NLP

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

यह शोध पत्र 12 कार्यों और 20 मॉडलों में मल्टीमॉडल चेन-ऑफ-थॉट रीजनिंग का व्यवस्थित मूल्यांकन करता है, जो यह प्रकट करता है कि जबकि यह जटिल तर्क क्षमता को प्रभावी ढंग से बढ़ाता है, यह अक्सर धारणा (परसेप्शन) प्रदर्शन को कम कर देता है और एक "लुक लाइट, थिंक हैवी" (कम देखना, अधिक सोचना) बाधा से ग्रस्त होता है जहाँ बढ़ी हुई मौखिक आत्म-चिंतन के बावजूद दृश्य अंतर्निरीक्षण घट जाता है।

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao2026-06-23