💬 NLP

Large Language Models Do Not Always Need Readable Language

यह शोध पत्र "BabelTele" को प्रस्तुत करता है, जो एक मॉडल-केंद्रित पाठ्य प्रतिनिधित्व है जो उच्च सूचना घनत्व और अर्थपूर्ण निष्ठा प्राप्त करने के लिए मानवीय पठनीयता का त्याग करता है, यह प्रदर्शित करते हुए कि बड़े भाषा मॉडल कुशल मशीन-से-मशीन संचार के लिए संक्षिप्त, गैर-मानक स्वरूपों को प्रभावी ढंग से उत्पन्न और व्याख्या कर सकते हैं।

Jiayi Zhu, Haoxuan Peng, Junxi Wang, Liang Ke, Chen Zhang, Linfeng Zhang2026-06-19
🤖 AI

PSCT-Net: Geometry-Aware Pediatric Skull CT Reconstruction via Differentiable Back-Projection and Attention-Guided Refinement

PSCT-Net एक ज्यामिति-जागरूक (geometry-aware) डीप लर्निंग फ्रेमवर्क है जो गहराई की अस्पष्टता को दूर करने और हड्डी की सीमा की सटीकता में सुधार करने के लिए डिफरेंशिएबल बैक-प्रोजेक्शन, अटेंशन-गाइडेड रिफाइनमेंट और एक बायडायरेक्शनल मंबा (Bidirectional Mamba) मॉड्यूल को एकीकृत करके स्पार्स द्वि-तलीय (bi-planar) एक्स-रे से 3D बाल चिकित्सा खोपड़ी CT का पुनर्निर्माण करता है, जबकि यह बाल-विशिष्ट प्रशिक्षण डेटा की कमी को दूर करने के लिए एक विशेष बाल चिकित्सा डेटासेट पेश करता है।

Dong Yeong Kim, Jaewon Choi, Youmin Shin, Jungyu Lee, Myeongseop Kim, Jinwook Choi, Joo Whan Kim, Young-Gon Kim2026-06-19✓ Author reviewed
🤖 AI

Co-policy: Responsive Human-Robot Co-Creation for Musical Performances

यह शोध पत्र को-पॉलिसी (Co-policy) प्रस्तुत करता है, जो एम्बोडीड मानव-रोबोट संगीतमय सह-सृजन के लिए एक ऐसा ढांचा है जो सिमेंटिक इंटेंट ग्राउंडिंग के लिए एक फाइन-ट्यून्ड Qwen-vl प्लानर को रीयल-टाइम, भौतिक रूप से निष्पादन योग्य पूरक संगीतमय प्रतिक्रियाएं उत्पन्न करने के लिए एक गॉसियन-मिक्सचर विज़ुओमोटर पॉलिसी के साथ एकीकृत करता है।

Xuetao Li, Wenke Huang, Mang Ye, Zijian Liu, Jinhua Xie, Jifeng Xuan, Miao Li2026-06-19
🤖 AI

Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models

यह शोध पत्र STORM को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), स्थानिक-जागरूक (spatial-aware) टोकन रिडक्शन फ्रेमवर्क है जो ग्रिड टोपोलॉजी और पड़ोस की सुसंगतता (neighborhood coherence) को बनाए रखने के लिए स्थानीय बाधाओं को लागू करके संरचनात्मक रूप से संवर्धित मम्बा (Mamba) मॉडलों के प्रदर्शन पतन (performance collapse) को हल करता है।

Jindi Lv, Aoyu Li, Yuhao Zhou, Zheng Zhu, Xiaofeng Wang, Qing Ye, Yueqi Duan, Wentao Feng, Jiancheng Lv2026-06-19
🤖 AI

Speeding up the annotation process in semantic segmentation industrial applications

यह शोध पत्र एक अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि अनसुपरवाइज्ड कंप्यूटर विजन एल्गोरिदम का प्री-एनोटेशन स्टेप के रूप में उपयोग करने से उच्च-रिज़ॉल्यूशन वाले औद्योगिक स्टील माइक्रोस्ट्रक्चर इमेजेस के लिए सिमेंटिक सेगमेंटेशन लेबलिंग समय में लगभग 78% (170 से घटाकर 37 घंटे) की कमी आती है, और साथ ही अपने प्रकार के सबसे बड़े सार्वजनिक डेटासेट और एक प्रमाणित डीप लर्निंग मॉडल को भी मुक्त करता है।

Marta Fernandez-Moreno, Margarita Guerrero, Rosalia Rementeria, Pablo Mesejo, Raul Moreno2026-06-19
🤖 AI

Triangular Consistency as a Universal Constraint for Learning Optical Flow

यह शोध पत्र "त्रिकोणीय निरंतरता" (triangular consistency) का प्रस्ताव करता है, जो एक सार्वभौमिक, आर्किटेक्चर-अज्ञेयवादी बाधा है जो बिना किसी अतिरिक्त एनोटेशन या कम्प्यूटेशनल ओवरहेड के, सुपरवाइज्ड, अनसुपरवाइज्ड और ट्रांसफर सेटिंग्स में सीखने के प्रदर्शन को सुधारने के लिए संयोजित ऑप्टिकल फ्लो के बीच ज्यामितीय निरंतरता लागू करती है।

Yi Xiao, Carlos Rodriguez Coronel, Jing Zhan, Haniyeh Ehsani Oskouie, Alex Wong, Dong Lao2026-06-19
⚡ electrical engineering

SIMBA: ABidirectional Retrieval Forward Simulation Framework for Modeling FY-4A GIIRS Hyperspectral Infrared Radiances Toward NWP Applications

यह शोध पत्र SIMBA को प्रस्तुत करता है, जो एक नवीन द्विदिश (bidirectional) डीप लर्निंग फ्रेमवर्क है जो चक्र-संगति बाधाओं (cycle-consistency constraints) और एक द्विदिश मंबा (Mamba) आर्किटेक्चर का उपयोग करके FY-4A GIIRS डेटा के लिए वायुमंडलीय प्रोफाइल पुनर्प्राप्ति और हाइपरस्पेक्ट्रल इन्फ्रारेड रेडिएंस सिमुलेशन को संयुक्त रूप से निष्पादित करता है, ताकि संख्यात्मक मौसम पूर्वानुमान अनुप्रयोगों के लिए मौजूदा विधियों से बेहतर प्रदर्शन किया जा सके।

Jingdong Shen, Fu Wang*, Qifeng Lu, Hao Huang, Chunqiang Wu, Chi Yang, Xiaofang Liu2026-06-19
🤖 AI

Advancing DialNav through Automatic Embodied Dialog Augmentation

DialNav फ्रेमवर्क को सीमित करने वाली डेटा की कमी को दूर करने के लिए, यह शोध पत्र 238K स्वचालित रूप से जनरेट किए गए संवाद एपिसोड के एक बड़े पैमाने के संग्रह—RAINbow डेटासेट—के साथ-साथ दोहरी-रणनीति प्रशिक्षण और एक लोकलाइजेशन मॉडल को प्रस्तुत करता है, जो सामूहिक रूप से देखे गए (seen) और अनदेखे (unseen) नेविगेशन स्प्लिट्स दोनों पर सफलता दर में महत्वपूर्ण सुधार के साथ एक नया स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।

Leekyeung Han, Sangwon Jung, Hyunji Min, Jinseong Jeong, Minyoung Kim, Paul Hongsuck Seo2026-06-19
🤖 AI

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

यह शोध पत्र ROSE प्रस्तुत करता है, जो एक नियंत्रित बेंचमार्क है यह प्रदर्शित करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (multimodal large language models) विजुअल काउंटिंग और कॉन्टेक्स्ट-कंडीशन्ड एक्शन्स के बीच एक महत्वपूर्ण प्रदर्शन अंतराल से जूझते हैं, जो उच्च मानव प्रदर्शन के बावजूद साझा विजुअल साक्ष्यों को कार्य-विशिष्ट व्यवहारों में अनुवादित करने में एक स्पष्ट बाधा को उजागर करता है।

Yihao Wang, Zijian He, Jie Ren, Keze Wang2026-06-19
🤖 AI

The Algorithmic-Human Manager: AI, Apps, and Workers in the Indian Gig Economy

यह शोध पत्र भारत की ब्लू-कॉलर गिग अर्थव्यवस्था पर एआई-संचालित एल्गोरिद्मिक प्रबंधन के दोहरे प्रभाव की जांच करता है, जो यह प्रकट करता है कि कैसे अपारदर्शी स्वचालित प्रणालियाँ परिचालन दक्षता तो पैदा करती हैं परंतु निष्पक्षता और श्रमिक गरिमा को कमजोर करती हैं, और अंततः तकनीकी दक्षता के साथ मानवीय जवाबदेही को संतुलित करने के लिए एक हाइब्रिड "एल्गोरिद्मिक-मानवीय प्रबंधक" ढांचे की वकालत करता है।

Omir Kumar, Krishnan Narayanan2026-06-19