💬 NLP

FirstPass: Grounding AI Scientific Judgment in Multi-Round Editorial Outcomes

यह शोध पत्र FirstPass प्रस्तुत करता है, जो Nature Communications के 3,668 बहु-चरणीय सहकर्मी-समीक्षा (पीयर-रिव्यू) संवादों पर निर्मित एक डेटासेट और फाइन-ट्यून किया गया मॉडल है, जो रिस्पॉन्स-ओनली लॉस मास्किंग और पांच वैज्ञानिक डोमेनों में पारदर्शी, पुनरावृत्ति संवाद डेटा का लाभ उठाकर संपादकीय परिणामों की भविष्यवाणी करने और वैज्ञानिक समीक्षाएं उत्पन्न करने में मौजूदा एआई प्रणालियों से काफी बेहतर प्रदर्शन करता है।

Prabhjot Singh, Somnath Luitel, Manmeet Singh, Josh Durkee2026-06-23
💬 NLP

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

यह शोध पत्र PuMVR प्रस्तुत करता है, जो बहुभाषी विजन-लैंग्वेज मॉडल्स में महत्वपूर्ण ऑर्थोग्राफिक पूर्वाग्रह को मापने वाला पहला बेंचमार्क है, यह प्रदर्शित करते हुए कि ये सिस्टम पंजाबी की तीन सक्रिय लिपियों (गुरमुखी, शाहमुखी और रोमन) के बीच प्रदर्शन में भारी अंतर और असंगत तर्क प्रदर्शित करते हैं, जिससे इस धारणा को चुनौती मिलती है कि एक भाषा का अर्थ एक एकल लेखन प्रणाली है।

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina2026-06-23
🤖 AI

TriMotion: Modality-Agnostic Camera Control for Video Generation

ट्रिमोटion (TriMotion) एक मोडैलिटी-अज्ञेय (modality-agnostic) फ्रेमवर्क है जो एक नए डेटासेट और लेटेंट कंसिस्टेंसी ऑब्जेक्टिव के माध्यम से वीडियो, पोज़ और टेक्स्ट इनपुट्स को एक साझा मोशन एम्बेडिंग स्पेस में एकीकृत करता है, जिससे विषम उपयोगकर्ता इनपुट्स के माध्यम से उच्च-गुणवत्ता वाले, लचीले कैमरा-नियंत्रित वीडियो जनरेशन को सक्षम बनाया जा सके।

Seunghyun Shin, Jifei Song, Wooseok Jeon, Hae-Gon Jeon, Jiankang Deng2026-06-23
🤖 AI

Formally Verified Code Synthesis for Structured Data Translation in a Medical Internet of Things

यह शोध पत्र एक औपचारिक रूप से सत्यापित, LLM-संचालित विकासवादी कोड संश्लेषण प्रणाली प्रस्तुत करता है जो मेडिकल IoT डिवाइस डेटा (जैसे पल्स ऑक्सीमीटर JSON स्कीमा) और FHIR मानक के बीच कम लागत वाला, विश्वसनीय ट्रांसलेशन कोड विश्वसनीय रूप से उत्पन्न करती है, जो पूर्व-निर्धारित आवश्यकताओं का कड़ाई से पालन सुनिश्चित करती है।

Colin Samplawski, Adam D. Cobb2026-06-23
🤖 AI

GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling

ग्राउंडशॉट (GroundShot) एक प्रशिक्षण-मुक्त (training-free), मॉडल-अज्ञेय (model-agnostic) फ्रेमवर्क है जो शॉट क्रम को गतिशील रूप से शेड्यूल करके और एंटिटी संदर्भों को ग्राउंड और सत्यापित करने के लिए एक ऑनलाइन एंटिटी-स्तरीय विजुअल मेमोरी बनाए रखकर, दृश्य रूप से सुसंगत मल्टी-शॉट लॉन्ग वीडियो जनरेशन को बढ़ाता है, जिससे शॉट्स के बीच विजुअल ड्रिफ्ट (visual drift) को रोका जा सके।

Yixuan Lai, Tianjia Shao, Kun Zhou, Weijia Dou, Siyu Zhu, Jingdong Wang2026-06-23
🤖 AI

Process-Reward Tactic Evolution for Long-Horizon Bioinformatics Workflows

यह शोध पत्र प्रोसेस-रिवॉर्ड टैक्टिक इवोल्यूशन (Process-Reward Tactic Evolution) प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो सत्यापित गैलेक्सी वर्कफ़्लो निष्पादन ट्रेसेस (Galaxy workflow execution traces) को एक पुन: प्रयोज्य टैक्टिक लाइब्रेरी में संकुचित करता है ताकि मौजूदा बेसलाइनों की तुलना में जटिल, दीर्घकालिक बायोइन्फॉर्मेटिक्स कार्यों को पूरा करने में एलएलएम (LLM) एजेंटों की विश्वसनीयता, जैविक शुद्धता और दक्षता में उल्लेखनीय सुधार किया जा सके।

Lingzhi Yang, Yubo Fan, Song Wu, Gilchan Park2026-06-23
🤖 AI

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA एक वास्तविक समय का ढांचा है जो एक अटेंशन-एनहैंस्ड LSTM और टेम्पोरल स्टेबिलाइज़ेशन मॉड्यूल के माध्यम से सांकेतिक भाषा के इशारों को अर्थपूर्ण निर्देशों में परिवर्तित करके मानव-रोबोट संपर्क में सुलभता को बढ़ाता है, जिससे विजन-लैंग्वेज-एक्शन मॉडल को बधिर और वाक-विकलांग उपयोगकर्ताओं के लिए रोबोटिक मैनिपुलेशन कार्यों को निष्पादित करने में सक्षम बनाया जा सके।

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe (…)2026-06-23
🤖 AI

FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

विज़न-लैंग्वेज-एक्शन मॉडल्स में फ्यू-शॉट परिदृश्यों के दौरान प्रदर्शन में होने वाली तीव्र गिरावट को संबोधित करने के लिए, यह शोध पत्र FOCA पेश करता है, जो एक भविष्योन्मुखी कंडीशनिंग फ्रेमवर्क है जो सिम्युलेटेड और वास्तविक रोबोट दोनों पर अत्याधुनिक डेटा-कुशल अनुकूलन प्राप्त करने के लिए लेटेंट-स्पेस फ्यूचर प्रेडिक्शन और गोल अलाइनमेंट का लाभ उठाता है।

Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen, Trong-Bao Ho, Doanh Le, Tan Q. Nguyen, Thien-Loc Ha, Nhiem Tran, Ba (…)2026-06-23
🤖 AI

Can LLMs Reason About Brand Ownership? An Empirical Study of Domain Attribution Intelligence

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि जबकि लार्ज लैंग्वेज मॉडल्स ब्रांड डोमेन को स्मृति से प्रभावी ढंग से सूचीबद्ध कर सकते हैं, उन्हें ब्रांड स्वामित्व को सत्यापित करने में पूर्णता के करीब सटीकता प्राप्त करने के लिए बाहरी WHOIS डेटा संवर्धन की आवश्यकता होती है, जिससे ब्रांड सुरक्षा पाइपलाइनों में फॉल्स पॉजिटिव्स (गलत सकारात्मक परिणामों) में उल्लेखनीय रूप से कमी आती है।

Fathima Mashood, Mohamed Nabeel2026-06-23
🤖 AI

A3C3: AI Algorithm and Accelerator Co-design, Co-search, and Co-generation

यह शोध पत्र A3C3 प्रस्तुत करता है, जो पारंपरिक, पृथक एआई सिस्टम डिज़ाइन प्रवाह की अक्षमताओं को दूर करने के लिए को-डिज़ाइन (co-design), को-सर्च (co-search) और को-जनरेशन (co-generation) के माध्यम से न्यूरल नेटवर्क आर्किटेक्चर और हार्डवेयर कार्यान्वयन को संयुक्त रूप से अनुकूलित करने वाली एक समग्र कार्यप्रणाली है।

Selin Yildirim, Yingbing Huang, Deming Chen2026-06-23