💬 NLP

SQUiD: Synthesizing Relational Databases from Unstructured Text

यह शोध पत्र SQUiD को पेश करता है, जो एक नवीन न्यूरोसिम्बोलिक ढांचा (neurosymbolic framework) है जो असंरचित पाठ (unstructured text) से रिलेशनल डेटाबेस स्कीमा को स्वचालित रूप से संश्लेषित करने और तालिकाओं को भरने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो मौजूदा बेसलाइनों की तुलना में विविध डेटासेट्स पर बेहतर प्रदर्शन प्रदर्शित करता है।

Mushtari Sadia, Zhenning Yang, Yunming Xiao, Ang Chen, Amrita Roy Chowdhury2026-03-03
💬 NLP

VeriTrail: Closed-Domain Hallucination Detection with Traceability

यह शोध पत्र VeriTrail को प्रस्तुत करता है, जो कि एकल-चरण और बहु-चरण जनरेटिव प्रक्रियाओं में मध्यवर्ती आउटपुट का विश्लेषण करके गैर-निष्ठापूर्ण सामग्री के मूल स्रोत की पहचान करने और क्लोज्ड-डोमेन मतिभ्रम (hallucinations) का पता लगाने और उनका पता लगाने के लिए डिज़ाइन की गई पहली विधि और डेटासेट है।

Dasha Metropolitansky, Jonathan Larson2026-03-03
💬 NLP

RedTeamCUA: Realistic Adversarial Testing of Computer-Use Agents in Hybrid Web-OS Environments

यह शोध पत्र RedTeamCUA को प्रस्तुत करता है, जो एक हाइब्रिड वेब-ओएस सैंडबॉक्स और RTC-Bench बेंचमार्क के साथ एक नवीन प्रतिकूल परीक्षण ढांचा (adversarial testing framework) है, जो यह प्रकट करता है कि वर्तमान कंप्यूटर-उपयोग एजेंट अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन हमलों के प्रति अत्यधिक संवेदनशील बने हुए हैं, और अत्याधुनिक मॉडलों में भी महत्वपूर्ण सफलता दर प्रदर्शित करते हैं।

Zeyi Liao, Jaylen Jones, Linxi Jiang, Yuting Ning, Eric Fosler-Lussier, Yu Su, Zhiqiang Lin, Huan Sun2026-03-03
💬 NLP

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

यह शोधपत्र सिटीलेंस (CityLens) का परिचय देता है, जो 17 वैश्विक शहरों के एक मल्टी-मोडल डेटासेट और 11 प्रेडिक्शन टास्क से बना एक व्यापक बेंचमार्क है, जिसका उद्देश्य विजुअल डेटा से विविध शहरी सामाजिक-आर्थिक संकेतकों की भविष्यवाणी करने में 17 अत्याधुनिक लार्ज विजन-लैंग्वेज मॉडल्स की क्षमताओं और सीमाओं का मूल्यांकन करना है।

Tianhui Liu, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Jie Feng, Yong Li, Pan Hui2026-03-03
💬 NLP

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

यह शोध पत्र OmniSpatial को प्रस्तुत करता है, जो संज्ञानात्मक मनोविज्ञान पर आधारित एक व्यापक बेंचमार्क है जिसमें चार प्रमुख श्रेणियों में 8.4K से अधिक एनोटेटेड नमूने शामिल हैं, जो वर्तमान विजन-लैंग्वेज मॉडलों की स्थानिक तर्क क्षमताओं में महत्वपूर्ण सीमाओं को प्रकट करता है और उन्हें संबोधित करने के लिए PointGraph और SpatialCoT जैसी रणनीतियों का अन्वेषण करता है।

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi2026-03-03
💬 NLP

Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering

यह शोध पत्र मेटा-एडेप्टिव प्रॉम्प्ट डिस्टिलेशन (Meta-Adaptive Prompt Distillation) का प्रस्ताव करता है, जो एक मेटा-लर्निंग फ्रेमवर्क है जो एक अटेंशन-मैपर मॉड्यूल के माध्यम से कार्य-प्रासंगिक विजुअल फीचर्स को एडेप्टेबल सॉफ्ट प्रॉम्प्ट्स में डिस्टिल करता है, जो लार्ज मल्टीमॉडल मॉडल्स में फ्यू-शॉट विजुअल क्वेश्चन अनस्वर्सिंग (Visual Question Answering) के लिए मानक इन-कॉन्टेक्स्ट लर्निंग और पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग से काफी बेहतर प्रदर्शन करता है।

Akash Gupta, Amos Storkey, Mirella Lapata2026-03-03
💬 NLP

VINCIE: Unlocking In-context Image Editing from Video

यह शोध पत्र VINCIE को प्रस्तुत करता है, जो एक ब्लॉक-कॉज़ल डिफ्यूजन ट्रांसफार्मर है जिसे तीन प्रॉक्सी कार्यों के माध्यम से विशेष रूप से वीडियो-व्युत्पन्न मल्टीमॉडल अनुक्रमों पर प्रशिक्षित किया गया है, जो इन-कॉन्टेक्स्ट इमेज एडिटिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है और मल्टी-कॉन्सेप्ट कंपोज़िशन एवं स्टोरी जनरेशन में मजबूत क्षमता प्रदर्शित करता है।

Leigang Qu, Feng Cheng, Ziyan Yang, Qi Zhao, Shanchuan Lin, Yichun Shi, Yicong Li, Wenjie Wang, Tat-Seng Chua, Lu Jiang2026-03-03
💬 NLP

Equitable Electronic Health Record Prediction with FAME: Fairness-Aware Multimodal Embedding

यह शोध पत्र FAME को प्रस्तुत करता है, जो एक निष्पक्षता-जागरूक मल्टीमॉडल एम्बेडिंग फ्रेमवर्क है, जो उनकी निष्पक्षता योगदानों के आधार पर मोडैलिटीज को स्पष्ट रूप से भारित करके और उपसमूह परिणामों को संतुलित करने के लिए एक साइन-अग्नोस्टिक एकत्रीकरण पद्धति का उपयोग करके इलेक्ट्रॉनिक हेल्थ रिकॉर्ड कार्यों में पूर्वानुमान प्रदर्शन और समानता दोनों को अनुकूलित करता है।

Nikkie Hooman, Zhongjie Wu, Eric C. Larson, Mehak Gupta2026-03-03
💬 NLP

When Does Divide and Conquer Work for Long Context LLM? A Noise Decomposition Framework

यह शोध पत्र एक शोर अपघटन (noise decomposition) ढांचे का प्रस्ताव करता है जो लॉन्ग-कॉन्टेक्स्ट एलएलएम (LLM) विफलताओं को टास्क, मॉडल और एग्रीगेटर शोर में वर्गीकृत करता है, यह प्रदर्शित करते हुए कि मल्टी-एजेंट चंकिंग रणनीतियां इन विशिष्ट त्रुटि स्रोतों को प्रभावी ढंग से प्रबंधित करके सिंगल-शॉट उन्नत मॉडलों से बेहतर प्रदर्शन कर सकती हैं।

Zhen Xu, Shang Zhu, Jue Wang, Junlin Wang, Ben Athiwaratkun, Chi Wang, James Zou, Ce Zhang2026-03-03
💬 NLP

Cognitive models can reveal interpretable value trade-offs in language models

यह शोध पत्र यह प्रदर्शित करता है कि मानव निर्णय लेने के संज्ञानात्मक मॉडलों को भाषा मॉडलों पर लागू करने से व्याख्या योग्य मूल्य व्यापार-संबंधों (value trade-offs) का पता चलता है, जो यह दर्शाता है कि तर्क संबंधी प्रयास, प्रॉम्प्ट्स और पोस्ट-ट्रेनिंग गतिकी किस प्रकार व्यवस्थित रूप से मॉडल के व्यवहार को आकार देते हैं और विकास के दौरान इन व्यापार-संबंधों के निदान और नियंत्रण के लिए एक लचीला ढांचा प्रदान करते हैं।

Sonia K. Murthy, Rosie Zhao, Jennifer Hu, Sham Kakade, Markus Wulfmeier, Peng Qian, Tomer Ullman2026-03-03