IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models
यह शोधपत्र IntentVLM को प्रस्तुत करता है, जो फॉरवर्ड-इनवर्स मॉडलिंग से प्रेरित एक नवीन दो-चरणीय वीडियो-भाषा ढांचा है, जो कार्य को लक्ष्य उम्मीदवार पीढ़ी और संरचित चयन में विभाजित करके ओपन-वोकेबुलरी मानव इरादा पहचान (human intention recognition) में अत्याधुनिक परिणाम प्राप्त करता है, जिससे मतिभ्रम (hallucinations) में उल्लेखनीय कमी आती है और मानव प्रदर्शन के समान स्तर तक पहुँचता है।