← नवीनतम पेपर
🤖 AI

VLM4Rec: Multimodal Semantic Representation for Recommendation with Large Vision-Language Models

VLM4Rec एक हल्का रिकमेंडेशन फ्रेमवर्क है जो बड़े विजन-लैंग्वेज मॉडल्स का लाभ उठाकर आइटम छवियों को सिमेंटिक अलाइनमेंट के लिए स्पष्ट प्राकृतिक-भाषा विवरणों में बदल देता है, जो यह प्रदर्शित करता है कि उच्च-गुणवत्ता वाला सिमेंटिक प्रतिनिधित्व मल्टीमॉडल रिकमेंडेशन कार्यों में जटिल फीचर फ्यूजन से बेहतर प्रदर्शन करता है।

मूल लेखक: Ty Valencia, Burak Barlas, Varun Singhal, Ruchir Bhatia, Wei Yang

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ty Valencia, Burak Barlas, Varun Singhal, Ruchir Bhatia, Wei Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अस्त-व्यस्त डिपार्टमेंट स्टोर में घूम रहे हैं। अलमारियाँ लाखों वस्तुओं से भरी हुई हैं, लेकिन लेबल बहुत छोटे, धुंधले हैं और अक्सर केवल "नीली शर्ट" या "लाल ड्रेस" ही कहते हैं। आप किसी विशेष अवसर के लिए, जैसे कि "समर बीच वेडिंग" (गर्मियों की बीच वेडिंग) के लिए एक आदर्श पोशाक खोजने की कोशिश कर रहे हैं, लेकिन स्टोर का कंप्यूटर सिस्टम आपकी मदद करने में संघर्ष कर रहा है।

यह वह समस्या है जिसे VLM4Rec हल करने की कोशिश करता है।

पुराना तरीका: "पिक्सेल मैचर" (Pixel Matcher)

पारंपरिक रूप से, अनुशंसा प्रणाली (जैसे Amazon या Netflix पर) एक सुपर-फास्ट विजुअल स्कैनर की तरह काम करती है।

  • यह कैसे काम करता है: यदि आप लाल रंग की ड्रेस खरीदते हैं, तो कंप्यूटर उस लाल ड्रेस के बिल्कुल समान दिखने वाली अन्य वस्तुओं को खोजता है। यह पिक्सेल, रंगों और आकारों की तुलना करता है।
  • समस्या: यह भीड़ में अपने दोस्त को केवल उसकी शर्ट के रंग को देखकर खोजने जैसा है। दो लोग एक ही लाल शर्ट पहन सकते हैं, लेकिन एक निर्माण श्रमिक हो सकता है और दूसरा बैलेरीना। कंप्यूटर "लाल शर्ट" देखता है और सोचता है कि वे एक ही हैं, लेकिन आप जानते हैं कि वे पूरी तरह से अलग हैं।
  • परिणाम: सिस्टम ऐसी वस्तुएं सुझाता है जो दिखने में समान होती हैं लेकिन वास्तव में आपकी आवश्यकताओं के अनुकूल नहीं होतीं (जैसे कि आपकी समर ड्रेस के समान रंग होने के कारण भारी विंटर कोट का सुझाव देना)।

नया तरीका: "अनुवादक" (The Translator - VLM4Rec)

लेखकों ने महसूस किया कि समस्या यह नहीं है कि हम चित्रों और टेक्स्ट को कैसे मिलाते हैं; समस्या यह है कि कंप्यूटर द्वारा मिलान करने से पहले चित्रों को मानव भाषा में "अनुवादित" नहीं किया जाता है।

उन्होंने VLM4Rec (विज़न-लैंग्वेज मॉडल फॉर रिकमेंडेशन) नामक एक सिस्टम बनाया। इसे एक कैमरे और डिक्शनरी वाले सुपर-स्मार्ट पर्सनल शॉपर के रूप में सोचें।

यह तीन सरल चरणों में कैसे काम करता है:

1. "अनुवादक" चरण (विजुअल सिमेंटिक ग्राउंडिंग)

केवल उत्पाद की छवि के पिक्सेल को देखने के बजाय, सिस्टम एक शक्तिशाली AI (जिसे लार्ज विजन-लैंग्वेज मॉडल या LVLM कहा जाता है) का उपयोग करके वस्तु का एक पूर्ण वाक्य में वर्णन करता है।

  • पुराना तरीका: कंप्यूटर एक जूते की तस्वीर देखता है और कहता है, "लाल, चमड़ा, साइज 10।"
  • VLM4Rec का तरीका: AI उस जूते को देखता है और एक विस्तृत नोट लिखता है: "यह मजबूत, लाल चमड़े के हाइकिंग बूट्स की एक जोड़ी है जिसमें मोटे सोल हैं, जो कीचड़ भरे रास्तों और ठंडे मौसम के लिए एकदम सही हैं।"

यह छवि को एक समृद्ध कहानी में बदल देता है जो वस्तु की शैली, सामग्री और उद्देश्य को समझाती है।

2. "लाइब्रेरी" चरण (सिमेंटिक रिप्रेजेंटेशन)

अब, वस्तु को एक धुंधली छवि या छोटे शीर्षक के रूप में संग्रहीत करने के बजाय, सिस्टम इस विस्तृत कहानी को एक गणितीय "फिंगरप्रिंट" (एम्बेडिंग) के रूप में संग्रहीत करता है।

  • कल्पना करें कि स्टोर में अब हर वस्तु के पास एक लाइब्रेरी कार्ड है।
  • हाइकिंग बूट्स के लिए कार्ड केवल "लाल जूता" नहीं कहता। यह कहता है "आउटडोर, रग्ड, कोल्ड वेदर।"
  • एक फैंसी लाल ड्रेस के लिए कार्ड कहता है "फॉर्मल, एलिगेंट, इवनिंग वियर।"

भले ही बूट्स और ड्रेस दोनों लाल हों, लेकिन उनका "फिंगरप्रिंट" अब बहुत अलग है क्योंकि उनका अर्थ अलग है।

3. "मैचमेकर" चरण (सिमेंटिक मैचिंग)

जब आप कोई सिफारिश चाहते हैं, तो सिस्टम आपके इतिहास को देखता है।

  • यदि आपने हाल ही में "डेनिम जैकेट" और "जींस" खरीदी है, तो सिस्टम जानता है कि आपको "कैजुअल, रोजमर्रा के कपड़े" पसंद हैं।
  • इसके बाद यह लाइब्रेरी में समान "अर्थ वाले कार्डों" वाली वस्तुओं की खोज करता है।
  • यह "कैजुअल कैनवस स्नीकर" (जो आपकी शैली से मेल खाता है) को ढूंढ लेता है, बजाय "फॉर्मल रेड हील" (जो लाल दिखता है लेकिन आपके वाइब से मेल नहीं खाता) के।

यह बेहतर क्यों है? ("रेसिपी" की उपमा)

एक अनुशंसा प्रणाली बनाने को केक बनाने की तरह समझें।

  • पुराना दृष्टिकोण (फ्यूजन): शेफ दो खराब सामग्रियों को पूरी तरह से मिलाने का तरीका खोजने की कोशिश कर रहे थे: "रॉ विजुअल डेटा" (जो केवल एक तस्वीर है) और "छोटे शीर्षक" (जो बहुत संक्षिप्त हैं)। उन्होंने इन खराब सामग्रियों को मिलाने के लिए फैंसी मिक्सर (जटिल एल्गोरिदम) बनाने में वर्षों बिता दिए, इस उम्मीद में कि परिणाम स्वादिष्ट होगा।
  • VLM4Rec दृष्टिकोण: लेखकों ने महसूस किया, "रुको, हम खराब सामग्रियों को क्यों मिला रहे हैं?" इसके बजाय, उन्होंने कच्ची तस्वीर ली और उसे पहले एक स्वादिष्ट, उच्च-गुणवत्ता वाली सामग्री (विस्तृत विवरण) में पकाया
  • परिणाम: एक बार जब आपके पास उच्च-गुणवत्ता वाली सामग्री (समृद्ध विवरण) होती है, तो आपको एक फैंसी मिक्सर की आवश्यकता नहीं होती है। आप बस एक साधारण चम्मच (एक बुनियादी मिलान एल्गोरिदम) का उपयोग करके इसे अपने इतिहास के साथ मिला सकते हैं, और केक अद्भुत स्वाद देगा।

मुख्य निष्कर्ष

पेपर की मुख्य खोज आश्चर्यजनक है: विवरण की गुणवत्ता मिलान करने वाली मशीन की जटिलता से अधिक महत्वपूर्ण है।

उन्होंने अपने सिस्टम का परीक्षण कई जटिल, हाई-टेक तरीकों के विरुद्ध किया जो छवियों और टेक्स्ट को चतुर तरीके से "फ्यूज" करने की कोशिश करते थे। सरल सिस्टम जिसने पहले छवियों को अच्छी अंग्रेजी विवरणों में अनुवादित किया, वह हर बार जीत गया।

संक्षेप में: कंप्यूटर को केवल एक तस्वीर दिखाने और यह अनुमान लगाने के लिए न कहें कि आपको क्या पसंद है। कंप्यूटर को पहले तस्वीर को शब्दों में वर्णित करना सिखाएं। एक बार जब कंप्यूटर वस्तु की कहानी समझ जाता है, तो एकदम सही मिलान ढूंढना आसान हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →