What Images Cannot Say: Language-Guided Olfactory Representation Learning
यह शोध पत्र SCENT को प्रस्तुत करता है, जो एक मल्टीमॉडल फ्रेमवर्क है जो विज़न-लैंग्वेज मॉडल्स से भाषा-निर्देशित सिमेंटिक डिस्क्रिप्टर्स का लाभ उठाकर दृश्य दृश्यों और इलेक्ट्रॉनिक-नोज़ संकेतों के बीच के अंतर को पाटने के लिए है, जिससे न्यूयॉर्क स्मेल्स्स (New York Smells) डेटासेट पर स्टेट-ऑफ-द-आर्ट क्रॉसमोडल रिट्रीवल और व्याख्यात्मक घ्राण प्रतिनिधित्व शिक्षण (interpretable olfactory representation learning) प्राप्त होता है।