TouchAI: Exploring human-AI perceptual alignment in touch through language model representations
यह शोध पत्र एक "गेस वॉट टेक्सटाइल" कार्य के माध्यम से बड़े भाषा मॉडलों और मानवीय स्पर्श अनुभवों के बीच संवेदी संरेखण की जांच करता है, जो यह प्रकट करता है कि हालांकि कुछ हद तक संरेखण मौजूद है, यह विभिन्न प्रकार के वस्त्रों में काफी भिन्न होता है और अक्सर मानवीय व्यक्तिपरक धारणाओं से मेल खाने में विफल रहता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: क्या AI वह "महसूस" कर सकता है जो हम महसूस करते हैं?
कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि एक रेशमी स्कार्फ (silk scarf) का अहसास एक जीन्स (jeans) की तुलना में कैसा होता है। आप रोबोट को हाथ नहीं दे सकते, इसलिए आपको इसे शब्दों के माध्यम से समझाना होगा। आप कहेंगे, "रेशम चिकना और फिसलन भरा है, जैसे पानी," और "जीन्स खुरदरी और सख्त है, जैसे रेगमाल (sandpaper)।"
इस अध्ययन ने एक सरल प्रश्न पूछा: यदि कोई इंसान यह वर्णन करता है कि कोई चीज़ कैसी महसूस होती है, तो क्या एक स्मार्ट कंप्यूटर (एक AI) उस विवरण को इतनी अच्छी तरह समझ सकता है कि वह सटीक रूप से अनुमान लगा सके कि वह वस्तु क्या है?
शोधकर्ताओं ने इस प्रोजेक्ट को "TouchAI" नाम दिया। वे यह देखना चाहते थे कि चीजों के अहसास का AI का "मानसिक मानचित्र" (mental map) हमारे मानवीय मानचित्र से कितना मेल खाता है।
प्रयोग: "अंधेरे में अनुमान लगाने वाला खेल"
इसे परखने के लिए, शोधकर्ताओं ने "Guess What Textile?" नामक एक खेल तैयार किया।
- सेटअप: एक प्रतिभागी एक डेस्क पर बैठा था जिसके सामने एक काला बॉक्स था। वह अंदर देख नहीं सकता था, केवल हाथ डाल सकता था।
- कार्य: बॉक्स के अंदर दो कपड़े थे। एक "संदर्भ" (reference) था (AI जानता था कि यह क्या है, जैसे कि सूती कपड़ा/cotton)। दूसरा "लक्ष्य" (target) था (AI इसके बारे में नहीं जानता था)।
- बातचीत: प्रतिभागी ने दोनों कपड़ों को छुआ। फिर उसे AI को उनके बीच का अंतर बताना था।
- उदाहरण: "लक्ष्य (target) कपास (cotton) के संदर्भ की तुलना में अधिक नरम और चिकना महसूस होता है।"
- AI की बारी: AI ने उस विवरण को सुना, शब्दों को प्रोसेस किया, और एक अनुमान लगाया: "मुझे लगता है कि लक्ष्य सिल्क सैटिन (Silk Satin) है।"
- परिणाम:
- यदि AI सही था, तो खेल समाप्त हो गया।
- यदि AI गलत था, तो "सिल्क सैटिन" नया संदर्भ बन गया, और प्रतिभागी को लक्ष्य का फिर से वर्णन करना था, रेशम के साथ तुलना करते हुए। AI ने फिर से प्रयास किया। वे ऐसा पाँच बार तक कर सकते थे।
उन्हें क्या मिला?
परिणाम "बुरा नहीं है" और "बहुत भ्रमित" का मिश्रण थे।
1. AI ज्यादातर अंधेरे में अनुमान लगा रहा है।
कुल मिलाकर, AI केवल 22.5% बार सही उत्तर दे पाया। यह उस स्थिति से भी मुश्किल से बेहतर है जब AI ने बस अपनी आँखें बंद कर ली होतीं और टोपी में से एक यादृच्छिक (random) कपड़ा चुन लिया होता। यह सुझाव देता है कि वर्तमान AI मॉडल वास्तव में यह नहीं जानते कि स्पर्श कैसा महसूस होता है; वे ज्यादातर उन शब्दों के आधार पर अनुमान लगाते हैं जो उन्होंने किताबों में देखे हैं।
2. AI का एक "पसंदीदा" कपड़ा है।
यहीं से यह दिलचस्प होता है। AI हर चीज़ में समान रूप से बुरा नहीं था।
- विजेता: जब लक्ष्य सिल्क सैटिन (Silk Satin) था, तो AI ने 100% बार सही अनुमान लगाया।
- हारने वाले: जब लक्ष्य कॉटन डेनिम (Cotton Denim) (जीन्स) था, तो AI ने 0% बार सही अनुमान लगाया।
उपमा (Analogy): कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। उसने "सोने" (Gold) के बारे में हर सवाल सही किया क्योंकि उसने सोने के बारे में एक कविता याद की थी। लेकिन वह "रेत" (Sand) के बारे में हर सवाल गलत कर गया क्योंकि उसने रेत के बारे में कभी पढ़ा ही नहीं। AI "सोने" (रेशम) को जानता है क्योंकि कहानियों और फिल्मों में इसे अक्सर "कोमल और चमकदार" के रूप में दिखाया जाता है। वह "रेत" (डेनिम) को नहीं जानता क्योंकि लोग डेनिम के खुरदरेपन के बारे में बहुत कम विस्तार से लिखते हैं।
3. "मानसिक मानचित्र" (Mental Map) पक्षपाती है।
शोधकर्ताओं ने देखा कि AI इन कपड़ों को अपने "दिमाग" (डेटा स्पेस) में कैसे व्यवस्थित करता है।
- मानवीय मानचित्र: हम कपड़ों को इस आधार पर समूह में बांटते हैं कि वे कैसे महसूस होते हैं। रेशम और एक नरम सिंथेटिक कपड़ा पड़ोसी हो सकते हैं क्योंकि दोनों चिकने महसूस होते हैं।
- AI मानचित्र: AI कपड़ों को इस आधार पर समूह में बांटता है कि उन्हें क्या कहा जाता है या वे किस श्रेणी के हैं। यह सभी "सूती" (cottons) को एक साथ और सभी "रेशमी" (silks) को एक साथ रख सकता है, भले ही एक विशिष्ट सूती कपड़ा दूसरे से बहुत अलग महसूस होता हो।
रूपक (Metaphor): AI के मस्तिष्क को एक पुस्तकालय के रूप में सोचें जहाँ किताबों को उनके कवर के रंग (कपड़े का नाम) के आधार पर छाँटा जाता है, न कि उनके विषय/शैली (महसूस होने का तरीका) के आधार पर। मनुष्य विषय (महसूस होना) के आधार पर छाँटते हैं; AI कवर के रंग (नाम) के आधार पर छाँटता है।
यह क्यों मायने रखता है?
यह पेपर बताता है कि ऐसा इसलिए होता है क्योंकि स्पर्श के बारे में लिखना कठिन है।
- दृष्टि (Vision) आसान है: हमारे पास रंगों के लिए एक सार्वभौमिक भाषा है। "लाल" हमेशा #FF0000 होता है। हम एक लाल सेब का बहुत सटीक वर्णन कर सकते हैं।
- स्पर्श (Touch) अव्यवस्थित है: "नरम", "खुरदरा" या "मक्खन जैसा" जैसे शब्द अस्पष्ट हैं। एक व्यक्ति का "नरम" दूसरे के लिए "मध्यम" हो सकता है। साथ ही, लोग अपने दैनिक ईमेल या उपन्यासों में अपनी जीन्स के महसूस होने के बारे में लंबे विवरण कम ही लिखते हैं।
चूंकि AI को टेक्स्ट (किताबों, वेबसाइटों, लेखों) पर प्रशिक्षित किया गया था, इसलिए इसने सीखा कि चीजें कैसी दिखती हैं और कैसी सुनाई देती हैं, लेकिन यह बहुत कम सीखा कि वे कैसी महसूस होती हैं। यह हाथी के बारे में केवल एक किताब पढ़कर यह सीखने जैसा है कि हाथी कैसा महसूस होता है, लेकिन उसे कभी छुआ नहीं।
निष्कर्ष (The Bottom Line)
अध्ययन यह निष्कर्ष निकालता है कि जबकि AI शब्दों को समझने में बहुत अच्छा हो रहा है, यह एहसासों को समझने में अभी भी खराब है।
- यह "रेशम" का अनुमान लगा सकता है क्योंकि "रेशम" शब्द उसके प्रशिक्षण डेटा में "कोमल" के साथ मजबूती से जुड़ा हुआ है।
- यह "डेनिम" के मामले में विफल रहता है क्योंकि "डेनिम" शब्द और "खुरदरेपन" के बीच का संबंध उसके द्वारा पढ़े गए टेक्स्ट में पर्याप्त मजबूत नहीं है।
शोधकर्ता कहते हैं कि भविष्य में AI को वास्तव में हमारी मदद करने के लिए (जैसे कि एक रोबोट जो आपके लिए कपड़े चुनता है), उसे केवल शब्दों को सीखने की आवश्यकता नहीं है। उसे भौतिक दुनिया को समझने की आवश्यकता है, न कि केवल उसके विवरण को। जब तक ऐसा नहीं होता, यदि आप AI से ऐसा कपड़ा चुनने के लिए कहते हैं जो "बिल्कुल सही" महसूस हो, तो वह केवल सबसे लोकप्रिय शब्द के आधार पर अनुमान लगा सकता है, न कि उस आधार पर कि वास्तव में क्या अच्छा महसूस होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।