OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models
यह शोध पत्र OddGridBench प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स सूक्ष्म दृश्य विसंगतियों (visual discrepancies) का पता लगाने में मनुष्यों से काफी पीछे हैं, और OddGrid-GRPO का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो करिकुलम लर्निंग और डिस्टेंस-अवेयर रिवार्ड्स के माध्यम से इस संवेदनशीलता को प्रभावी ढंग से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: AI के लिए "अंतर पहचानो" (Spot the Difference) परीक्षण
कल्पना कीजिए कि आप अपने दोस्त के साथ एक क्लासिक खेल "अंतर पहचानो" (Spot the Difference) खेल रहे हैं। आप दो लगभग एक जैसी तस्वीरों को देखते हैं, और आपका दोस्त बताता है कि बैकग्राउंड में एक पेड़ थोड़ा झुका हुआ है, या एक पक्षी नीले रंग की अलग शेड का है। इंसान इसमें अविश्वसनीय रूप से कुशल होते हैं। हम सूक्ष्म बदलावों को तुरंत पकड़ लेते हैं।
अब, कल्पना कीजिए कि आप वही तस्वीरें एक बहुत ही स्मार्ट AI (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल, या MLLM) को दिखाते हैं। आप उम्मीद करेंगे कि यह एकदम सटीक होगा, है ना? आखिर, यह कविताएँ लिख सकता है, गणित की समस्याएँ हल कर सकता है और इंसानों की तरह बातें कर सकता है।
बुरी खबर: यह पेपर खुलासा करता है कि ये AI "अंतर पहचानो" खेलने में बहुत खराब हैं। वे उस व्यक्ति की तरह हैं जो उपन्यास तो लिख सकता है लेकिन यह नहीं बता सकता कि एक तस्वीर को कुछ डिग्री घुमाया गया है या नहीं। वे उन सूक्ष्म विवरणों को मिस कर देते हैं जिन्हें इंसान तुरंत देख लेते हैं।
1. समस्या: "अंधा दैत्य" (The Blind Giant)
लेखक वर्तमान AI की स्थिति को एक "अंधे दैत्य" कहते हैं।
- दैत्य: ये मॉडल विशाल और शक्तिशाली हैं। वे जटिल कहानियों, मेडिकल रिपोर्ट्स और वैज्ञानिक चार्टों को समझते हैं।
- अंधापन: वे छोटी चीजों के प्रति "अंधे" हैं। यदि आप एक सिंगल पिक्सेल का रंग बदल दें, किसी वस्तु को 5 डिग्री घुमा दें, या किसी आकार को थोड़ा बाईं ओर खिसका दें, तो AI अक्सर इसे नोटिस नहीं कर पाता। यह एक ऐसे दैत्य की तरह है जो कार तो उठा सकता है लेकिन सुई में धागा नहीं पिरो सकता।
यह पेपर तर्क देता है कि यदि एक AI सूक्ष्म विवरण नहीं देख सकता, तो वह वास्तव में दुनिया को "समझ" नहीं सकता। यह रेत की नींव पर घर बनाने जैसा है; यदि बुनियादी धारणा (perception) कमजोर है, तो उसके ऊपर बनी स्मार्ट रीजनिंग अंततः ढह जाएगी।
2. समाधान: "OddGridBench" (AI का ट्रेनिंग जिम)
इसे साबित करने के लिए, शोधकर्ताओं ने OddGridBench नामक एक नया टेस्ट बनाया।
उपमा: इसे AI की आँखों के लिए एक जिम के रूप में सोचें।
AI को एक अस्त-व्यस्त सड़क के दृश्य या जटिल फोटो दिखाने के बजाय, उन्होंने एक साफ, व्यवस्थित ग्रिड (जैसे सुडोकू बोर्ड) बनाया जो समान आइकनों (जैसे 50 छोटे गाय या 50 छोटी घड़ियाँ) से भरा हुआ है।
- ट्विस्ट: हर इमेज में, एक अकेला आइकन अलग होता है।
- शायद वह थोड़ा अधिक लाल है (रंग - Color)।
- शायद वह बड़ा है (आकार - Size)।
- शायद वह झुका हुआ है (रोटेशन - Rotation)।
- शायद वह बगल में खिसका हुआ है (पोजीशन - Position)।
AI को ग्रिड को देखना होता है और कहना होता है, "रो 4, कॉलम 2 अलग है।"
परिणाम: शोधकर्ताओं ने दुनिया के 19 सबसे स्मार्ट AI का परीक्षण किया (GPT-5, Gemini और Qwen सहित)।
- इंसान: लगभग 87% सही स्कोर करते हैं।
- टॉप AI: लगभग 68% सही स्कोर करते हैं।
- कुछ AI: रैंडम अनुमान लगाने (जैसे सिक्का उछालना) से भी मुश्किल से बेहतर स्कोर करते हैं।
यहाँ तक कि "सबसे स्मार्ट" मॉडल भी रोटेशन और पोजीशन के बदलावों में संघर्ष करते हैं। वे हरे रंग के ढेर में एक चमकीले लाल सेब को पहचानने में माहिर थे, लेकिन एक ऐसे हरे सेब को पहचानने में बहुत खराब थे जो बाकी सेबों की तुलना में बस थोड़ा सा अधिक पीला था।
3. सुधार: "OddGrid-GRPO" (पर्सनल ट्रेनर)
चूंकि AI विफल हो रहे थे, इसलिए शोधकर्ताओं ने हार नहीं मानी; उन्होंने उनके लिए OddGrid-GRPO नामक एक पर्सनल ट्रेनर बनाया।
यह ट्रेनर AI को बेहतर देखना सिखाने के लिए दो विशेष तकनीकों का उपयोग करता है:
A. करिकुलम लर्निंग (सीढ़ी वाला तरीका - The "Staircase" Method)
कल्प la कल्पना कीजिए कि आप एक बच्चे को साइकिल चलाना सिखा रहे हैं। आप उन्हें सीधे एक खड़ी, पथरीली पहाड़ी पर नहीं भेजते।
- स्टेप 1: आप एक सपाट, चिकनी सड़क से शुरू करते हैं (आसान सैंपल)।
- स्टेप 2: आप एक हल्की ढलान पर जाते हैं (मध्यम सैंपल)।
- स्टेप 3: अंत में, आप उन्हें ऊबड़-खाबड़ रास्ते पर ले जाते हैं (कठिन सैंपल)।
AI को भी इसी तरह प्रशिक्षित किया गया। इसने उन ग्रिड्स के साथ शुरुआत की जहाँ अंतर बहुत बड़ा और स्पष्ट था। एक बार जब यह इसमें अच्छा हो गया, तो ट्रेनर ने अंतर को छोटा और छोटा करता गया, जिससे AI को अपनी आँखों को तेज करने के लिए मजबूर किया ताकि वह सबसे सूक्ष्म बदलावों को भी देख सके।
B. डिस्टेंस-अवेयर रिवॉर्ड्स ("गरम या ठंडा" वाला खेल - The "Warm/Cold" Game)
आमतौर पर, जब आप एक AI को प्रशिक्षित करते हैं, तो यदि वह सही है तो उसे "हाँ" (रिवॉर्ड) मिलता है और यदि वह गलत है तो "ना" (दंड) मिलता है। यह बाइनरी होता है।
- पुराना तरीका: यदि उत्तर "रो 5, कॉलम 5" है और AI "रो 5, कॉलम 6" कहता है, तो AI को एक बड़ा "ना" मिलता है। वह यह नहीं सीख पाता कि वह क्यों गलत था।
- नया तरीका (डिस्टेंस-अवेयर): ट्रेनर कहता है, "तुम करीब थे! तुम केवल एक कदम दूर हो। यह एक आंशिक रिवॉर्ड (partial reward) है।"
यह "गरम या ठंडा" (Hot and Cold) खेल खेलने जैसा है। केवल "गलत" कहने के बजाय, ट्रेनर फुसफुसाता है, "तुम करीब पहुँच रहे हो।" यह AI को यह समझने में मदद करता है कि स्थानिक संबंध (spatial relationships) क्या हैं, और उसे केवल रैंडम अनुमान लगाने के बजाय अपने अनुमानों को बारीक ट्यून करने में मदद करता है।
4. परिणाम
इस विशेष प्रशिक्षण के बाद:
- AI का स्कोर 17% से बढ़कर 82% हो गया।
- यह घूमती हुई वस्तुओं (rotated objects) और खिसकी हुई स्थितियों (shifted positions) को पहचानने में बहुत बेहतर हो गया।
- इसने साबित कर दिया कि सही "जिम रूटीन" (ट्रेनिंग) के साथ, AI मानव जैसी सटीकता के साथ दुनिया को देख सकता है।
सारांश
यह पेपर एक चेतावनी (wake-up call) है। यह हमें बताता है कि जबकि AI बात करने और तर्क करने में स्मार्ट हो रहा है, यह अभी भी देखने में अनाड़ी है।
- समस्या: AI सूक्ष्म विजुअल विवरणों को मिस कर देता है।
- परीक्षण: एक नए "अंतर पहचानो" खेल (OddGridBench) ने इसे साबित किया।
- इलाज: एक नई ट्रेनिंग पद्धति (OddGrid-GRPO) जो AI को करीब से देखना, चरण-दर-चरण सीखना और उत्तर के "करीब" होने पर पुरस्कृत करना सिखाती है।
लेखक आशा करते हैं कि इस "अंधेपन" को ठीक करके, हम ऐसा AI बना सकते हैं जो न केवल दुनिया के बारे में बात करता है, बल्कि वास्तव में उसे देखता भी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।