PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions
यह शोध पत्र विस्तृत छवि विवरणों के मूल्यांकन के लिए एक सीन ग्राफ-निर्देशित LLM-as-a-Judge मीट्रिक, PoSh को प्रस्तुत करता है, और नए DOCENT बेंचमार्क के माध्यम से इसे मान्य करता है, जो मौजूदा मीट्रिक्स की तुलना में मानव निर्णयों के साथ बेहतर सहसंबंध और विविध प्रकार की छवियों में मजबूती प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कला समीक्षक हैं जो एक संग्रहालय का दौरा कर रहे हैं। आप एक जटिल पेंटिंग देखते हैं जिसमें एक अराजक दृश्य है: एक आदमी पानी उँडेल रहा है, एक विशिष्ट चोंच वाले आकार का पक्षी है, और लोगों का एक समूह आपस में बातचीत कर रहा है। आप इस पेंटिंग का एक विस्तृत विवरण लिखना चाहते हैं ताकि एक दृष्टिहीन व्यक्ति इसे अपने मन में "देख" सके।
अब, कल्पना कीजिए कि आपके पास एक रोबोट (एक AI) है जो विवरण भी लिखता है। आप कैसे जानेंगे कि रोबोट ने अच्छा काम किया है या नहीं?
यही वह समस्या है जिसे POSH नामक पेपर हल करने की कोशिश करता है। यहाँ इसे सरल शब्दों में समझाया गया है:
1. समस्या: पुराने पैमाने नए कपड़ों के लिए फिट नहीं बैठते
लंबे समय से, हम AI विवरणों को ग्रेड देने के लिए सरल पैमानों का उपयोग करते आए हैं। ये पुराने पैमाने (CIDEr या SPICE जैसे मेट्रिक्स) छोटे, सरल वाक्यों के लिए बनाए गए थे, जैसे "एक कुत्ता दौड़ रहा है।" वे यह जाँचते हैं कि क्या AI ने सही शब्दों का उपयोग किया है।
लेकिन आज, AI छवियों के बारे में लंबे, विस्तृत विवरण लिख सकता है। पुराने पैमाने इसके लिए टूट चुके हैं।
- दोष: यदि AI कहता है, "आदमी पानी उँडेल रहा है," लेकिन वास्तव में आदमी पानी पकड़े हुए है, तो पुराना पैमाना इसे उच्च स्कोर दे सकता है क्योंकि इसने "आदमी," "उँडेलना," और "पानी" जैसे शब्दों को सही ढंग से प्राप्त कर लिया है। यह तार्किक त्रुटि (logic error) को चूक जाता है।
- असली मुद्दा: विस्तृत विवरणों में, संबंधों (कौन, किसके साथ क्या कर रहा है) को सही ढंग से समझना ही सब कुछ है। यदि AI संबंधों को गलत कर देता है, तो विवरण बेकार है, भले ही उसकी शब्दावली एकदम सही क्यों न हो।
2. समाधान: POSH ("सीन ग्राफ" जासूस)
लेखकों ने POSH नामक एक नया टूल बनाया है। POSH को एक पैमाने के रूप में नहीं, बल्कि एक चेकलिस्ट के साथ एक जासूस के रूप में सोचें।
POSH इस प्रकार काम करता है, चरण-दर-चरण:
चरण 1: ब्लूप्रिंट (सीन ग्राफ):
कल्पना कीजिए कि AI एक विवरण लिखता है। POSH उस टेक्स्ट को लेता है और उसे एक ब्लूप्रिंट (जिसे सीन ग्राफ कहा जाता है) में बदल देता है। यह कहानी को उसके निर्माण खंडों में तोड़ देता है: कौन वहाँ है? वे क्या पहने हुए हैं? वे कैसे जुड़े हुए हैं?- उपमा: यदि वाक्य है "घोड़े पर सवार लंबा आदमी हाथ हिला रहा है," तो ब्लूप्रिंट सूचीबद्ध करता है:
[आदमी] + [लंबा] + [घोड़े पर] + [हाथ हिलाना]।
- उपमा: यदि वाक्य है "घोड़े पर सवार लंबा आदमी हाथ हिला रहा है," तो ब्लूप्रिंट सूचीबद्ध करता है:
चरण 2: पूछताछ (LLM-as-a-Judge):
POSH AI के ब्लूप्रिंट की तुलना "गोल्ड स्टैंडर्ड" ब्लूप्रिंट (एक मानव विशेषज्ञ द्वारा लिखे गए) से करता है। केवल शब्दों को गिनने के बजाय, POSH एक स्मार्ट AI (एक "जज") का उपयोग विशिष्ट प्रश्न पूछने के लिए करता है।- प्रश्न: "क्या विवरण में घोड़े पर सवार आदमी का उल्लेख है?"
- परिणाम: यदि AI ने "साइकिल पर सवार आदमी" कहा, तो जज उस विशिष्ट त्रुटि को पकड़ लेगा। यह सटीक रूप से पहचान लेता है कि टेक्स्ट में गलती कहाँ हुई।
चरण 3: रिपोर्ट कार्ड:
POSH दो चीजों के आधार पर स्कोर देता है:- गलतियाँ (Precision): क्या AI ने ऐसी चीजें बना दीं जो वहाँ नहीं थीं? (जैसे, यह कहना कि वहाँ एक बिल्ली है जबकि वास्तव में नहीं है)।
- छूट जाना (Recall): क्या AI महत्वपूर्ण विवरण बताना भूल गया? (जैसे, पक्षी की चोंच का उल्लेख करना भूल जाना)।
3. नया टेस्ट: DOCENT (कला संग्रहालय)
यह साबित करने के लिए कि उनका नया टूल काम करता है, लेखकों ने DOCENT नामक एक नया टेस्ट बनाया है।
- यह क्या है? नेशनल गैलरी ऑफ आर्ट से 1,750 जटिल कलाकृतियों (पेंटिंग्स, स्केच, मूर्तियाँ) का एक संग्रह।
- यह विशेष क्यों है? अधिकांश AI टेस्ट बिल्लियों या कारों की तस्वीरों का उपयोग करते हैं। ये सरल होते हैं। DOCENT कला का उपयोग करता है, जो अस्त-व्यस्त, भावनात्मक और छिपे हुए विवरणों से भरी होती है।
- मानवीय तत्व: उन्होंने AI के विवरणों को ग्रेड देने के लिए कला इतिहास के छात्रों को काम पर रखा। इन छात्रों ने केवल "अच्छा" या "बुरा" नहीं कहा; उन्होंने सटीक रूप से चिह्नित किया कि कौन सा वाक्य गलत था या क्या छूट गया था। इसने POSH को टेस्ट करने के लिए एक "गोल्ड स्टैंडर्ड" बनाया।
4. परिणाम: क्यों POSH जीतता है
जब उन्होंने अन्य तरीकों के मुकाबले POSH का परीक्षण किया:
- यह स्मार्ट है: POSH ने उन्नत AI जजों (जैसे GPT-4o) से भी बेहतर तरीके से मानव विशेषज्ञों के साथ सह-संबंध (correlation) दिखाया। इसने समझा कि विवरण खराब क्यों था, न कि केवल यह कि वह खराब था।
- यह सस्ता है: आपको POSH का उपयोग करने के लिए महंगे API कॉल का भुगतान करने की आवश्यकता नहीं है; यह ओपन-सोर्स मॉडल का उपयोग करता है।
- यह एक कोच है: लेखकों ने POSH का उपयोग AI को "प्रशिक्षित" करने के लिए किया। केवल उदाहरण दिखाने के बजाय, उन्होंने AI को अभ्यास करने दिया और POSH का उपयोग फीडबैक देने के लिए किया। प्रशिक्षण के बाद AI कला का वर्णन करने में काफी बेहतर हो गया।
बड़ी तस्वीर
यह पेपर तर्क देता है कि AI को वास्तव में उपयोगी बनाने के लिए (जैसे एक्सेसिबिलिटी/सुगमता के लिए—दृष्टिहीनों के लिए विवरण लिखना), हमें केवल शब्द-मिलान से आगे बढ़ने की आवश्यकता है। हमें ऐसे उपकरणों की आवश्यकता है जो छवि में कहानी और संबंधों को समझ सकें।
POSH वही उपकरण है। यह एक स्पेल-चेकर (जो केवल यह जाँचता है कि शब्द सही स्पेलिंग के हैं या नहीं) से एक साहित्यिक संपादक (जो यह जाँचता है कि कथानक का अर्थ निकलता है या नहीं) में अपग्रेड करने जैसा है। इस नए संपादक और एक नए, कठिन टेस्ट (DOCENT) का उपयोग करके, हम अंततः ऐसे AI का निर्माण कर सकते हैं जो वास्तव में दुनिया को विस्तार से "देख" और वर्णित कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।