← नवीनतम पेपर
💬 NLP

On the Wings of Imagination: Conflicting Script-based Multi-role Framework for Humor Caption Generation

यह शोध पत्र HOMER को प्रस्तुत करता है, जो एक नवीन हास्य-सिद्धांत-संचालित मल्टी-रोल LLM फ्रेमवर्क है जो स्क्रिप्ट विरोध (script oppositions), रिट्रीवल-ऑगमेंटेड पदानुक्रमित कल्पना (retrieval-augmented hierarchical imagination), और लक्षित कैप्शन जनरेशन का लाभ उठाकर मज़ेदार मल्टी-मोडल इमेज कैप्शन बनाने में मौजूदा अत्याधुनिक तरीकों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Wenbo Shang, Yuxi Sun, Jing Ma, Xin Huang

प्रकाशित 2026-08-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Wenbo Shang, Yuxi Sun, Jing Ma, Xin Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चुटकुला सुनाना सिखाने की कोशिश कर रहे हैं। आप सोच सकते हैं, "बस इसे एक तस्वीर दे दो और इसे मज़ेदार बनने के लिए कहो!" लेकिन यहाँ एक पेंच है: एक कंप्यूटर के लिए, "मज़ेदार" होना एक फिसलन भरा और भ्रमित करने वाला विचार है। यह केवल यह बताने के बारे में नहीं है कि आप क्या देख रहे हैं; यह दुनिया के छिपे हुए नियमों को समझने, यह पहचानने के बारे में है कि वे नियम कब टूटते हैं, और फिर उस टूट के भीतर छिपे आश्चर्य को खोजने के लिए अपने दिमाग को घुमाने के बारे में है। यही मल्टीमॉडल ह्यूमर जनरेशन (multimodal humor generation) का मूल है, एक ऐसा क्षेत्र जहाँ वैज्ञानिक कृत्रिम बुद्धिमत्ता (AI) को यह समझने में मदद करने की कोशिश कर रहे हैं कि एक सामान्य कॉफी कप और नहाने के टब के आकार के कॉफी कप के बीच क्या अंतर है।

इसे करने के लिए, इस शोध पत्र के शोधकर्ता हास्य सिद्धांत के एक क्लासिक विचार पर भरोसा करते हैं जिसे स्क्रिप्ट अपोजिशन (Script Opposition) कहा जाता है। एक "स्क्रिप्ट" को एक मानसिक मूवी स्क्रिप्ट के रूप में सोचें जिसे हम सभी दिल से जानते हैं, जैसे "एक मीटिंग में जाना" या "कॉफी पीना।" हास्य अक्सर तब होता है जब इनमें से दो स्क्रिप्ट एक अजीब तरीके से आपस में टकराती हैं—जैसे कि एक गंभीर व्यावसायिक बैठक जहाँ हर कोई विशाल मग से पी रहा हो। शोध पत्र सुझाव देता है कि कंप्यूटर को वास्तव में मज़ेदार बनाने के लिए, वह केवल अनुमान नहीं लगा सकता; उसे इन टकरावों को खोजने, जंगली (wild) संबंध बनाने और फिर एक पंचलाइन लिखने के लिए जो सब कुछ जोड़ सके, एक संरचित योजना की आवश्यकता होती है।

शोध पत्र एक नई प्रणाली पेश करता है जिसे HOMER (ह्यूमर-रिट्रीवल के साथ ह्यूमर-थ्योरी-ड्रिवन मल्टी-रोल एलएलएम कोलैबोरेशन फ्रेमवर्क) कहा जाता है। एक एकल AI से "मज़ेदार होने" के लिए कहने और सबसे अच्छे परिणाम की उम्मीद करने के बजाय, HOMER एक छोटी, विशिष्ट कॉमेडी लेखन टीम की तरह कार्य करता है। यह काम को तीन अलग-अलग भूमिकाओं में विभाजित करता है, जिनमें से प्रत्येक एक अलग AI एजेंट द्वारा निभाई जाती है जो मिलकर काम करते हैं:

  1. द कॉन्फ्लिक्ट डिटेक्टिव (Conflicting-script Extractor): यह एजेंट छवि और दृश्य विवरण को देखता है ताकि वास्तविकता में "ग्लिच" (खराबी) को ढूंढ सके। यदि छवि एक सामान्य कुर्सियों वाले मीटिंग रूम को दिखाती है लेकिन उसमें एक विशाल, अत्यधिक बड़े आकार का कॉफी कप है, तो यह एजेंट "सामान्य कार्यालय" और "विशाल कप" के बीच के टकराव को पहचान लेता है। यह उस मूल विरोधाभास की पहचान करता है जो चुटकुले को संभव बनाता है।
  2. द वाइल्ड इमेजिनेटर (Hierarchical Imaginator): एक बार संघर्ष मिल जाने के बाद, यह एजेंट एक रचनात्मक खोज पर निकलता है। यह उस अजीब वस्तु (विशाल कप) को लेता है और जुड़ाव का एक पेड़ (tree of associations) बनाता है। यह सोच सकता है: कप → कॉफी → दूध → गाय। लेकिन यह केवल अनुमान नहीं लगाता; यह देखने के लिए मानव चुटकुलों के एक विशाल डेटाबेस की जाँच करता है कि कौन से संबंध वास्तव में मज़ेदार लगते हैं। यह उबाऊ विचारों को छाँट देता है और उन लोगों को रखता है जिनमें सबसे अधिक "हास्य क्षमता" होती है।
  3. द पंचलाइन राइटर (Caption Generator): अंत में, यह एजेंट संघर्ष, वाइल्ड इमेजिनेशन ट्री और दृश्य विवरण को लेकर कैप्शन लिखता है। यह विसंगति को समझाने के लिए सभी सुरागों को एक संक्षिप्त, चतुर वाक्य में जोड़ देता है।

शोध पत्र पाता है कि यह टीम दृष्टिकोण एक एकल AI को सब कुछ एक साथ करने की कोशिश करने की तुलना में काफी बेहतर काम करता है। जब हजारों वास्तविक दुनिया के कार्टून कैप्शन (विशेष रूप से न्यू यॉर्कर से, जो अपने मज़ेदार चित्रों के लिए प्रसिद्ध पत्रिका है) पर परीक्षण किया गया, तो HOMER ने अन्य शीर्ष AI मॉडलों को लगातार पीछे छोड़ दिया। वास्तव में, औसतन, HOMER के कैप्शन अगले सर्वश्रेष्ठ तरीके की तुलना में मानव-लिखित कैप्शनों के विरुद्ध जीतने की लगभग 7% अधिक संभावना रखते थे।

लेखक इस विचार का खंडन करते हैं कि केवल AI को "अधिक सोचने" या "अधिक तर्क करने" (जैसे जटिल स्टेप-बाय-स्टेप लॉजिक चेन का उपयोग करना) के लिए कहना ही पर्याप्त है। वे दिखाते हैं कि बिना किसी विशिष्ट मार्गदर्शक के कि हास्य कैसे काम करता है (जैसे स्क्रिप्ट अपोजिशन को देखना) और रचनात्मक विचारों को खोजने के लिए एक संरचित तरीके के बिना, AI ऐसे कैप्शन बनाता है जो तार्किक तो होते हैं लेकिन वास्तव में मज़ेदार नहीं होते। इन विशिष्ट, सिद्धांत-आधारित चरणों में प्रक्रिया को तोड़कर, HOMER ऐसे कैप्शन बनाता है जो अधिक मौलिक और वास्तव में मनोरंजक महसूस होते हैं, जिससे यह सिद्ध होता है कि कभी-कभी, मज़ेदार होने के लिए, आपको थोड़े से ढांचे और बहुत सारी कल्पना की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →