lmfaoooo at SemEval-2026 Task 1: Humor Is an Audience. Preference Modeling for Constrained Humor Generation
यह शोध पत्र SemEval-2026 टास्क 1 (MWAHAHA) के लिए प्रथम स्थान प्राप्त करने वाले एक ऐसे सिस्टम को प्रस्तुत करता है जो "जनरेट-मेनी, सेलेक्ट-बेस्ट" रणनीति का उपयोग करके हास्य की श्रोता-निर्भर प्रकृति को संबोधित करता है, जहाँ उम्मीदवारों के एक विविध समूह को पूर्ण हास्य स्कोर के बजाय मानव युग्मवार निर्णयों (human pairwise judgments) पर प्रशिक्षित प्राथमिकता मॉडल द्वारा रैंक किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कॉमेडी क्लब के मालिक हैं जो आज रात के शो के लिए सबसे मज़ेदार चुटकुला चुनने की कोशिश कर रहे हैं। आपके पास एक सुपर-फास्ट रोबोट द्वारा लिखे गए एक हज़ार चुटकुले हैं, लेकिन आप जानते हैं कि जो बात एक व्यक्ति को हँसा सकती है, वह दूसरे को आँखों में धूल झोंकने जैसा (चिढ़ाने वाला) लग सकती है। आप जो कागज़ पढ़ रहे हैं, वह एक रिपोर्ट है कि कैसे लेखकों ने SemEval-2026 Task 1 (जिसे MWAHAHA नाम दिया गया है) नामक एक कंप्यूटर साइंस प्रतियोगिता के लिए इस सटीक समस्या को हल करने हेतु एक सिस्टम बनाया।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल चरणों में विभाजित किया गया है:
1. समस्या: "मज़ेदार" होना देखने वाले की दृष्टि पर निर्भर करता है
लेखक बताते हैं कि कंप्यूटर को मज़ेदार बनाना इसलिए कठिन नहीं है क्योंकि वह शब्द नहीं लिख सकता, बल्कि इसलिए है क्योंकि "मज़ेदार" होना व्यक्तिपरक (subjective) है।
- दर्शक की समस्या: एक चुटकुला जो बर्लिन में धूम मचा सकता है, वह बीजिंग में फ्लॉप हो सकता है। यहाँ तक कि इंसान भी इस बात पर सहमत नहीं हो सकते कि क्या मज़ेदार है; यदि आप 10 लोगों से एक चुटकुले को रेट करने के लिए कहते हैं, तो वे 10 अलग-अलग स्कोर देंगे।
- रोबोट की समस्या: कंप्यूटर चीज़ों को याद रखने में बहुत अच्छे होते हैं। यदि आप किसी रोबोट से चुटकुला सुनाने के लिए कहते हैं, तो वह अक्सर उन्हीं 25 चुटकुलों को दोहराता रहता है जो उसे रटे हुए हैं, जैसे कोई तोता किसी कहावत को दोहरा रहा हो। उसे वास्तव में कुछ नया सोचने में संघर्ष करना पड़ता है।
2. रणनीति: "भले (Darts) फेंको, फिर केंद्र (Bullseye) चुनो"
एक ही बार में एक परफेक्ट चुटकुला लिखने के बजाय, लेखकों ने दो-चरणीय रणनीति का उपयोग किया: कई उत्पन्न करें, फिर सर्वश्रेष्ठ का चयन करें।
चरण 1: "चुटकुला फैक्ट्री" (उत्पादन/Generation)
उन्होंने एक ऐसी फैक्ट्री स्थापित की जो प्रत्येक प्रॉम्प्ट के लिए 50 अलग-अलग चुटकुले तैयार करती है। उन्होंने विभिन्न AI मॉडलों (जैसे अलग-अलग कॉमेडियनों की एक टीम) के मिश्रण का उपयोग किया और उन्हें रचनात्मक होने के लिए मजबूर किया ताकि वे केवल पुराने चुटकुलों को कॉपी-पेस्ट न करें। उन्होंने यह भी सुनिश्चित किया कि चुटकुले नियमों का पालन करें (जैसे विशिष्ट शब्दों को शामिल करना या एक निश्चित लंबाई के भीतर रहना)।- उपमा: कल्पना कीजिए कि आप 50 अलग-अलग शेफ से एक बर्गर बनाने के लिए कहते हैं। कुछ तीखा बनाएंगे, कुछ मीठा, कुछ अजीब। अब आपके पास बर्गर का एक बड़ा ढेर है।
चरण 2: "स्वाद परीक्षक" (चयन/Selection)
अब, उन्हें उस 50 चुटकुलों के ढेर में से विजेता चुनने के लिए एक तरीके की आवश्यकता थी। चूंकि इंसान वास्तविक समय में हर एक चुटकुले का निर्णय नहीं ले सकते, इसलिए उन्होंने एक प्रिफरेंस मॉडल (Preference Model) बनाया।- चुटकुले के बारे में "क्या यह मज़ेदार है?" पूछने के बजाय (जो कि अस्पष्ट और भ्रमित करने वाला है), उन्होंने पूछा, "चुटकुले A और चुटकुले B के बीच, कौन सा बेहतर है?"
- उन्होंने इस मॉडल को लगभग 2,500 मानव वोटों पर प्रशिक्षित किया जहाँ लोगों ने दो चुटकुलों की तुलना की और एक विजेता चुना। यह एक जज को हजारों "A बनाम B" मुकाबलों को दिखाकर प्रशिक्षित करने जैसा है, जब तक कि जज दर्शकों की पसंद को सीख न जाए।
3. गुप्त नुस्खा: "ह्यूमर रेसिपी बुक"
अपने "स्वाद परीक्षक" को अधिक स्मार्ट और समझने में आसान बनाने के लिए, उन्होंने केवल कंप्यूटर को अनुमान लगाने के लिए नहीं छोड़ा। उन्होंने एक "ह्यूमर बेसिस" (Humor Basis) बनाया—17 विशिष्ट "फ्लेवर्स" (स्वादों) की एक छोटी सूची।
- इसे एक मसाला रैक की तरह समझें। ये फ्लेवर "डार्क ह्यूमर," "वर्डप्ले (शब्दों का खेल)," "अतिशयोक्ति (Exaggeration)," या "अप्रत्याशित मोड़ (Unexpected Twist)" हो सकते हैं।
- जब कंप्यूटर एक चुटकुले को देखता है, तो वह केवल "अच्छा" या "बुरा" नहीं कहता। वह मसाला रैक के विरुद्ध चुटकुले की जाँच करता है: क्या इसमें एक दमदार पंचलाइन है? क्या यह वर्डप्ले का उपयोग कर रहा है? क्या यह बहुत डार्क है?
- यह सिस्टम को "व्याख्या योग्य" (interpretable) बनाता है, जिसका अर्थ है कि इंसान परिणामों को देख सकते हैं और समझ सकते हैं कि कंप्यूटर ने एक विशिष्ट चुटकुले को क्यों चुना (जैसे, "इसने इसे इसलिए चुना क्योंकि इसमें एक शानदार ट्विस्ट था, भले ही यह थोड़ा छोटा था")।
4. परिणाम: प्रतियोगिता जीतना
उन्होंने अपने सिस्टम का परीक्षण तीन अलग-अलग प्रकार के डेटा (रेडिट चुटकुले, पेशेवर चुटकुले, और उनका अपना नया डेटासेट) पर किया।
- विजेता: उनकी "दो चुटकुलों की तुलना करने" वाली विधि, केवल एक चुटकुले को स्कोर देने के बजाय, बहुत बेहतर काम करती है। यह अन्य तरीकों की तुलना में विभिन्न भाषाओं और संस्कृतियों को संभालने में भी बेहतर थी।
- ट्रॉफी: वास्तविक प्रतियोगिता (MWAHAHA) में, उनके सिस्टम ने अंग्रेजी और चीनी में पहला स्थान और स्पेनिश में दूसरा स्थान प्राप्त किया।
5. मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि कंप्यूटर के हास्य का भविष्य शून्य से बेहतर चुटकुले लिखने के बारे में नहीं है। रोबोट पहले से ही कई चुटकुले लिखने में अच्छा है। असली चुनौती सही एक को चुनने की है।
लेखक तर्क देते हैं कि यदि हम चाहते हैं कि कंप्यूटर मज़ेदार हो, तो हमें "मज़ेदार" को एक एकल संख्या के रूप में मापने के बजाय पसंद (preferences) पर ध्यान केंद्रित करने की आवश्यकता है—यह समझना कि दर्शक क्या पसंद करते हैं, विकल्पों की तुलना करके, ठीक वैसे ही जैसे हम तय करते हैं कि कौन सी फिल्म देखनी है या कौन सा गाना बजाना है।
संक्षेप में: उन्होंने एक ऐसा सिस्टम बनाया जो चुटकुलों का एक विशाल बुफे तैयार करता है और एक स्मार्ट, प्रशिक्षित "स्वाद परीक्षक" का उपयोग करता है जो उस व्यंजन को चुनता है जिसे दर्शक सबसे अधिक पसंद करने की संभावना रखते हैं, उन्होंने यह समझकर प्रतियोगिता जीती कि हास्य केवल चुटकुले के बारे में नहीं, बल्कि दर्शकों की पसंद के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।