← नवीनतम पेपर
💬 NLP

LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task

NLPerspectives में LeWiDi साझा कार्य (shared task) का तीसरा संस्करण चार विविध NLP कार्यों के साथ बेंचमार्क का विस्तार करके, नवीन मेट्रिक्स के साथ सॉफ्ट-लेबल और पर्सपेक्टिविस्ट मूल्यांकन प्रतिमानों को पेश करके, और मानव निर्णय भिन्नता के मॉडलिंग में नए संसाधनों और अंतर्दृष्टि प्रदान करके असहमति-जागरूक AI के विकास को आगे बढ़ाता है।

मूल लेखक: Elisa Leonardelli, Silvia Casola, Siyao Peng, Giulia Rizzi, Valerio Basile, Elisabetta Fersini, Diego Frassinelli, Hyewon Jang, Maja Pavlovic, Barbara Plank, Massimo Poesio

प्रकाशित 2026-02-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Elisa Leonardelli, Silvia Casola, Siyao Peng, Giulia Rizzi, Valerio Basile, Elisabetta Fersini, Diego Frassinelli, Hyewon Jang, Maja Pavlovic, Barbara Plank, Massimo Poesio

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानव भाषा समझना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, हमने रोबोट को ऐसे उदाहरण दिखाकर सिखाया जहाँ हर कोई उत्तर पर सहमत था, जैसे "2 + 2 = 4।" लेकिन वास्तविक जीवन में, मनुष्य अक्सर असहमत होते हैं। एक व्यक्ति को एक चुटकुला बेहद मजेदार लग सकता है, जबकि दूसरे को वह अपमानजनक लग सकता है। एक व्यक्ति किसी वाक्य को झूठ मान सकता है, जबकि दूसरा उसे एक हानिरहित राय के रूप में देख सकता है।

यह शोध पत्र एक "प्रतियोगिता" (जिसे LeWiDi-2025 कहा जाता है) के तीसरे संस्करण का वर्णन करता है, जिसे AI मॉडल को मतभेदों को अनदेखा करने के बजाय उन्हें संभालने के लिए सिखाने के लिए डिज़ाइन किया गया है।

यहाँ एक सरल विवरण दिया गया कि उन्होंने क्या किया, जिसमें कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. लक्ष्य: AI को भीड़ को सुनना सिखाना

AI को केवल एक "सही" उत्तर चुनने के लिए मजबूर करने के बजाय, आयोजकों चाहते थे कि यह देखा जाए कि क्या AI मानव राय की पूरी तस्वीर को समझ सकता है।

  • पुराना तरीका: यदि 10 लोग किसी फिल्म पर वोट करते हैं, और 6 कहते हैं "अच्छी है" और 4 कहते हैं "खराब है," तो पुराने AI को बस बताया जाता कि, "उत्तर 'अच्छी है' है।" यह उन 4 लोगों की अनदेखी करता है।
  • नया तरीका: AI को बताया जाता है, "यहाँ पूरी कहानी है: 6 लोगों ने इसे पसंद किया, 4 ने नहीं। आपका काम यह समझना है कि वे ऐसा क्यों महसूस करते थे और मतभेदों के इस मिश्रण की भविष्यवाणी करना है।"

2. चार "खेल" (डेटासेट)

प्रतियोगिता ने प्रतिभागियों को चार अलग-अलग प्रकार की पहेलियाँ हल करने के लिए दीं, जिनमें से प्रत्येक मानव असहमति के एक अलग प्रकार का प्रतिनिधित्व करती है:

  • व्यंग्य का खेल (CSC): कल्पना कीजिए कि आप एक टेक्स्ट मैसेज पढ़ रहे हैं। क्या यह एक ईमानदार प्रशंसा है या एक व्यंग्यात्मक कटाक्ष? अलग-अलग लोग इसे 1 से 6 के पैमाने पर कितना "व्यंग्यात्मक" है, इसके आधार पर रेट करते हैं।
  • विडंबना का खेल (MP): एक छोटी पोस्ट और उसका जवाब। क्या जवाब विडंबनापूर्ण है? यह 9 अलग-अलग भाषाओं (जैसे अंग्रेजी, स्पेनिश और अरबी) में खेला गया था, जो यह दर्शाता है कि विडंबना एक वैश्विक समस्या है।
  • पैराफ्रेस (समान अर्थ वाला वाक्य) का खेल (Par): दो प्रश्न पूछे जाते हैं। क्या वे एक ही चीज़ पूछ रहे हैं? केवल "हाँ/नहीं" के बजाय, लोगों ने उन्हें -5 से 5 के पैमाने पर समानता के आधार पर रेट किया।
  • तर्क का खेल (VEN): एक कथन और एक तथ्य। क्या तथ्य कथन को सिद्ध करता है, उसका खंडन करता है, या उसका उससे कोई लेना-देना नहीं है? यहाँ, लोगों को अपने उत्तरों के साथ व्याख्याएँ भी लिखनी थीं।

3. खेलने के दो तरीके (टास्क)

प्रतिभागियों को अपनी AI की समझ दिखाने के लिए दो अलग-अलग तरीकों में से एक चुनने का विकल्प दिया गया:

  • टास्क A: "मौसम विज्ञानी" (Soft-Label)
    दिएв एक विशिष्ट उत्तर का अनुमान लगाने के बजाय, AI एक मौसम विज्ञानी की तरह कार्य करता है। यह केवल यह नहीं कहता कि "बारिश होगी"; यह कहता है, "बारिश होने की 60% संभावना है, धूप की 30% और बर्फबारी की 10% संभावना है।" AI लोगों के वोटिंग के वितरण (distribution) की भविष्यवाणी करता है।
  • टास्क B: "मनोवैज्ञानिक" (Perspectivist)
    यह कठिन है। AI को यह अनुमान लगाना होता है कि एक विशिष्ट व्यक्ति क्या कहेगा। यदि आप AI को बताते हैं, "यहाँ व्यक्ति X की सामान्य सोच है," तो AI को भविष्यवाणी करनी चाहिए, "व्यक्ति X के इतिहास के आधार पर, वे संभवतः यह उत्तर देंगे।" यह अनुमान लगाने जैसा है कि आपका गुस्सैल चाचा या आपकी आशावादी आंटी एक चुटकुले पर क्या प्रतिक्रिया देंगे।

4. नया स्कोरकार्ड (मेट्रिक्स)

अतीत में, निर्णायक यह मापने के लिए एक साधारण पैमाने का उपयोग करते थे कि AI कितनी दूर था। लेकिन वह पैमाना "व्यंग्य के पैमाने" या "कई भाषाओं" के लिए ठीक से काम नहीं करता था।

  • नया पैमाना: उन्होंने सफलता को मापने के लिए नए तरीके विकसित किए।
    • "स्केल्स" के लिए (जैसे 1 से 6), उन्होंने एक ऐसा मेट्रिक इस्तेमाल किया जो यह समझता है कि एक अंक की गलती होना (जैसे 5 के बजाय 4 कहना) पांच अंक की गलती होने (जैसे 5 के बजाय 1 कहना) से बेहतर है।
    • "मनोवैज्ञानिक" कार्य के लिए, उन्होंने यह मापा कि AI विशिष्ट व्यक्तियों के पूर्वाग्रहों और आदतों की कितनी अच्छी तरह नकल कर सकता है।

5. परिणाम: कौन जीता?

लगभग 15 टीमों ने प्रतियोगिता में भाग लिया। यहाँ उन्होंने क्या पाया:

  • "बड़ा दिमाग" दृष्टिकोण: शीर्ष टीमों ने लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग किया—वही तरह के सुपर-स्मार्ट AI जो निबंध लिखते हैं और आपसे चैट करते हैं। ये मॉडल इस बात के उदाहरणों को देखने और उस पैटर्न की नकल करने में बहुत अच्छे थे कि अलग-अलग लोगों ने कैसे वोट दिया।
  • "छोटा लेकिन शक्तिशाली" दृष्टिकोण: कुछ टीमों ने छोटे, विशेषीकृत मॉडल्स का उपयोग किया। उन्होंने वास्तव में छोटे, पेचीदा डेटासेट्स पर आश्चर्यजनक रूप से अच्छा प्रदर्शन किया।
  • गुप्त सामग्री: जीतने वाले सिस्टम ने केवल टेक्स्ट को नहीं देखा; उन्होंने यह भी देखा कि टेक्स्ट कौन लिख रहा था। उन्होंने बेहतर अनुमान लगाने के लिए उम्र, लिंग या पिछले वोटिंग इतिहास जैसे संकेतों का उपयोग किया।
  • "व्याख्या" बोनस: लॉजिक गेम पर, उन टीमों ने बहुत बेहतर प्रदर्शन किया जिन्होंने AI को लोगों द्वारा लिखी गई व्याख्याएँ भी दीं (न कि केवल उनके उत्तर)। यह यह समझने जैसा है कि किसी ने क्यों वोट दिया, न कि केवल यह कि उन्होंने कैसे वोट दिया।

6. कमी (सीमाएँ)

लेखक ईमानदार हैं कि उन्होंने क्या टेस्ट नहीं किया:

  • "नया चेहरा" समस्या: वास्तविक दुनिया में, आप किसी ऐसे अजनबी से मिल सकते हैं जिसकी राय आपने पहले कभी नहीं देखी है। इस प्रतियोगिता में, AI का परीक्षण उन लोगों पर किया गया जिन्हें वह प्रशिक्षण के दौरान पहले ही "मिल" चुका था। हमें अभी तक नहीं पता कि क्या ये मॉडल पूरी तरह से नए व्यक्ति को संभाल सकते हैं।
  • केवल टेक्स्ट: प्रतियोगिता केवल पढ़ने और लिखने के बारे में थी। हमें नहीं पता कि क्या ये तरीके छवियों, वीडियो या आवाज़ के लिए भी काम करते हैं।

सारांश

यह शोध पत्र एक ऐसी प्रतियोगिता की रिपोर्ट कार्ड है जिसने AI को यह मानना छोड़ने के लिए सिखाया कि हर कोई सहमत नहीं होता। नए स्कोरिंग तरीकों का उपयोग करके और मानव असहमति की जटिल वास्तविकता पर ध्यान केंद्रित करके, विजेताओं ने दिखाया कि सबसे अच्छे AI मॉडल वे हैं जो भीड़ को देख सकते हैं, उसके भीतर की विभिन्न आवाजों को समझ सकते हैं, और केवल एक विजेता चुनने के बजाय मतों के मिश्रण की भविष्यवाणी कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →