← नवीनतम पेपर
💻 computer science

Enhancing Factuality through Consensus and Consistency in Summarization Using Minimum Bayes Risk Decoding

यह शोध पत्र ConSUM को प्रस्तुत करता है, जो एक ऐसा रीरैंकिंग फ्रेमवर्क है जो उम्मीदवार आउटपुट के बीच सहमति और स्रोत दस्तावेज़ के साथ निरंतरता को संतुलित करने के लिए मिनिमम बेयस रिस्क डिकोडिंग का लाभ उठाकर उत्पन्न सारांशों की तथ्यात्मकता को बढ़ाता है, जिससे मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Riza Setiawan Soetedjo, Yusuke Sakai, Hidetaka Kamigaito, Jingun Kwon, Manabu Okumura, Taro Watanabe

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Riza Setiawan Soetedjo, Yusuke Sakai, Hidetaka Kamigaito, Jingun Kwon, Manabu Okumura, Taro Watanabe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक समाचार संपादक हैं जो एक लंबे, जटिल लेख का संक्षिप्त सारांश लिखने की कोशिश कर रहे हैं। आप अपने एआई (AI) सहायकों की एक टीम से उनके अपने संस्करण लिखने के लिए कहते हैं। समस्या यह है कि भले ही ये एआई बुद्धिमान हैं, लेकिन वे कभी-कभी तथ्य बना लेते हैं या विवरण गलत कर देते हैं (जैसे यह कहना कि कार दुर्घटना मंगलवार को हुई थी जबकि वास्तव में वह बुधवार को हुई थी)। इसे "तथ्यात्मक त्रुटि" (factual error) कहा जाता है।

यह शोध पत्र इस समस्या को ठीक करने के लिए ConSUM नामक एक नई विधि पेश करता है। ConSUM को एक अकेले लेखक के रूप में नहीं, बल्कि एक स्मार्ट मुख्य संपादक (editor-in-chief) के रूप में समझें जो टीम में से सबसे अच्छे सारांश को चुनने के लिए दो-चरणीय वोटिंग सिस्टम का उपयोग करता है।

यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. समस्या: "एकल स्रोत" का जाल (The "Single Source" Trap)

आमतौर पर, जब एक संपादक सारांश की जांच करता है, तो वह केवल मूल लेख (स्रोत) को देखता है। वह पूछता है, "क्या यह लेख से मेल खाता है?"

  • दोष: कभी-कभी एक एआई ऐसा सारांश लिखता है जो सुनने में तो ऐसा लगता है कि वह लेख से मेल खा रहा है, लेकिन वास्तव में वह किसी नाम या संख्या को बदल देता है। क्योंकि एआई इतना आत्मविश्वासी होता है, इसलिए संपादक उसे मिस कर सकता है। यह एक छात्र की तरह है जो पाठ्यपुस्तक की नकल करता है लेकिन एक महत्वपूर्ण संख्या बदल देता है; यदि आप केवल टेक्स्ट को सरसरी तौर पर देखते हैं, तो आप गलती को नहीं पकड़ पाएंगे।

2. समाधान: "ConSUM" संपादक

ConSUM इस प्रक्रिया को दो चीजों को एक साथ देखकर बेहतर बनाता है: निरंतरता (Consistency) और सहमति (Consensus)

चरण A: निरंतरता (स्रोत की जाँच करना)

यह पारंपरिक जाँच है। संपादक यह सुनिश्चित करने के लिए मूल लेख के विरुद्ध सारांश की तुलना करता है कि तथ्य वहां मौजूद हैं।

  • उदाहरण: यह एक शिक्षक की तरह है जो छात्र के होमवर्क की उत्तर कुंजी (answer key) के साथ जाँच करता है ताकि यह सुनिश्चित हो सके कि उसने नए नियम नहीं बनाए हैं।

चरण B: सहमति (भीड़ का विवेक - "Wisdom of the Crowd")

यह नया, चतुर हिस्सा है। एआई सारांश के कई अलग-अलग संस्करण बनाता है (मान लीजिए कि 16 अलग-अलग ड्राफ्ट)।

  • विचार: यदि 16 में से 15 एआई सहायक इस बात पर सहमत हैं कि "रॉकेट ने 6 पर्यटकों को ले जाया," लेकिन एक सहायक कहता है "रॉकेट ने 600 पर्यटकों को ले जाया," तो 600 कहने वाला सहायक संभवतः भ्रमित है (यानी वह मनगढ़ंत बातें बना रहा है)।
  • प्रक्रिया: ConSUM मिनिमम बेयस रिस्क (Minimum Bayes Risk - MBR) नामक तकनीक का उपयोग करता है। कल्पना कीजिए कि न्यायाधीशों का एक पैनल है। केवल "सबसे संभावित" वाक्य चुनने के बजाय, वे सभी ड्राफ्ट को देखते हैं और पूछते हैं, "कौन सा वाक्य सभी अलग-अलग संस्करणों में सबसे अधिक बार दिखाई देता है?"
  • उदाहरण: यह "टेलीफोन" गेम की तरह है। यदि घेरे में हर कोई एक ही बात फुसफुसाता है, तो वह शायद सच है। यदि एक व्यक्ति कुछ बिल्कुल अलग फुसफुसाता है, तो संभावना है कि वही भ्रमित हुआ है। ConSUM उस संस्करण को चुनता है जो "समूह के वोट" के साथ संरेखित होता है।

3. अंतिम निर्णय: स्कोरकार्ड

ConSUM इन दोनों जाँचों को एक अंतिम स्कोर में जोड़ता है:

  1. निरंतरता स्कोर (Consistency Score): यह मूल लेख के साथ कितनी अच्छी तरह मेल खाता है?
  2. सहमति स्कोर (Consensus Score): यह अन्य एआई ड्राफ्ट के साथ कितनी अच्छी तरह सहमत है?

सिस्टम उच्चतम संयुक्त स्कोर वाले सारांश को चुनता है। यह एक हायरिंग मैनेजर की तरह है जो उम्मीदवार के बायोडाटा (Resume) की जाँच करता है (निरंतरता) लेकिन साथ ही उसके पिछले सहकर्मियों से संदर्भ (References) भी मांगता है (सहमति) यह देखने के लिए कि क्या वह वास्तव में विश्वसनीय है।

उन्होंने क्या पाया?

शोधकर्ताओं ने समाचार लेखों (जैसे CNN और XSum डेटासेट) पर इसका परीक्षण किया।

  • परिणाम: ConSUM द्वारा चुने गए सारांश पुराने तरीकों द्वारा चुने गए सारांशों की तुलना में बहुत अधिक सटीक थे।
  • मानवीय प्रमाण: जब वास्तविक मनुष्यों ने सारांश पढ़े, तो उन्होंने ConSUM द्वारा बनाए गए सारांशों को पसंद किया। उन्होंने पाया कि वे अधिक भरोसेमंद और तथ्यात्मक थे, बिना लेखन की गुणवत्ता या प्रवाह को खोए।

एक कमी (सीमाएं)

शोध पत्र नोट करता है कि इस "वोटिंग" प्रक्रिया में अधिक कंप्यूटर पावर और समय लगता है क्योंकि एआई को कई ड्राफ्ट बनाने होते हैं और उन सभी की तुलना करनी होती है। यह एक पूरी समिति से वोट लेने के बजाय एक व्यक्ति द्वारा निर्णय लेने जैसा है; यह अधिक सटीक है, लेकिन इसमें अधिक समय लगता है।

संक्षेप में: ConSUM एआई को तथ्य बनाने से रोकने के लिए उसे सत्य पर "वोट" करने के लिए मजबूर करता है। यदि एआई टीम एक तथ्य पर सहमत है, तो वह संभवतः सच है। यदि वे असहमत हैं, तो सिस्टम अजीब और मनगढ़ंत उत्तरों को फ़िल्टर कर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →