← नवीनतम पेपर
💬 NLP

Evaluating LLM-Driven Summarisation of Parliamentary Debates with Computational Argumentation

यह शोधपत्र संसदीय बहसों के LLM-जनित सारांशों की निष्ठा (faithfulness) का मूल्यांकन करने के लिए एक नवीन कम्प्यूटेशनल तर्क संरचना ढांचे (computational argumentation framework) का प्रस्ताव करता है, जो तर्कसंगत निरंतरता को पकड़ने में मौजूदा मेट्रिक्स की सीमाओं को संबोधित करते हुए तर्क संरचनाओं के औपचारिक संरक्षण पर ध्यान केंद्रित करता है।

मूल लेखक: Eoghan Cunningham, Derek Greene, James Cross, Antonio Rago

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eoghan Cunningham, Derek Greene, James Cross, Antonio Rago

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि यूरोपीय संसद एक विशाल, अराजक रसोईघर है जहाँ सैकड़ों शेफ (राजनेता) एक विशाल, जटिल रेसिपी (एक नया कानून) पर बहस कर रहे हैं। वे नमक डालने, चीनी हटाने या पकाने का समय बदलने के बारे में चिल्ला रहे हैं। अंतिम रेसिपी में दर्जनों विशिष्ट निर्देश (प्रावधान) हैं।

अब, कल्पना कीजिए कि आप एक सामान्य व्यक्ति हैं जो यह समझने की कोशिश कर रहे हैं कि उस रसोई में क्या हुआ। आप यह समझने के लिए कि हर कोई क्या चिल्ला रहा था, 500 पन्नों का ट्रांसक्रिप्ट नहीं पढ़ सकते। इसलिए, आप एक सुपर-स्मार्ट रोबोट (एक AI या लार्ज लैंग्वेज मॉडल) से अपने लिए एक छोटा सारांश लिखने को कहते हैं।

समस्या:
रोबोट एक अच्छा, छोटा सारांश लिखता है। लेकिन क्या वह सच बोल रहा है?

  • क्या उसने कहा कि शेफ नमक डालना चाहते थे जबकि वास्तव में वे उसे हटाना चाहते थे?
  • क्या उसने इस तथ्य को छिपा दिया कि आधी रसोई एक विशिष्ट सामग्री के बारे में "नहीं!" चिल्ला रही थी?
  • क्या उसने एक विवादास्पद सामग्री को ऐसा दिखाया जैसे कि हर कोई उसे पसंद करता था?

सारांश को जांचने के पुराने तरीके इस बात पर आधारित हैं कि क्या सारांश मूल पाठ के समान शब्दों का उपयोग करता है। यदि रोबोट अलग शब्दों का उपयोग करता है लेकिन अर्थ गलत कर देता है, तो पुराने चेक विफल हो जाते हैं। वे एक फिल्म के सारांश को यह गिनकर आंकने जैसे हैं कि "विस्फोट" शब्द कितनी बार आया है, बजाय इसके कि यह जांचा जाए कि क्या नायक वास्तव में मर गया।

समाधान: "आर्ग्युमेंट मैप" (तर्क मानचित्र)
यह शोध पत्र रोबोट के काम की जांच करने का एक नया तरीका प्रस्तावित करता है। शब्दों को देखने के बजाय, वे बहस को एक तार्किक युद्ध मानचित्र (जिसे क्वांटिटेटिव बाइपोलर आर्ग्युमेंटेशन फ्रेमवर्क कहा जाता है) में बदल देते हैं।

इसे एक रस्साकशी (Tug-of-War) के खेल की तरह समझें:

  1. रस्सी: कानून के वे विशिष्ट हिस्से जिन पर बहस की जा रही है (जैसे, "स्वास्थ्य एजेंसी की शक्ति बढ़ाएं")।
  2. टीमें:
    • टीम ग्रीन (समर्थन): शेफ जो रस्सी को एक तरफ खींच रहे हैं, कह रहे हैं "यह अच्छा है!"
    • टीम रेड (विरोध): शेफ जो दूसरी तरफ खींच रहे हैं, कह रहे हैं "यह बुरा है!"
  3. स्कोर: रस्सी की अंतिम स्थिति इस बात पर निर्भर करती है कि प्रत्येक टीम में कितने लोग हैं और वे कितनी जोर से खींच रहे हैं।

यह नया सिस्टम कैसे काम करता है:
शोधकर्ताओं ने एक प्रणाली बनाई है जो दो मानचित्र बनाती है:

  1. मैप A: वास्तविक बहस का मानचित्र (पूर्ण ट्रांसक्रिप्ट)।
  2. मैप B: रोबोट के सारांश का मानचित्र।

फिर, वे यह देखने के लिए कि क्या सारांश लड़ाई का एक "वफादार" प्रतिनिधित्व है, पाँच सरल नियमों (गुणों) का उपयोग करके इन मानचित्रों की तुलना करते हैं:

  • नियम 1: क्या किसी को छोड़ दिया गया? (प्रासंगness/Relevance) क्या सारांश ने उस शेफ का उल्लेख करना भूल गया जो जोर से चिल्ला रहा था?
  • नियम 2: क्या स्कोर संतुलित है? (पक्ष-विपक्ष अनुपात/Pro-Con Ratio) यदि वास्तविक बहस में 10 लोगों ने "हाँ" कहा और 2 ने "नहीं" कहा, तो क्या सारांश उसी 10-से-2 के विभाजन को दिखाता है? या क्या इसने गलती से 10 "हाँ" और 0 "नहीं" दिखा दिया?
  • नियम 3: रस्साकशी में कौन जीता? (स्वीकार्यता/Acceptability) वास्तविक बहस में, क्या "हाँ" टीम जीती? क्या सारांश ने भी दिखाया कि "हाँ" टीम जीत गई?
  • नियम 4: क्या तीव्रता सही है? (संतुलन/Balance) यदि वास्तविक बहस में "हाँ" टीम थोड़े से अंतर से जीत रही थी, तो क्या सारांश दिखाता है कि वे एक बड़ी जीत के साथ जीते? (यह एक सामान्य AI गलती है: चीजों को जितना वे हैं उससे अधिक निश्चित दिखाना)।
  • नियम 5: क्या सटीक स्कोर करीब है? (सटीकता/Accuracy) यदि वास्तविक स्कोर 55% "हाँ" था, तो क्या सारांश का स्कोर 55% के करीब है, या यह बहुत ज्यादा अलग है?

उन्होंने क्या पाया:
उन्होंने वास्तविक यूरोपीय संसद की बहसों का उपयोग करके विभिन्न AI मॉडलों (जैसे क्लॉड और लामा) पर इसका परीक्षण किया।

  • पुराना तरीका (शब्द गणना): AI सारांश बेहतरीन दिखे! उन्होंने समान शब्दों का उपयोग किया और वे बुद्धिमान लगे।
  • नया तरीका (युद्ध मानचित्र): सारांश तर्क की कसौटी में विफल रहे।
    • AI अक्सर "नहीं" टीम को अनदेखा कर देता था। यह एक गरमागरम बहस को ऐसे सारांशित कर देता था जैसे कि सभी सहमत हों।
    • इसने विवादास्पद मुद्दों को (जहाँ रस्सी बीच में थी) तय तथ्यों (जहाँ रस्सी को पूरी तरह से एक तरफ खींच लिया गया था) में बदल दिया।
    • अनिवार्य रूप से, AI संघर्ष को "सुचारू" (smoothing over) कर रहा था, जिससे बहस बहुत अधिक शांतिपूर्ण और एकतरफा लग रही थी।

निष्कर्ष:
यदि हम चाहते हैं कि AI हमें लोकतंत्र को समझने में मदद करे, तो हमें केवल इसे "पाठ का सारांश" करने के लिए नहीं कहना चाहिए। हमें इसे "तर्क का सारांश" करने के लिए कहना होगा।

यह शोध पत्र हमें एक पैमाना देता है जिससे हम माप सकें कि क्या एक AI हमसे झूठ बोल रहा है कि बहस में कौन जीता, कौन हारा, और उन्होंने कितनी कड़ी टक्कर दी। यह एक रेफरी के स्कोरकार्ड की जांच करने जैसा है ताकि यह सुनिश्चित किया जा सके कि खेल में धांधली नहीं हुई है, भले ही रेफरी की रिपोर्ट बहुत अच्छी तरह से लिखी गई हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →