← नवीनतम पेपर
💬 NLP

Re3: A Holistic Framework and Dataset for Modeling Collaborative Document Revision

यह शोध पत्र Re3 को प्रस्तुत करता है, जो एक समग्र ढांचा और इसके साथ संलग्न Re3-Sci डेटासेट है जिसमें एनोटेटेड वैज्ञानिक शोध पत्रों के संशोधन, समीक्षाएं और संपादन सारांश शामिल हैं, ताकि सहयोगात्मक दस्तावेज़ संशोधन की मॉडलिंग को सक्षम बनाया जा सके और संपादन विश्लेषण को स्वचालित करने तथा टेक्स्ट-आधारित सहयोग को सुगम बनाने में बड़े भाषा मॉडलों (large language models) की क्षमताओं का मूल्यांकन किया जा सके।

मूल लेखक: Qian Ruan, Ilia Kuznetsov, Iryna Gurevych

प्रकाशित 2026-01-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qian Ruan, Ilia Kuznetsov, Iryna Gurevych

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दोस्तों के एक समूह को मिलकर एक कहानी लिखने की कोशिश करते हुए देख रहे हैं। एक व्यक्ति एक पैराग्राफ का मसौदा तैयार करता है, दूसरा उसे पढ़ता है और कहता है, "यह हिस्सा भ्रमित करने वाला है, और यह तथ्य गलत है।" पहला व्यक्ति फिर उस पैराग्राफ को फिर से लिखता है, और तीसरा व्यक्ति एक नोट लिखता है जिसमें बताया गया है कि उन्होंने वे बदलाव क्यों किए।

यह शोध पत्र, जिसका शीर्षक Re3 है, यह समझने के लिए एक मानचित्र बनाने के बारे में है कि यह जटिल, उतार-चढ़ाव वाली प्रक्रिया वास्तव में कैसे काम करती है। लेखकों ने महसूस किया कि हालांकि कंप्यूटर टेक्स्ट पढ़ने में अच्छे हो रहे हैं, लेकिन वे बदलावों के पीछे की बातचीत को समझने में बहुत खराब हैं। वे एक ऐसा सिस्टम बनाना चाहते थे जो तीन चीजों को जोड़ता है:

  1. समीक्षा (The Review): फीडबैक (जैसे, "व्याकरण ठीक करें")।
  2. संशोधन (The Revision): टेक्स्ट में किए गए वास्तविक बदलाव।
  3. प्रतिक्रिया (The Response): लेखक द्वारा दिया गया उनका स्पष्टीकरण कि उन्होंने क्या किया।

समस्या: बड़ी तस्वीर को न देख पाना

इस शोध पत्र से पहले, शोधकर्ता इन टुकड़ों का अलग-अलग अध्ययन करते थे। उन्होंने देखा कि वाक्य कैसे बदलते हैं, या समीक्षाएँ कैसे लिखी जाती हैं, लेकिन उनके पास एक साथ पूरी तस्वीर देखने का कोई तरीका नहीं था। यह फिल्म को समझने के लिए केवल उसके ट्रेलर, स्क्रिप्ट और निर्देशक के नोट्स को अलग-अलग देखने जैसा है, बिना कभी पूरी फिल्म देखे।

लेखक तर्क देते हैं कि सहयोग कैसे किया जाता है, इसे वास्तव में समझने के लिए, आपको पूरा दस्तावेज़ देखना होगा और यह देखना होगा कि हर एक बदलाव बड़ी कहानी में कैसे फिट बैठता है।

समाधान: Re3 और "Re3-Sci" डेटासेट

इसे ठीक करने के लिए, टीम ने Re3 बनाया, जो इन दस्तावेजों का विश्लेषण करने के लिए एक नया ढांचा (नियमों और श्रेणियों का एक सेट) है। इसके बाद उन्होंने परीक्षण के लिए Re3-Sci नामक एक विशाल डेटासेट बनाया।

Re3-Sci को वैज्ञानिक शोध पत्रों के एक विशाल, व्यवस्थित पुस्तकालय के रूप में समझें जो पीयर-रिव्यू (सहकर्मी समीक्षा) प्रक्रिया से गुजरे हैं। प्रत्येक पेपर के लिए, उनके पास है:

  • मूल मसौदा।
  • अंतिम संस्करण।
  • समीक्षकों की टिप्पणियाँ।
  • लेखकों के उत्तर।

लेकिन उन्होंने केवल फाइलें एकत्र नहीं कीं; उन्होंने एक सुपर-डिटेक्टिव की तरह काम किया। उन्होंने इन शोध पत्रों में 11,600 विशिष्ट परिवर्तनों (संशोधनों) को मैन्युअल रूप से लेबल किया। प्रत्येक परिवर्तन के लिए, उन्होंने पूछा:

  • उन्होंने क्या किया? (क्या उन्होंने एक वाक्य जोड़ा? एक पैराग्राफ हटाया? दो विचारों को मिलाया?)
  • उन्होंने ऐसा क्यों किया? (क्या यह टाइपो ठीक करने के लिए था? एक नया तथ्य जोड़ने के लिए? या एक वैज्ञानिक दावे को बदलने के लिए?)
  • यह कहाँ हुआ? (क्या यह एक छोटा सा शब्द परिवर्तन था या पूरा सेक्शन दोबारा लिखा गया था?)

उन्होंने क्या खोजा (मानवीय अंतर्दृष्टि)

इस सभी डेटा को देखते हुए, लेखकों ने पाया कि मनुष्य संपादन कैसे करते हैं, इसके बारे में कुछ दिलचस्प पैटर्न हैं:

  • "बुकएंड्स" प्रभाव (The "Bookends" Effect): लोग पेपर की शुरुआत (प्रस्तावना/Introduction) और अंत (निष्कर्ष/Conclusion) में सबसे अधिक संपादन करते हैं। बीच का हिस्सा आमतौर पर स्थिर रहता है।
  • तथ्य बनाम प्रवाह (Fact vs. Flow): प्रक्रिया के शुरुआती चरण में, लोग मुख्य रूप से व्याकरण और स्पष्टता (वाक्यों को बेहतर प्रवाह देने) को ठीक करते हैं। बाद में, वे तथ्यों और वैज्ञानिक दावों को बदलने पर ध्यान केंद्रित करते हैं।
  • समीक्षक विशिष्ट होते हैं: जब कोई समीक्षक एक विशिष्ट, स्पष्ट निर्देश देता है (जैसे, "यहाँ एक साइटेशन जोड़ें"), तो लेखक आमतौर पर उसका पालन करते हैं। लेकिन यदि समीक्षक केवल कहता है "यह खंड कमजोर है," तो लेखक विशिष्ट बदलाव करने की कम संभावना रखते हैं।
  • सब कुछ नहीं बदलता: यहाँ तक कि उन शोध पत्रों में भी जिनमें "भारी संशोधन" किए गए हैं, अधिकांश टेक्स्ट वैसा ही रहता है। केवल लगभग 18% वाक्य वास्तव में बदले जाते हैं, और इससे भी कम वाक्य गहरे वैज्ञानिक कारणों से बदले जाते हैं।

क्या कंप्यूटर यह कर सकते हैं? (AI प्रयोग)

लेखकों ने यह भी पूछा: "क्या आधुनिक AI (लार्ज लैंग्वेज मॉडल्स) इस प्रक्रिया को समझ सकते हैं?"

उन्होंने AI का चार कार्यों पर परीक्षण किया:

  1. इरादे का अनुमान लगाना (Guessing the Intent): क्या AI एक बदलाव को देखकर अनुमान लगा सकता है कि वह व्याकरण के लिए था या एक नए तथ्य के लिए?
    • परिणाम: AI लगभग 70% सही था। यह काफी अच्छा है, लेकिन यह अभी भी एक "तथ्य" वाले बदलाव और एक "दावे" वाले बदलाव के बीच अंतर करने में संघर्ष करता है।
  2. परिवर्तनों का सारांश बनाना (Summarizing Changes): क्या AI सभी परिवर्तनों को पढ़ सकता है और लेखक के लिए एक संक्षिप्त सारांश लिख सकता है जिसे वह समीक्षकों को वापस भेज सके?
    • परिणाम: AI एक सारांश लिख सकता था, लेकिन कभी-कभी यह विवरण छोड़ देता था या तथ्यों को थोड़ा गलत कर देता था। यह "क्या किया गया" (जैसे, "हमने 5 चीजें हटाईं") के आधार पर परिवर्तनों को समूहित करने की प्रवृत्ति रखता था, बजाय इसके कि "यह कहाँ हुआ" (जैसे, "प्रस्तावना में, हमने बदला...")।
  3. समीक्षाओं को परिवर्तनों से मिलाना (Matching Reviews to Changes): क्या AI एक समीक्षक की टिप्पणी को उस विशिष्ट वाक्य से जोड़ सकता है जिसे लेखक ने बदला है?
    • परिणाम: AI इस मामले में बहुत अच्छा था, लगभग सटीक।
  4. समीक्षा अनुरोधों को खोजना (Finding Review Requests): क्या AI यह पहचान सकता है कि समीक्षा के कौन से वाक्य वास्तव में लेखक के लिए निर्देश हैं?
    • परिणाम: AI इन निर्देशों को पहचानने में बहुत अच्छा था।

निष्कर्ष

यह शोध पत्र यह दावा नहीं करता है कि AI अभी मानव संपादकों की जगह लेने के लिए तैयार है या यह हमारे लिए वैज्ञानिक शोध पत्र लिख सकता है। इसके बजाय, यह इस बात का पहला पूर्ण मानचित्र प्रदान करता है कि सहयोगात्मक लेखन वास्तव में कैसे होता है।

उन्होंने उपकरण, डेटा और नियम बनाए हैं ताकि कंप्यूटर सहयोग की "भाषा" सीख सकें। यह कंप्यूटर को सहयोग, समीक्षा और संशोधन के जटिल नृत्य के लिए एक शब्दकोश और व्याकरण पुस्तक देने जैसा है, ताकि भविष्य में, AI केवल यह अनुमान लगाने के बजाय कि वे क्या कर रहे हैं, वास्तव में मनुष्यों को एक साथ मिलकर बेहतर काम करने में मदद कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →