← नवीनतम पेपर
💬 NLP

Refining and Reusing Annotation Guidelines for LLM Annotation

यह शोध पत्र एक पुनरावृत्ति मॉडरेशन ढांचे (iterative moderation framework) का प्रस्ताव करता है और अनुभवजन्य रूप से उसे मान्य करता है जो बायोमेडिकल नेम एन्टिटी रिकग्निशन कार्यों में लार्ज लैंग्वेज मॉडल्स को गोल्ड-स्टैंडर्ड बेंचमार्क के साथ संरेखित करने के लिए एनोटेशन दिशानिर्देशों को व्यवस्थित रूप से परिष्कृत और पुन: उपयोग करता है, जो दिशानिर्देश एकीकरण, तर्क-अनुकूलित मॉडल्स और न्यूनतम पर्यवेक्षण के तहत मॉडरेशन की प्रभावकारिता की पुष्टि करता है।

मूल लेखक: Kon Woo Kim, Jin-Dong Kim, Akiko Aizawa

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kon Woo Kim, Jin-Dong Kim, Akiko Aizawa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुपर-फास्ट रोबोट असिस्टेंट को मेडिकल टेक्स्ट पढ़ने और विशिष्ट बीमारियों को हाईलाइट करने के लिए सिखाने की कोशिश कर रहे हैं। वह रोबोट अविश्वसनीय रूप से स्मार्ट है; वह जानता है कि "हार्ट अटैक" या "डायबिटीज" क्या है। हालांकि, जब आप उसे एक विशिष्ट काम करने के लिए कहते हैं, तो वह छोटी-छोटी गलतियाँ करता है क्योंकि उसे वे सटीक, सख्त नियम नहीं पता जो आपकी टीम इस्तेमाल करती है।

मानव एनोटेटर्स (डेटा को लेबल करने वाले लोग) की दुनिया में, हम इसे एक नियम पुस्तिका (एनोटेशन गाइडलाइन) लिखकर हल करते हैं। यदि कोई इंसान गलती करता है, तो एक सुपरवाइजर उनके काम की समीक्षा करता है, उनकी गलती बताता है, और नियम पुस्तिका को अपडेट करता है ताकि सभी सीख सकें।

यह पेपर पूछता है: क्या हम AI के साथ भी ऐसा कर सकते हैं? क्या हम एक मौजूदा नियम पुस्तिका ले सकते हैं, AI को उसका पालन करने दे सकते हैं, उसकी गलतियाँ ढूँढ सकते हैं, और फिर AI का उपयोग स्वयं नियम पुस्तिका को अधिक स्पष्ट बनाने के लिए कर सकते हैं?

यहाँ बताया गया है कि उन्होंने इसे एक सरल उपमा (analogy) के माध्यम से कैसे परीक्षण किया।

सेटअप: द "रोबोट इंटर्न" और "द रूलबुक"

शोधकर्ताओं ने लार्ज लैंग्वेज मॉडल (LLM) के साथ एक नए रोबोट इंटर्न जैसा व्यवहार किया।

  1. कार्य: इंटर्न को मेडिकल एब्स्ट्रैक्ट्स (सारांश) पढ़ने और बीमारी के नामों को हाईलाइट करने का काम दिया गया है।
  2. समस्या: यदि आप सिर्फ कहें "बीमारियों को खोजो," तो इंटर्न अनुमान लगाने लगता है। वह बीमारी के बजाय लक्षण को हाईलाइट कर सकता है, या किसी लिस्ट में छिपी हुई बीमारी को छोड़ सकता है।
  3. समाधान: आप इंटर्न को एक नियम पुस्तिका (एनोटेशन गाइडलाइन्स) देते हैं।

तीन बड़े प्रश्न (परिकल्पनाएं)

टीम तीन चीजें साबित करना चाहती थी:

  1. क्या नियम पुस्तिका मदद करती है? (परिकल्पना 1)

    • उपमा: क्या इंटर्न को एक मैनुअल देने से वह केवल अनुमान लगाने की तुलना में बेहतर बनता है?
    • परिणाम: हाँ। जब उसके पास पालन करने के लिए विशिष्ट नियम थे, तो रोबोट बहुत बेहतर हो गया।
  2. क्या "सोचने वाले" रोबोट बेहतर काम करते हैं? (परिकल्पना 2)

    • उपमा: कुछ रोबोट बस तेजी से जवाब देते हैं (Non-Reasoning)। अन्य रुकते हैं, कदम-दर-कदम सोचते हैं, और तर्क का विश्लेषण करते हैं (Reasoning)। कौन जटिल नियम पुस्तिका को बेहतर समझता है?
    • परिणाम: हाँ। "सोचने वाले" रोबोट नियमों की बारीकियों को समझने में काफी बेहतर थे।
  3. क्या रोबोट अपने स्वयं के मैनुअल को ठीक कर सकता है? (परिकल्पना 3)

    • उपमा: कल्पना कीजिए कि इंटर्न कोई गलती करता है। मानव बॉस द्वारा मैनुअल को ठीक करने के बजाय, इंटर्न उस गलती को देखता है, यह पता लगाता है कि वह क्यों हुई, और इसे अगली बार रोकने के लिए एक नया, स्पष्ट नियम लिखता है।
    • परिणाम: हाँ। रोबोट सफलतापूर्वक नियमों को परिष्कृत कर सका, हालांकि सुधार छोटे लेकिन निरंतर थे।

प्रक्रिया: "सेल्फ-करेक्टिंग लूप" (स्वयं सुधारने वाला चक्र)

लेखकों ने एक सिस्टम बनाया है जो वास्तविक काम शुरू होने से पहले एक रिहर्सल लूप की तरह कार्य करता है। यह कैसे काम करता है:

  1. ट्रायल रन: रोबोट इंटर्न वर्तमान नियम पुस्तिका का उपयोग करके 10 मेडिकल दस्तावेजों के एक छोटे सेट को पढ़ता है।
  2. ग्रेडिंग: सिस्टम रोबोट के हाइलाइट्स की तुलना "गोल्ड स्टैंडर्ड" (परफेक्ट ह्यूमन आंसर्स) से करता है।
  3. डिटेक्टिव वर्क (जासूसी): यदि रोबोट ने कुछ छोड़ दिया या गलत चीज़ को हाईलाइट किया, तो सिस्टम इन त्रुटियों को समूहों में बांट देता है।
    • उदाहरण: "ओह, रोबोट 'with/of' वाक्य संरचना में सूचीबद्ध बीमारियों को बार-बार मिस कर रहा है।"
  4. रीराइट (मॉडरेशन): रोबोट एक सुपरवाइजर की भूमिका निभाता है। वह त्रुटि को देखता है, समझाता है कि यह क्यों हुई, और इसे ठीक करने के लिए एक नया नियम लिखता है।
    • नया नियम: "यदि कोई बीमारी 'with' या 'of' वाक्यांश में सूचीबद्ध है, तो उसे अनदेखा न करें! उसे हाईलाइट करें।"
  5. दोहराना: रोबलेट नए नियम पुस्तिका के साथ उन 10 दस्तावेजों को फिर से पढ़ता है। यदि वह बेहतर होता है, तो बहुत अच्छा। यदि नहीं, तो वह रुक जाता है।

परिणाम: वास्तव में क्या हुआ?

  • नियम पुस्तिका मायने रखती है: बिना नियमों के, रोबोट ठीक था लेकिन बहुत अच्छा नहीं। नियमों के साथ, वह बहुत अच्छा हो गया।
  • सोचना मदद करता है: "सोचने वाले" मॉडल (जो तर्क करने के लिए रुकते हैं) स्वचालित मॉडलों की तुलना में नियमों का पालन बहुत बेहतर तरीके से करते हैं।
  • "सेल्फ-करेक्शन" वास्तविक है लेकिन छोटा है: रोबोट द्वारा अपने स्वयं के मैनुअल को फिर से लिखने की प्रक्रिया काम कर गई। इसने विशिष्ट त्रुटियों को ठीक किया (जैसे लिस्ट में बीमारियों को मिस करना)। हालाँकि, सुधार बहुत बड़ा उछाल नहीं था; यह सही दिशा में एक छोटा, स्थिर धक्का था (लगभग 1-3% बेहतर)।

कमियां (सीमाएं)

लेखक कुछ बातों की ओर ध्यान दिलाना चाहते थे:

  • सैंपल साइज: उन्होंने रोबोट को नियम कैसे लिखने के लिए सिखाने हेतु केवल 10 दस्तावेजों का उपयोग किया। यह 10 वाक्यों का अध्ययन करके पूरी भाषा सीखने की कोशिश करने जैसा है। यह एक त्वरित परीक्षण के लिए काम करता है, लेकिन यह उन बड़े पैटर्न को मिस कर सकता है जो केवल 1,000 दस्तावेजों में दिखाई देते हैं।
  • लागत बनाम गति: कुछ रोबोट (जैसे "सोचने वाले") महंगे और धीमे होते हैं। अन्य सस्ते और तेज़ होते हैं लेकिन अधिक गलतियाँ करते हैं। यहाँ एक ट्रेड-ऑफ (समझौता) है।
  • "गोल्ड" की आवश्यकता: इस पूरे सिस्टम को चेक करने के लिए एक परफेक्ट "गोल्ड स्टैंडर्ड" उत्तर कुंजी की आवश्यकता होती है। यदि आपके पास शुरू करने के लिए मानव-लिखित नियम पुस्तिका नहीं है, तो यह विशिष्ट विधि काम नहीं करती है।

निष्कर्ष

यह पेपर दिखाता है कि हम AI एनोटेशन को एक प्रशिक्षण कार्यक्रम की तरह मान सकते हैं। केवल यह उम्मीद करने के बजाय कि AI सही करेगा, हम इसे एक नियम पुस्तिका दे सकते हैं, इसे अभ्यास करने दे सकते हैं, इसे अपनी गलतियों का विश्लेषण करने दे सकते हैं, और इसे स्पष्टता के लिए नियम पुस्तिका को फिर से लिखने के लिए कह सकते हैं।

यह कोई जादुई छड़ी नहीं है जो AI को तुरंत पूर्ण बना देती है, बल्कि यह एक सुपर-स्मार्ट रोबोट को उन विशिष्ट, उबाऊ, विस्तृत नियमों के साथ व्यवस्थित रूप से संरेखित (align) करने का एक प्रमाणित तरीका है जिनका पालन करने की आवश्यकता मनुष्यों को होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →