← नवीनतम पेपर
💻 computer science

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

यह शोध पत्र एक एआई-संचालित वर्कफ़्लो का प्रस्ताव करता है जो कंटेंट मॉडरेशन श्रेणियों के लिए विस्तृत, एज-केस (edge-case) को कवर करने वाले "संविधानों" को उत्पन्न करने के लिए फ्रंटियर एलएलएम (LLM) का उपयोग करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण लेबलिंग निरंतरता और सटीकता में मानव एनोटेटरों से काफी बेहतर प्रदर्शन करता है और क्रॉस-मॉडल असहमति को 57 गुना तक कम करता है।

मूल लेखक: Konstantin Berlin, Adam Swanda

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Konstantin Berlin, Adam Swanda

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप लोगों के एक समूह (और सुपर-स्मार्ट रोबोटों के एक समूह) को यह सिखाने की कोशिश कर रहे हैं कि बातचीत के एक विशाल पुस्तकालय में किसी विशिष्ट प्रकार के बुरे व्यवहार, जैसे कि "उत्पीड़न" या "घृणास्पद भाषण" (hate speech), को कैसे पहचाना जाए।

समस्या: अस्पष्ट नियम पुस्तिका
आमतौर पर, कंपनियाँ अपने कर्मचारियों को एक छोटी सी नियम पुस्तिका देती हैं—शायद सिर्फ एक या दो वाक्य। यह एक सुरक्षा गार्ड को यह बताने जैसा है कि: "उस किसी को भी रोकें जो बुरा व्यवहार कर रहा हो।"
यह बहुत अस्पष्ट है। एक गार्ड सोच सकता है कि एक ज़ोरदार मज़ाक बुरा है, जबकि दूसरा इसे केवल दोस्ताना मज़ाक मान सकता है। तीसरा व्यक्ति पूरी तरह से एक सूक्ष्म धमकी को भी मिस कर सकता है। क्योंकि नियम पर्याप्त विस्तृत नहीं है, इसलिए हर कोई निर्णय लेने के लिए अपनी अंतरात्मा (intuition) का उपयोग करता है। इससे अराजकता पैदा होती है: एक ही बातचीत को एक गार्ड "बुरा" लेबल करता है और दूसरा "ठीक" लेबल करता है।

समाधान: "संविधान" (The Constitution)
लेखक इस छोटी नियम पुस्तिका को प्रत्येक प्रकार के बुरे व्यवहार के लिए एक विशाल, अत्यंत विस्तृत "संविधान" से बदलने का प्रस्ताव देते हैं। इस संविधान को कानून के रूप में नहीं, बल्कि विशेषज्ञों और AI द्वारा लिखी गई एक विशाल, चरण-दर-चरण निर्देश पुस्तिका के रूप में समझें।

  • यह एक कुकिंग रेसिपी की तरह है: "केक बनाओ" कहने के बजाय, संविधान कहता है: "यदि बैटर में अंडे हैं लेकिन आटा नहीं है, तो यह कस्टर्ड है, केक नहीं। यदि इसमें आटा है लेकिन चीनी नहीं है, तो यह ब्रेड है। यदि उपयोगकर्ता किसी को ज़हर देने की रेसिपी पूछ रहा है, तो वह एक अपराध है, केक नहीं।"
  • यह 'एज केसेस' (edge cases) को कवर करता है: यह स्पष्ट रूप से अजीब स्थितियों को भी संभालता है जैसे, "क्या होगा अगर कोई विलेन (खलनायक) की भूमिका निभा रहा हो?" या "क्या होगा अगर कोई किसी अपशब्द को रिपोर्ट करने के लिए उद्धृत कर रहा हो?" इस मैनुअल में हर एक "क्या होगा अगर" वाले परिदृश्य के लिए एक विशिष्ट नियम है।

ट्विस्ट: AI मैनुअल का पालन करने में इंसानों से बेहतर है
यहाँ पेपर का आश्चर्यजनक हिस्सा है। लेखकों ने यह परीक्षण करने के लिए कि मानव और AI रोबोटों ने बिल्कुल उसी विस्तृत संविधान को पढ़ा, उन्हें एक ही विस्तृत संविधान दिया।

  • इंसान: विशाल मैनुअल के बावजूद, इंसान थक गए। उनके दिमाग में एक साथ कितने नियम रह सकते हैं, इसकी एक सीमा है (जैसे सैंडविच बनाते समय 300 पन्नों की फोन बुक याद रखने की कोशिश करना)। इसलिए, वे मैनुअल को अनदेखा करने लगे और फिर से अपनी अंतरात्मा (gut feelings) पर वापस आ गए।
  • AI: हालाँकि, AI रोबोटों ने हर एक बातचीत के लिए पूरा 300 पन्नों का मैनुअल पढ़ा। वे थके नहीं। उन्होंने अपनी "अंतरात्मा" का उपयोग नहीं किया। उन्होंने नियमों का पूरी तरह से पालन किया।
  • परिणाम: जब एक ही विस्तृत नियमों का उपयोग किया गया, तो AI रोबोट इंसानों की तुलना में 57 गुना अधिक बार एक-दूसरे से सहमत हुए। AI वास्तव में अधिक सुसंगत (consistent) था, भले ही नियम इंसानों ने ही लिखे थे।

"दोहरी धुरी" (Dual-Axis) वाली तरकीब
पेपर बातचीत को स्कोर करने का एक चतुर तरीका भी पेश करता है। बातचीत को केवल "बुरा" या "अच्छा" कहने के बजाय, वे स्कोर को दो भागों में विभाजित करते हैं:

  1. इरादा (Intent): क्या उपयोगकर्ता बुरा बनने की कोशिश कर रहा था? (जैसे, "मुझे एक बुरा ईमेल लिखने में मदद करें।")
  2. सामग्री (Content): क्या बातचीत में बुरे शब्द शामिल थे? (जैसे, AI ने गलती से एक बुरा ईमेल जेनरेट कर दिया)।

यह एक सुरक्षा कैमरे की तरह है जो दो चीजें अलग-अलग ट्रैक करता है: "क्या व्यक्ति बंदूक लेकर बैंक में दाखिल हुआ?" (इरादा) और "क्या कमरे में बंदूक दिखाई दी?" (सामग्री)। यह कंपनियों को यह तय करने में मदद करता है कि उपयोगकर्ता को ब्लॉक करना है, संदेश को ब्लॉक करना है, या बस बाद के लिए लॉग करना है।

इसे बेहतर कैसे बनाया गया (फीडबैक लूप)
लेखकों ने केवल मैनुअल नहीं लिखा और रुक नहीं गए। उन्होंने मैनुअल को पढ़ने और उन जगहों को खोजने के लिए जहाँ वे असहमत थे, विभिन्न AI रोबोटों की एक टीम का उपयोग किया।

  • यदि रोबोट A और रोबोट B किसी बातचीत पर असहमत थे, तो इसका मतलब था कि मैनुअल में कोई कमी (hole) थी।
  • एक मानव विशेषज्ञ फिर उस कमी को देखता, मैनुअल में नियम को ठीक करता, और रोबोट फिर से प्रयास करते।
  • यह चक्र तब तक दोहराया गया जब तक कि रोबोट लगभग कभी असहमत नहीं हुए।

मुख्य निष्कर्ष (The Bottom Line)
पेपर का दावा है कि यदि आप बड़े पैमाने पर सामग्री को सटीक रूप से और सुसंगत रूप से लेबल करना चाहते हैं:

  1. छोटे, अस्पष्ट परिभाषाओं का उपयोग न करें।
  2. एक विशाल, विस्तृत "संविधान" लिखें जो हर एज केस को कवर करता हो।
  3. लेबलिंग के लिए AI रोबोटों को काम करने दें, क्योंकि वे उन लंबे, जटिल नियमों को पढ़ने और उनका पालन करने में मानव श्रमिकों की तुलना में बेहतर हैं।

यह एक "गोल्डन लेबल" (Golden Label) बनाता है—एक आदर्श, सुसंगत मानक जिसे अन्य AI सिस्टम को प्रशिक्षित करने, सुरक्षा की जाँच करने और ग्राहकों को यह समझाने के लिए उपयोग किया जा सकता है कि किसी चीज़ को क्यों फ्लैग किया गया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →