← नवीनतम पेपर
💬 NLP

HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment

यह शोध पत्र HarmMetric Eval प्रस्तुत करता है, जो एक व्यवस्थित बेंचमार्क है जो यह प्रकट करता है कि पारंपरिक संदर्भ-आधारित मेट्रिक्स सूक्ष्म-स्तरीय हानिकारक मूल्यांकन में LLM-आधारित जजों से बेहतर प्रदर्शन कर सकते हैं, जिससे इन मेट्रिक्स को एकीकृत करने वाले एक उन्नत जज का डिज़ाइन तैयार हुआ है जो अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपनी कंपनी के लिए कहानियाँ लिखने, सवालों के जवाब देने और डेटा जेनरेट करने के लिए सुपर-स्मार्ट रोबोट्स (लार्ज लैंग्वेज मॉडल्स, या LLMs) की एक विशाल सेना काम पर रखी है। ये रोबोट अविश्वसनीय रूप से प्रतिभाशाली हैं, लेकिन उनका एक खतरनाक पक्ष भी है: कभी-कभी वे अनजाने में (या जानबूझकर) बम बनाने, बैंक लूटने या लोगों को ठगने के निर्देश लिखना शुरू कर देते हैं।

आपका काम है सेफ्टी इंस्पेक्टर (सुरक्षा निरीक्षक) बनना। आपको एक ऐसा तरीका चाहिए जिससे आप इन रोबोट्स द्वारा लिखे गए हर टेक्स्ट की तेज़ी से जांच कर सकें और कह सकें, "यह खतरनाक है, इसे फेंक दो," या "यह सुरक्षित है, इसे रखो।"

यह पेपर, HarmMetric Eval, उन टॉर्चों (टूल्स) का परीक्षण करने के बारे में है जिनका उपयोग आप खतरनाक टेक्स्ट को खोजने के लिए करते हैं।

समस्या: टूटी हुई टॉर्चें

काफी समय से, सभी ने यह मान लिया था कि सबसे अच्छी टॉर्च एक सुपर-इंटेलिजेंट रोबोट जज (एक LLM-आधारित जज) होगी। तर्क यह था: "चूंकि बुरा टेक्स्ट एक स्मार्ट रोबोट द्वारा लिखा गया है, इसलिए केवल दूसरा सुपर-स्मार्ट रोबोट ही इसकी बारीकियों को समझ सकता है और इसे पकड़ सकता है।"

हालाँकि, इस पेपर के लेखकों ने इन टॉर्चों का परीक्षण करने के लिए एक विशाल ट्रेनिंग डोजो (प्रशिक्षण केंद्र) (3,500+ उदाहरणों का एक डेटासेट) बनाया। उन्होंने पेचीदा स्थितियाँ बनाईं, जैसे:

  • असली खतरा: एक रोबोट जो बैंक लूटने का स्टेप-बाय-स्टेप गाइड दे रहा है।
  • नकली खतरा: एक रोबोट जो कहता है "ज़रूर, मैं मदद कर सकता हूँ!" लेकिन फिर रुक जाता है और आगे कुछ नहीं कहता।
  • ध्यान भटकाना: एक रोबोट जो बैंक लूटने के बारे में पूछे जाने पर मौसम जैसे किसी बिल्कुल अलग विषय पर बात कर रहा है।
  • इनकार (Refusal): एक रोबोट जो कहता है, "मैं यह नहीं कर सकता, यह अवैध है।"

जब उन्होंने इन सुपर-इंटेलिजेंट रोबोट जजों का इस डोजो में परीक्षण किया, तो उन्हें एक चौंकाने वाला सरप्राइज मिला: रोबोट जज अक्सर चकमा खा रहे थे। वे "नकली खतरे" (वह रोबोट जिसने सिर्फ "ज़रूर" कहा और रुक गया) को देखकर सोचते थे, "ओह नहीं! यह खतरनाक है!" क्योंकि वह आत्मविश्वास से भरा लग रहा था। वे खाली शब्दों से बहुत आसानी से मूर्ख बन जाते थे।

सरप्राइज विनर: पुराना-स्कूल टेप मेजर

यहाँ एक ट्विस्ट है: जो टूल्स सबसे अच्छा प्रदर्शन कर रहे थे, वे सुपर-स्मार्ट रोबोट्स बिल्कुल नहीं थे। वे पुराने-स्कूल के, साधारण स्ट्रिंग-मैचिंग टूल्स (जैसे ROUGE और METEOR) थे।

उपमा (Analogy):
कल्पना कीजिए कि आप सूप में एक विशिष्ट प्रकार के ज़हर की तलाश कर रहे हैं।

  • रोबोट जज एक बेहतरीन शेफ की तरह है जो सूप को चखता है और "वाइब" (vibe) और "फ्लेवर प्रोफाइल" के आधार पर अंदाज़ा लगाने की कोशिश करता है कि क्या यह ज़हर है। कभी-कभी शेफ एक अजीब मसाले से भ्रमित हो जाता है और सोच लेता है कि सुरक्षित सूप ज़हर है।
  • पुराना-स्कूल टूल एक मेटल डिटेक्टर की तरह है। उसे "वाइब" से कोई फर्क नहीं पड़ता। वह बस यह चेक करता है: "क्या इस सूप में ज़हर का विशिष्ट रासायनिक सूत्र मौजूद है?"

पेपर में पाया गया कि "नकली खतरों" (जहाँ रोबोट सिर्फ सहमत होता है लेकिन वास्तव में कोई निर्देश नहीं देता) को पकड़ने के लिए, मेटल डिटेक्टर वास्तव में सुपर-स्मार्ट रोबोट्स की तुलना में अधिक विश्वसनीय था। साधारण टूल्स यह समझने में बेहतर थे कि, "हे, इस उत्तर ने वास्तव में कोई नई जानकारी नहीं दी, इसलिए यह खतरनाक नहीं है।"

समाधान: एक बेहतर जज

लेखकों ने केवल समस्या की ओर इशारा नहीं किया; उन्होंने इसे ठीक भी किया। उन्होंने एक नया सुपर-जज (जिसे HarmJudge और HarmClassifier कहा गया) बनाया जिसमें दो विशेष अपग्रेड थे:

  1. एक बेहतर नियम पुस्तिका: उन्होंने नए जज को एक बहुत ही सख्त, तीन-चरणीय चेकलिस्ट दी, जिसे सरल भाषा में लिखा गया था:

    • क्या यह असुरक्षित है? (क्या यह वास्तव में खतरनाक है?)
    • क्या यह प्रासंगिक है? (क्या यह वास्तव में सवाल का जवाब दे रहा है, या सिर्फ बकवास कर रहा है?)
    • क्या यह उपयोगी है? (क्या यह वास्तव में ऐसे निर्देश देता है जो काम कर सकें, या यह सिर्फ खाली बातें हैं?)
    • परिणाम: इसने जज को "खाली बातों" पर घबराने से रोक दिया।
  2. सर्वश्रेष्ठ पर प्रशिक्षण: उन्होंने "पुराने-स्कूल के मेटल डिटेक्टर्स" (ROUGE टूल्स) को लिया और उनका उपयोग नए रोबोट जज को सिखाने के लिए किया। उन्होंने रोबोट को दिखाया: "देखो, जब मेटल डिटेक्टर कहता है 'कोई ज़हर नहीं है', तो तुम्हें सहमत होना चाहिए, भले ही टेक्स्ट डरावना लग रहा हो।"

परिणाम

नया, प्रशिक्षित रोबोट जज गोल्ड स्टैंडर्ड (स्वर्ण मानक) बन गया। यह पुराने रोबोट जजों से बेहतर था, साधारण स्ट्रिंग मैचर्स से बेहतर था, और यह उन पेचीदा "नकली खतरों" को पहचान सकता था जिन्होंने सबको भ्रमित कर दिया था।

यह क्यों मायने रखता है

डेटा प्रबंधन के भविष्य के लिए यह एक बड़ी बात है। जैसे-जैसे हम (समाचार, कोड, कहानियों आदि के लिए) अधिक और अधिक डेटा जेनरेट करने के लिए AI का उपयोग कर रहे हैं, हमें उस बुरे हिस्से को स्वचालित रूप से फ़िल्टर करने के तरीके की आवश्यकता है।

  • पहले: हम सुरक्षा गार्ड होने के लिए "सबसे स्मार्ट AI" पर अंधा विश्वास करते थे।
  • अब: हम जानते हैं कि कभी-कभी, एक साधारण, नियम-आधारित जांच बेहतर होती है, और हम अपने AI गार्ड्स को स्मार्ट बना सकते हैं, उन्हें यह सिखाकर कि वे वास्तविक नुकसान को देखें, न कि केवल डरावने-दिखने वाले शब्दों को।

संक्षेप में: इस पेपर ने सुरक्षा टूल्स का परीक्षण करने के लिए एक जिम बनाया, यह खोजा कि "स्मार्ट" जज खाली बातों से आसानी से मूर्ख बन जाते हैं, "डम्ब" (साधारण) टूल्स ने नकली चीज़ों को पहचानने में आश्चर्यजनक रूप से अच्छा प्रदर्शन किया, और फिर उस ज्ञान का उपयोग करके एक परम सुरक्षा गार्ड बनाया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →