← नवीनतम पेपर
💬 NLP

Evalet: Evaluating Large Language Models through Functional Fragmentation

यह शोध पत्र Evalet को प्रस्तुत करता है, जो एक संवादात्मक प्रणाली है जो कार्यात्मक विखंडन (functional fragmentation) का उपयोग करके LLM-जनित आउटपुट को प्रमुख रूप से अलंकारिक घटकों में विभाजित करती है, जिससे अभ्यासकर्ताओं को अपारदर्शी समग्र स्कोर से आगे बढ़ने और सूक्ष्म, गुणात्मक विश्लेषण के माध्यम से विशिष्ट मूल्यांकन मिसअलाइनमेंट की पहचान करने में सक्षम बनाया जा सके।

मूल लेखक: Tae Soo Kim, Heechan Lee, Yoonjoo Lee, Joseph Seering, Juho Kim

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tae Soo Kim, Heechan Lee, Yoonjoo Lee, Joseph Seering, Juho Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान, लेकिन थोड़ी ज़रूरत से ज़्यादा उत्साही सहायक को काम पर रखा है, जिसका काम एक रोबोट द्वारा लिखे गए 100 निबंधों के ढेर को ग्रेड करना है।

पुराना तरीका (होलिस्टिक स्कोरिंग - समग्र स्कोरिंग):
आपका सहायक आपको एक रिपोर्ट कार्ड थमाता है। इसमें लिखा है: "निबंध #42: 5 में से ग्रेड 3। कारण: शब्दावली अच्छी है, लेकिन थोड़ा अजीब है।"
आप निबंध देखते हैं। आप वह अजीब हिस्सा देखते हैं, लेकिन आप एक शानदार पैराग्राफ भी देखते हैं जिसे आपने मिस कर दिया था। आप निबंध #43 को देखते हैं। उसे भी समान अस्पष्ट कारण के साथ "5 में से 3" मिला है। क्या वे एक ही तरह से अजीब हैं? क्या रोबोट ने वही गलती दोबारा की? आपको पता ही नहीं चलेगा। आपको यह समझने के लिए कि वास्तव में क्या हो रहा है, सभी 100 निबंध खुद पढ़ने होंगे। "5 में से 3" का स्कोर एक धुंधली तस्वीर की तरह है; यह बताता है कि वहां कुछ है, लेकिन यह नहीं कि क्या है।

नया तरीका (Evalet और फंक्शनल फ्रैगमेंटेशन - कार्यात्मक विखंडन):
इस पेपर के पीछे के शोधकर्ताओं, Evalet का कहना है: "हमें हमें धुंधली तस्वीरें देना बंद करें। आइए इन निबंधों को पहेली के टुकड़ों में काट दें।"

सिर्फ एक ग्रेड देने के बजाय, Evalet एक सुपर-पावर्ड माइक्रोस्कोप की तरह काम करता है। यह रोबोट के आउटपुट के हर एक वाक्य या वाक्यांश को लेता है, उसे टुकड़ों में काटता है, और पूछता है: "यह विशिष्ट टुकड़ा वास्तव में क्या कर रहा है?"

यह कैसे काम करता है, यहाँ कुछ रचनात्मक उपमाओं का उपयोग किया गया है:

1. "फंक्शन" लेबल (कार्य विवरण)

कल्पना कीजिए कि रोबोट ने कीटाणुओं से लड़ने वाले टी-सेल्स (शरीर के सैनिक) के बारे में एक कहानी लिखी है।

  • पुराना तरीका: सहायक कहता है, "यह बच्चों के लिए अच्छा है।"
  • Evalet: Evalet टेक्स्ट को काटता है और टुकड़ों को लेबल करता है:
    • टुकड़ा A: "टी-सेल्स नन्हे सैनिक हैं।" -> लेबल: मानवीकरण (जुड़ाव के लिए अच्छा)।
    • टुकड़ा B: "सूक्ष्म बंदूकें चलाना।" -> लेबल: युद्ध चित्रण (आयु-उपयुक्तता के लिए बुरा)।
    • टुकड़ा C: "दूसरे सैनिकों का उत्साह बढ़ाना।" -> लेबल: टीमवर्क रूपक (जुड़ाव के लिए अच्छा)।

अचानक, आप केवल "5 में से 3" का स्कोर नहीं देखते। आप सामग्रियों का एक मेनू देखते हैं। आप महसूस करते हैं कि कहानी मज़ेदार होने में (सैनिकों के माध्यम से) बहुत अच्छी है, लेकिन अनजाने में इसमें डरावने युद्ध के रूपक इस्तेमाल किए गए हैं जो शायद 5 साल के बच्चे को परेशान कर सकते हैं।

2. "मैप" (पड़ोस)

Evalet केवल इन टुकड़ों को सूचीबद्ध नहीं करता है; यह उन्हें एक 2D मैप पर रखता है।

  • एक शहर के नक्शे की कल्पना करें।
  • हर निबंध से जुड़े सभी "युद्ध चित्रण" के टुकड़े "वार डिस्ट्रिक्ट" (युद्ध क्षेत्र) में एक साथ रखे जाते हैं।
  • सभी "मज़ेदार चुटकुले" "कॉमेडी डिस्ट्रिक्ट" में होते हैं।
  • हरे बिंदु का अर्थ है कि टुकड़ा अच्छा था। लाल क्रॉस का अर्थ है कि वह बुरा था।

यदि आप "वार डिस्ट्रिक्ट" में लाल क्रॉस का एक बड़ा समूह देखते हैं, तो आप तुरंत जान जाते हैं: "हे, रोबोट युद्ध के रूपकों के प्रति जुनूनी है! हमें इसे रुकने के लिए कहना होगा।" आपको पैटर्न खोजने के लिए 100 निबंध नहीं पढ़ने पड़ते; मैप आपको सेकंडों में यह दिखा देता है।

3. "फीडबैक लूप" (सहायक को सिखाना)

पुराने सिस्टम में, यदि आप ग्रेड से असहमत थे, तो आप बस सहायक से बहस करते थे।
Evalet में, आप सहायक को सिखा सकते हैं

  • आप एक टुकड़ा देखते हैं जिसे "युद्ध चित्रण" लेबल किया गया है और आपको लगता है कि वह वास्तव में ठीक है।
  • आप एक बटन क्लिक करते हैं यह कहने के लिए, "नहीं, यह वास्तव में इस कार्य के लिए एक सकारात्मक उदाहरण है।"
  • आप एक अन्य टुकड़ा चुनते हैं जो "युद्ध चित्रण" है लेकिन बहुत डरावना है, और उसे नकारात्मक के रूप में चिह्नित करते हैं।
  • सिस्टम तुरंत सब कुछ फिर से मैप करता है। "वार डिस्ट्रिक्ट" छोटा हो जाता है या अपना रंग बदल लेता है। आप अनिवार्य रूप से वास्तविक उदाहरणों के आधार पर रोबोट को नए नियम दे रहे हैं, न कि केवल अमूर्त निर्देशों के आधार पर।

यह क्यों मायने रखता है?

इस पेपर ने वास्तविक लोगों (डेवलपर्स और शोधकर्ताओं) के साथ इसका परीक्षण किया।

  • Evalet के बिना: लोग भ्रमित थे। उन्हें ग्रेड पर भरोसा नहीं था। वे अंततः समय बर्बाद करते हुए मैन्युअल रूप से निबंध पढ़ ही रहे थे।
  • Evalet के साथ: लोगों ने 48% अधिक समस्याएं पाईं। वे ठीक से जानते थे कि ग्रेड कम क्यों था। वे सिस्टम पर अधिक भरोसा करते थे क्योंकि वे स्कोर के पीछे की "सामग्री" देख सकते थे।

बड़ी तस्वीर

Evalet को एक पेंटिंग को एक एकल संख्या (जैसे, "10/10") देने से लेकर कलाकार को एक ऐसी आलोचना देने के रूप में देखें जो कहती है:

"नीले रंग का आपका उपयोग शानदार है (9/10), लेकिन कोने में आपके ब्रशस्ट्रोक बिखरे हुए हैं (2/10), और विषय वस्तु नर्सरी के लिए थोड़ी अधिक डार्क है (1/10)।"

यह बातचीत को "क्या यह अच्छा है?" (एक अस्पष्ट भावना) से बदलकर "यहाँ बताया गया है कि वास्तव में क्या काम कर रहा है और क्या नहीं" (कार्रवाई योग्य डेटा) में बदल देता है।

संक्षेप में: Evalet AI आउटपुट को एक ब्लैक बॉक्स की तरह नहीं देखता जो सिर्फ एक ग्रेड उगल देता है। इसके बजाय, यह बॉक्स को खोलता है, सामग्री को उनके द्वारा किए जाने वाले कार्यों के आधार पर छाँटता है, और आपको एक मैप देता है ताकि आप सटीकता के साथ रोबोट के व्यवहार को ठीक कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →