DIALEVAL: Automated Type-Theoretic Evaluation of LLM Instruction Following
यह शोधपत्र DIALEVAL को प्रस्तुत करता है, जो एक प्रकार-सैद्धांतिक (type-theoretic) ढांचा है जो निर्देशों को विभेदित संतुष्टि अर्थों (differentiated satisfaction semantics) वाले टाइप किए गए विधेयकों (typed predicates) में स्वचालित रूप से विघटित करने के लिए दोहरे LLM एजेंटों का उपयोग करता है, जिससे मौजूदा बेसलाइन की तुलना में, विशेष रूप से जटिल और बहु-चरण संवादात्मक संदर्भों में, काफी अधिक सटीकता और मानव निर्णय के साथ मजबूत संरेखण प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सख्त शिक्षक हैं जो एक छात्र के होमवर्क को ग्रेड दे रहे हैं। छात्र को नियमों के एक बहुत ही विशिष्ट सेट का पालन करना होगा: "एक बिल्ली के बारे में एक कहानी लिखें, लेकिन यह ठीक 50 शब्दों की होनी चाहिए, इसका स्वर दुखद होना चाहिए, और इसमें संख्या 42 शामिल होनी चाहिए।"
अतीत में, छात्र द्वारा इन नियमों का पालन करने की जाँच करना एक बुरा सपना था। आपको हर कहानी को पढ़ना पड़ता, शब्दों को गिनना पड़ता, स्वर की जाँच करनी पड़ती, और अन्य शिक्षकों के साथ बहस करनी पड़ती कि क्या "50 शब्द" का अर्थ "ठीक 50" था या "लगभग 50"। कभी-कभी आप गलत हो जाते थे क्योंकि आप थक गए थे या नियम बहुत अस्पष्ट थे।
DIALEVAL ऐसा लगता है जैसे आपने अपने लिए दो सुपर-स्मार्ट, विशेषज्ञ रोबोट सहायक काम पर रखे हों, लेकिन एक ट्विस्ट के साथ: वे केवल कहानी नहीं पढ़ते; वे नियम के प्रकार को भी समझते हैं।
यह यहाँ कैसे काम करता है, सरल अवधारणाओं में विभाजित है:
1. दो-रोबोट टीम
एक रोबोट द्वारा सब कुछ करने की कोशिश करने के बजाय, DIALEVAL एक दो-एजेंट टीम का उपयोग करता है:
ब्रेकडाउन बॉट (द एनालिस्ट): यह रोबोट शिक्षक के निर्देशों को पढ़ता है और उन्हें छोटे-छोटे, समझने योग्य टुकड़ों में तोड़ देता है। यह एक जटिल रेसिपी को हर एक सामग्री और चरण को अलग-अलग सूचीबद्ध करने जैसा है।
- उदाहरण: यदि निर्देश है "एक बिल्ली के बारे में एक दुखद कहानी ठीक 50 शब्दों में लिखें," तो यह बॉट इसे अलग करता है:
- सामग्री (Content): बिल्ली के बारे में होना चाहिए।
- शैली (Style): दुखद होनी चाहिए।
- प्रारूप (Format): ठीक 50 शब्द होने चाहिए।
- महत्वपूर्ण रूप से, यह सुनिश्चित करता है कि ये चरण आपस में न टकराएं। यह उन्हें स्वतंत्र कार्यों के रूप में मानता है।
- उदाहरण: यदि निर्देश है "एक बिल्ली के बारे में एक दुखद कहानी ठीक 50 शब्दों में लिखें," तो यह बॉट इसे अलग करता है:
ग्रेडिंग बॉट (द इवैलुएटर): यह रोबोट छात्र की कहानी लेता है और उसकी सूची के विरुद्ध जाँच करता है। लेकिन जादू यह है: यह नियम के प्रकार के आधार पर अलग तरह से ग्रेड देता है।
- "सामग्री" के लिए (बिल्ली): यह लचीला है। यदि कहानी "बिल्ली" के बजाय "बिल्ली के बच्चे (feline)" के बारे में है, या यदि बिल्ली "म्याऊँ" करने के बजाय "पुर्रा" रही है, तो बॉट कहता है, "काफी हद तक सही! यह वही विचार है।" यह मानवीय भाषा की बारीकियों को समझता है।
- "संख्याओं" के लिए (50 शब्द): यह एक बाज की तरह है। यदि कहानी 49 शब्द या 51 शब्द की है, तो यह तुरंत छात्र को फेल कर देता है। "काफी हद तक सही" जैसा कुछ भी मान्य नहीं है।
- "शैली" के लिए (दुख): यह समग्र मूड को देखता है, जैसे एक संगीत समीक्षक किसी गाने के वाइब (vibe) का निर्णय लेता है।
2. यह एक बड़ी बात क्यों है
DIALEVAL से पहले, स्वचालित ग्रेडिंग सिस्टम एक कुंद हथौड़े की तरह थे। वे हर चीज़ के लिए एक ही सख्त नियमों का उपयोग करते थे।
- वे एक बिल्ली के बारे में कहानी को केवल इसलिए फेल कर देते थे क्योंकि उसने "फलाइन" (feline) शब्द का उपयोग किया था (सामग्री के लिए बहुत सख्त)।
- वे एक कहानी को स्वीकार कर सकते थे जो 100 शब्द लंबी थी क्योंकि उन्होंने गणित की जाँच नहीं की थी (संख्याओं के लिए बहुत ढीला)।
DIALEVAL एक अनुकूलित ग्रेडिंग रूब्रिक की तरह है। यह जानता है कि मनुष्य शब्दों के साथ लचीले होते हैं लेकिन गणित के साथ सख्त होते हैं। यह कैसे काम करता है, यह मानव सोच की नकल करके, यह बहुत कम गलतियाँ करता है। परीक्षणों में, इसने 90% बार सही ग्रेड प्राप्त किया, जबकि पुराने तरीकों ने केवल 87% बार सही किया। यह बहुत अधिक नहीं लग सकता है, लेकिन AI की दुनिया में, यह एक बड़ी छलांग है।
3. "संवाद" की चुनौती
अधिकांश AI परीक्षण केवल एक प्रश्न और एक उत्तर देखते हैं (जैसे कि एक गणित का सवाल)। लेकिन वास्तविक जीवन एक बातचीत है। आप कह सकते हैं, "मुझे एक चुटकुला सुनाओ," और AI आपको एक चुटकुला सुनाता है। फिर आप कहते हैं, "इसे छोटा करो," और AI उसे छोटा कर देता है।
DIALEVAL विशेष है क्योंकि यह पूरी बातचीत को याद रख सकता है। यह केवल नवीनतम वाक्य को नहीं देखता; यह बातचीत के इतिहास को देखता है।
- उपमा: कल्पना कीजिए कि आप "टेलीफोन" का खेल खेल रहे हैं जहाँ हर मोड़ पर नियम बदलते हैं। DIALEVAL वह रेफरी है जो मूल नियमों और नए नियमों दोनों को याद रखता है, यह सुनिश्चित करता है कि खिलाड़ी अभी भी खेल का सही ढंग से पालन कर रहा है, भले ही 20 दौर की बातचीत के बाद भी।
4. उन्होंने क्या खोजा?
जब उन्होंने विभिन्न AI मॉडलों (जैसे GPT-4, Mixtral, आदि) को टेस्ट करने के लिए DIALEVAL का उपयोग किया, तो उन्हें कुछ दिलचस्प कमजोरियां मिलीं:
- "शब्द गणना" का संघर्ष: यहाँ तक कि सबसे स्मार्ट AI भी कभी-कभी सटीक संख्या के शब्दों को हिट करने में संघर्ष करते हैं। यह आँखों पर पट्टी बांधकर लक्ष्य साधने जैसा है।
- "सामग्री" का अंतर: AI विनम्र दिखने (शैली) और तार्किक अर्थ निकालने (तर्क) में बहुत अच्छा है, लेकिन जब बातचीत लंबी होती है तो वे अक्सर वास्तविक तथ्यों या विवरणों (सामग्री) में गलती कर देते हैं। यह एक महान कहानीकार की तरह है जो मुख्य पात्र का नाम भूल जाता रहता है।
निचोड़
DIALEVAL परीक्षण करने का एक नया तरीका है जो निर्देशों को विभिन्न प्रकार के नियमों की चेकलिस्ट की तरह मानता है। यह जानता है कि कब उदार होना है (शब्दों के साथ) और कब सख्त होना है (संख्याओं के साथ)। यह एक सुपर-ह्यूमन शिक्षक की तरह कार्य करता है जो कभी थकता नहीं है, कभी नियम नहीं भूलता, और यह समझता है कि "फलाइन" और "बिल्ली" के बीच का अंतर क्या है, लेकिन वह जानता है कि "50 शब्द" का अर्थ ठीक 50 ही होना चाहिए।
यह उन डेवलपर्स को बेहतर चैटबॉट्स बनाने में मदद करता है जो वास्तव में हमारी बात सुनते हैं, हमारे जटिल आदेशों का पालन करते हैं, और यह याद रखते हैं कि हमने पाँच मिनट पहले क्या बात की थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।