Conv-to-Bench: Evaluating Language Models Via User-Assistant Dialogues In Code Tasks
Conv-to-Bench एक स्केलेबल, मल्टी-स्टेज फ्रेमवर्क है जो वास्तविक मल्टी-टर्न यूजर-असिस्टेंट संवादों को कोड कार्यों के लिए संरचित, सत्यापन योग्य मूल्यांकन बेंचमार्क में स्वचालित रूप से परिवर्तित करता है, जो श्रम-गहन विशेषज्ञ क्यूरेशन पर निर्भरता को काफी कम करते हुए मानव-निर्मित मानकों के साथ लगभग पूर्ण संरेखण प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर कोड लिखना सिखाने की कोशिश कर रहे हैं। ऐसा कुशलता से करने के लिए, आपको एक परीक्षण (test) की आवश्यकता है जिससे यह देखा जा सके कि क्या रोबोट बेहतर हो रहा है। पारंपरिक रूप से, ये परीक्षण बनाना ऐसे है जैसे 1,000 अद्वितीय, पूर्ण रेसिपी हाथ से लिखने के लिए मास्टर शेफ की एक टीम को काम पर रखना। यह महंगा है, धीमा है, और इसे बड़े पैमाने पर करना कठिन है। यदि आपको एक नया परीक्षण चाहिए, तो आपको शेफ के इसे फिर से लिखने का इंतज़ार करना होगा।
यह शोध पत्र एक नया तरीका पेश करता है जिससे ये परीक्षण बनाए जा सकते हैं, जिसे Conv-to-Bench कहा जाता है। नए परीक्षणों को शुरुआत से लिखने के लिए शेफ को काम पर रखने के बजाय, शोधकर्ताओं ने वास्तविक लोगों द्वारा AI सहायकों से बात करने के "किचन लॉग्स" (kitchen logs) को देखने का निर्णय लिया। उन्होंने पूछा: क्या हम इन अव्यवस्थित, वास्तविक जीवन की बातचीत को एक पूर्ण परीक्षण में बदल सकते हैं?
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल चरणों में विभाजित किया गया है:
1. समस्या: "शेफ" की बाधा (The "Chef" Bottleneck)
अभी, AI के लिए सबसे अच्छे परीक्षण (जैसे BigCodeBench) मानव विशेषज्ञों द्वारा लिखे जाते हैं। एक अच्छा परीक्षण बनाने में उन्हें एक साल लग जाता है। यह एक नई शहर बनाने के लिए हर ईंट को हाथ से तराशने जैसा है। यह उच्च गुणवत्ता वाला है, लेकिन यह AI के सीखने की गति के साथ तालमेल बिठाने के लिए बहुत धीमा है।
2. समाधान: "किचन लॉग्स" की माइनिंग (Mining the "Kitchen Logs")
शोधकर्ताओं ने महसूस किया कि लाखों लोग हर दिन AI से बात कर रहे हैं, कोड के लिए मदद मांग रहे हैं। ये बातचीत सोने की खानें हैं।
- परिदृश्य: एक उपयोगकर्ता पूछता है, "एक Python स्क्रिप्ट लिखें।" AI कुछ गलत लिखता है। उपयोगकर्ता कहता है, "नहीं, जब मैं इसे चलाता हूँ तो यह क्रैश हो जाता है। लूप को ठीक करें।" AI फिर से प्रयास करता है। उपयोगकर्ता कहता है, "बहुत बढ़िया, अब एक कमेंट जोड़ें।"
- अंतर्दृष्टि: यह आगे-पीछे की बातचीत केवल एक चैट नहीं है; यह एक ब्लूप्रिंट है। उपयोगकर्ता का अंतिम अनुरोध, उनके सभी सुधारों के साथ मिलकर, वास्तव में एक अच्छे कोड समाधान के लिए क्या निर्देश होने चाहिए, इसका एक बहुत ही विस्तृत, पूर्ण सेट है।
3. प्रक्रिया: चैट को चेकलिस्ट में बदलना (Turning Chat into a Checklist)
टीम ने एक सिस्टम (Conv-to-Bench) बनाया जो एक सुपर-स्मार्ट संपादक (editor) की तरह काम करता है। यह इन लंबी, अव्यवस्थित बातचीत को लेता है और तीन चीजें करता है:
- फ़िल्टर (Filters): यह खाना पकाने या मौसम के बारे में होने वाली बातचीत को हटा देता है, और केवल उन्हीं को रखता है जो कोडिंग के बारे में हैं।
- संश्लेषण (Synthesizes): यह पूरी बातचीत को पढ़ता है और एक एकल, पूर्ण "मास्टर निर्देश" (Master Instruction) लिखता है जो मूल अनुरोध को सभी सुधारों के साथ जोड़ता है जो उपयोगकर्ता ने मांगे थे।
- चेकलिस्ट बनाना (Creates a Checklist): यह उस निर्देश को एक सरल "हाँ/नहीं" चेकलिस्ट में बदल देता है। उदाहरण के लिए: "क्या कोड बिना किसी त्रुटि के चलता है?" "क्या यह लूप को सही ढंग से संभालता है?" "क्या इसमें कमेंट्स हैं?"
4. प्रयोग: क्या यह काम कर गया? (Did it Work?)
उन्होंने इस नए सिस्टम का परीक्षण यह देखकर किया कि क्या यह AI मॉडल को उसी तरह रैंक कर सकता है जैसे महंगे, मानव-लिखित परीक्षण करते हैं।
- परिणाम: यह अविश्वसनीय रूप से अच्छा काम कर गया। जब उन्होंने अपने AI-जनित परीक्षणों की तुलना मानव-लिखित "गोल्ड स्टैंडर्ड" (BigCodeBench) से की, तो रैंकिंग लगभग पूरी तरह से मेल खाती थी। कुछ मामलों में, सहसंबंध (correlation) 1.0 में से 1.0 था—जिसका अर्थ है कि नया सिस्टम मानव विशेषज्ञों के साथ 100% सहमत था।
- "फीडबैक" ट्विस्ट: उन्होंने दो संस्करणों को आज़माया। एक में केवल अंतिम निर्देशों का उपयोग किया गया, और दूसरे में निर्देशों साथ ही उपयोगकर्ता की शिकायतों और सुधारों (फीडबैक) का उपयोग किया गया। आश्चर्यजनक रूप से, केवल निर्देशों वाला संस्करण वास्तव में अधिक स्थिर और विश्वसनीय था। उपयोगकर्ता का फीडबैक स्पष्टता के बजाय कभी-कभी "शोर" (भ्रम) जोड़ देता था, जैसे कि कोई ग्राहक बहुत बार अपना मन बदल रहा हो।
5. निष्कर्ष (The Verdict)
शोध पत्र यह निष्कर्ष निकालता है कि हमें हर नया परीक्षण लिखने के लिए मानव विशेषज्ञों का इंतज़ार करने की आवश्यकता नहीं है। हम उन स्वाभाविक, अव्यवस्थित बातचीत का उपयोग कर सकते हैं जो लोग पहले से ही AI के साथ कर रहे हैं, ताकि उच्च-गुणवत्ता वाले, विश्वसनीय परीक्षण स्वचालित रूप से बनाए जा सकें।
संक्षेप में:
पारंपरिक परीक्षण को एक उत्कृष्ट कृति (masterpiece) को हाथ से पेंट करने के रूप में सोचें (धीमा, महंगा, पूर्ण)।
Conv-to-Bench जनता द्वारा बनाई गई लाखों कच्ची रेखाचित्रों (sketches) को एक पूर्ण, मानकीकृत पेंटिंग में बदलने के लिए एक हाई-टेक स्कैनर का उपयोग करने जैसा है। यह तेज़ है, सस्ता है, और आश्चर्यजनक रूप से उतना ही सटीक है, बशर्ते आप मुख्य निर्देशों पर टिके रहें और हाशिए में लिखे गए अव्यवस्थित नोट्स को अनदेखा करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।