CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data
यह शोध पत्र CRAFT को प्रस्तुत करता है, जो एक ऐसी विधि है जो रूब्रिक-आधारित मूल्यांकनों को एक पदानुक्रमित क्षमता वृक्ष (hierarchical capability tree) में परिवर्तित करती है ताकि विशिष्ट मॉडल कमजोरियों का निदान किया जा सके और लक्षित फाइन-ट्यूनिंग डेटा उत्पन्न किया जा सके, जिसके परिणामस्वरूप मौजूदा क्लस्टरिंग और रैंडम जनरेशन बेसलाइन की तुलना में वित्त और कानूनी डोमेन में मापने योग्य बेहतर प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अनाड़ी रोबोट को एक नया काम करना सिखाने की कोशिश कर रहे हैं। आप उसे एक टेस्ट देते हैं, और वह फेल हो जाता है। एक मानक रिपोर्ट केवल यह कह सकती है, "रोबोट गणित वाले भाग में फेल हो गया," या "रोबोट कानूनी अनुबंध लिखना नहीं जानता।" यह मददगार तो है, लेकिन यह थोड़ा अस्पष्ट भी है। यह वैसा ही है जैसे कोई डॉक्टर आपसे कहे, "आपके पेट में दर्द है," बिना यह बताए कि क्या आपने कुछ खराब खाया था, क्या आप तनाव में हैं, या आपको दवा लेने की ज़रूरत है। अगली बार के लिए रोबोट को ठीक करने के लिए, आपको यह जानने की ज़रूरत है कि ठीक से क्या गलत हुआ ताकि आप उस विशिष्ट चीज़ का अभ्यास कर सकें।
यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है, जो वे सुपर-स्मार्ट AI दिमाग हैं जो कहानियाँ लिखते हैं, समस्याओं को हल करते हैं और सवालों के जवाब देते हैं। वैज्ञानिकों ने इन एआई (AI) को बेहतर बनाने के तरीके बनाने में सालों बिताए हैं, लेकिन अधिकांश परीक्षण केवल एक अंतिम स्कोर देते हैं। वे हमें बताते हैं कि AI कहाँ कमजोर है, लेकिन यह नहीं कि क्यों। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: हम एक साधारण "तुम फेल हो गए" को एक विशिष्ट "यहाँ वह चीज़ है जिसका तुम्हें अभ्यास करने की सटीक आवश्यकता है" में कैसे बदल सकते हैं? यदि हम इसका उत्तर दे सकें, तो हम बेहतर प्रशिक्षण डेटा बना सकते हैं जो AI को केवल अनुमान लगाने के बजाय तेज़ी से और स्मार्ट तरीके से सीखने में मदद करे।
"रूब्रिक" जासूस: CRAFT
मिलिए CRAFT (Clustering Rubrics for Actionable Fine-Tuning) से। CRAFT को एक सुपर-पावर्ड डिटेक्टिव की तरह समझें जो केवल एक छात्र के टेस्ट के अंतिम ग्रेड को नहीं देखता; बल्कि यह देखता है कि हर एक प्रश्न के रूब्रिक (एक आदर्श उत्तर के लिए नियमों की चेकलिस्ट) पर क्या लिखा है, ताकि यह पता लगाया जा सके कि छात्र ने वास्तव में कौन सा सूक्ष्म कौशल (skill) छोड़ा है।
यहाँ कहानी कैसे आगे बढ़ती है:
1. "सिर्फ एक स्कोर" के साथ समस्या
कल्पना कीजिए कि आप गणित का होमवर्क चेक कर रहे हैं। एक मानक टेस्ट केवल यह कह सकता है, "आपको 60% मिला।" यह समस्या को ठीक करने के लिए बहुत उपयोगी नहीं है। क्या छात्र फॉर्मूला भूल गया? क्या उसने जोड़ने में कोई साधारण गलती की? क्या वह इकाइयों (जैसे "मीटर" या "डॉलर") को लिखना भूल गया?
AI की दुनिया में, शोधकर्ता रूब्रिक्स (rubrics) का उपयोग करते हैं। एक रूब्रिक एक विस्तृत चेकलिस्ट की तरह होता है। गणित की एक समस्या के लिए, रूब्रिक कह सकता है: "1. सही संख्याओं की पहचान करें। 2. समीकरण सेट करें। 3. गणित हल करें। 4. सही इकाइयाँ जोड़ें।"
अधिकांश AI परीक्षण अंतिम स्कोर पर ही रुक जाते हैं। लेकिन CRAFT कहता है, "रुको! आइए उस चेकलिस्ट को देखें।" यह चेकलिस्ट के प्रत्येक आइटम को एक विशिष्ट कौशल के लिए एक छोटे "प्रोब" या मिनी-टेस्ट के रूप में देखता है।
2. जादुई पेड़ (The Magic Tree)
CRAFT इन विभिन्न प्रश्नों से हजारों ऐसे चेकलिस्ट आइटम्स लेता है और एक स्मार्ट AI से पूछता है कि प्रत्येक आइटम किस कौशल का परीक्षण कर रहा है। फिर, यह कुछ जादुई करता है: यह कौशलों का एक फैमिली ट्री (वंशवृक्ष) बनाता है।
- पेड़ के शीर्ष पर, आपके पास "फाइनेंस" या "लीगल" जैसे व्यापक वर्ग होते हैं।
- जैसे-जैसे आप शाखाओं के नीचे जाते हैं, कौशल अधिक विशिष्ट होते जाते हैं। "फाइनेंस" "कॉर्पोरेट फाइनेंस" में विभाजित होता है, जो आगे "फिनेंसिंग कॉस्ट्स" में विभाजित होता है, जो "ब्याज दरों की गणना करने" में विभाजित होता है।
- पेड़ की सबसे निचली पत्तियों पर विशिष्ट चेकलिस्ट आइटम होते हैं, जैसे "क्या उत्तर में ब्याज दर का उल्लेख किया गया था?"
यह पेड़ विशेष है क्योंकि यह केवल एक सूची नहीं है; यह एक मानचित्र है। यह दिखाता है कि कौशल एक-दूसरे से कैसे संबंधित हैं।
3. कमजोर कड़ियों को खोजना
अब, CRAFT इस AI मॉडल का इन सभी प्रश्नों पर परीक्षण करता है। यह केवल कुल स्कोर नहीं गिनता; यह पेड़ की प्रत्येक शाखा पर AI के प्रदर्शन की जाँच करता है।
- शायद AI "कॉर्पोरेट फाइनेंस" में बहुत अच्छा है (84% पास रेट) लेकिन "ब्याज दरों की गणना करने" में बहुत खराब है (48% पास रेट)।
- शायद दूसरा AI "ब्याज दरों" में ठीक है लेकिन "पॉलिसी परिवर्तनों को समझने" में विफल रहता है।
CRAFT इतना स्मार्ट है कि वह जानता है कि आपको केवल बहुत नीचे की पत्तियों (बहुत विशिष्ट) या बहुत ऊपर की शाखाओं (बहुत व्यापक) को नहीं चुनना चाहिए। यह पेड़ में गतिशील रूप से खोज करता है ताकि वह वह "स्वीट स्पॉट" ढूंढ सके जहाँ कमजोरी सबसे स्पष्ट हो। यह एक कोच की तरह है जो महसूस करता है, "तुम्हें पूरे फुटबॉल की प्रैक्टिस करने की ज़रूरत नहीं है; तुम्हें विशेष रूप से 'लेफ्ट-फुटेड कॉर्नर किक' का अभ्यास करने की आवश्यकता है।"
4. लक्षित अभ्यास (Targeted Practice)
एक बार जब CRAF इन कमजोरियों को ढूंढ लेता है, तो यह वहीं नहीं रुक जाता। यह इन्हें लक्षित अभ्यास डेटा (targeted practice data) उत्पन्न करने के लिए उपयोग करता है।
कल्पना कीजिए कि आप एक शिक्षक हैं। छात्र को 1,000 रैंडम गणित के सवाल देने के बजाय, CRAFT कहता है, "यहाँ 'ब्याज दरों की गणना करने' के बारे में विशेष रूप से 40 प्रश्न दिए गए हैं क्योंकि यहीं पर आप बार-बार असफल हो रहे हैं।"
शोधकर्ताओं ने इस पद्धति का उपयोग चार अलग-अलग AI मॉडल्स (Qwen3-4B, Qwen3-8B, Gemma-3-4B, और Llama-3.1-8B-Instruct) के लिए दो कठिन क्षेत्रों: फाइनेंस और लीगल में सिंथेटिक (कंप्यूटर द्वारा जनरेट किए गए) अभ्यास उदाहरण बनाने के लिए किया।
5. परिणाम: क्या यह काम आया?
टीम ने CRAFT की तुलना दो अन्य तरीकों से की:
- रैंडम (Random): उसी विषय से रैंडम अभ्यास प्रश्न चुनना।
- EvalTree: एक समान विधि जो पूरे प्रश्नों को समूहों में बांटती है बजाय इसके कि उन्हें चेकलिस्ट आइटम्स में तोड़ा जाए।
परिणाम स्पष्ट थे:
- फाइनेंस में: CRAFT चारों AI मॉडल्स के लिए विजेता रहा। इसने उन्हें प्रदर्शन में सबसे बड़ी बढ़त दी, विशेष रूपकर छोटे मॉडल्स को।
- लीगल में: CRAFT चार में से तीन मॉडल्स के लिए सर्वश्रेष्ठ था। चौथे मॉडल के लिए, यह सर्वश्रेष्ठ प्रतियोगी के समान ही अच्छा था, उससे बदतर नहीं।
अध्ययन ने दिखाया कि चीजों को सूक्ष्म, विशिष्ट कौशलों (रूब्रिक मानदंडों) में तोड़ना, पूरे प्रश्नों को देखने की तुलना में बहुत बेहतर है। यह एक छात्र को "तुम गणित में बुरे हो" कहने और "तुम्हें लॉन्ग डिवीजन का अभ्यास करने की आवश्यकता है" कहने के बीच का अंतर है।
CRAFT क्या नहीं है
यह ध्यान रखना महत्वपूर्ण है कि यह पेपर क्या नहीं कहता है। यह दावा नहीं करता कि CRAFT हर समस्या को ठीक करता है या यह हर सिंगल बेंचमार्क पर पूरी तरह से काम करता है। वास्तव में, परिणाम विशिष्ट AI मॉडल और विशिष्ट परीक्षण के आधार पर थोड़े भिन्न थे। कभी-कभी, एक विधि एक विशिष्ट प्रश्न पर थोड़ी बेहतर थी, लेकिन जब पूरे डोमेन में औसत प्रदर्शन को देखा गया, तो CRAFT लगातार विजेता रहा। पेपर इस बात पर भी जोर देता है कि यह बेहतर प्रशिक्षण डेटा बनाने की एक विधि है, न कि एक जादू की छड़ी जो तुरंत AI को परफेक्ट बना देगी।
बड़ी सीख (The Big Takeaway)
CRAFT सुझाव देता है कि यदि हम AI को स्मार्ट बनाना चाहते हैं, तो हमें बड़े चित्र को देखना बंद करना होगा और सूक्ष्म विवरणों पर ध्यान देना शुरू करना होगा। विस्तृत चेकलिस्ट (रूब्रिक्स) का उपयोग करके यह पता लगाकर कि एक AI क्यों विफल होता है, हम लक्षित अभ्यास सत्र बना सकते हैं जो वास्तव में समस्या को ठीक करते हैं। यह एक अस्पष्ट "तुम फेल हो गए" को सुधार के लिए एक स्पष्ट रोडमैप में बदल देता है, जो यह साबित करता है कि सीखने का सबसे अच्छा तरीका यह जानना है कि आपको वास्तव में किस चीज़ का अभ्यास करने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।