MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction
यह शोध पत्र MIND-Skill को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो जटिल कार्यों पर मजबूती और सामान्यीकरण सुनिश्चित करने के लिए टेक्स्टुअल लॉस (पुनर्निर्माण, परिणाम और रूब्रिक) के माध्यम से अनुकूलित इंडक्शन-डिडक्शन चक्र के माध्यम से स्वचालित रूप से उच्च-गुणवत्ता वाले, पुन: प्रयोज्य LLM कौशल उत्पन्न करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन थोड़ा अनाड़ी रोबोट सहायक है। आप उसे एक विशिष्ट कार्य करना सिखाते हैं, जैसे "अपने दोस्त को Venmo पर रिफंड भेजना," एक वीडियो दिखाकर जिसमें आप यह काम पूरी तरह से कर रहे हैं। रोबोट देखता है, लेकिन केवल आपके सटीक कदमों की नकल करने के बजाय, वह भविष्य में समान कार्य करने के लिए अपने लिए एक नियम पुस्तिका (rulebook) लिखने की कोशिश करता है।
समस्या यह है कि यदि रोबट एक खराब नियम पुस्तिका लिखता है, तो वह फंस सकता है। वह आपके विशिष्ट मित्र का नाम याद रख सकता है (बहुत विशिष्ट) या निर्देश इतने अस्पष्ट लिख सकता है कि वे उपयोगी ही न रहें (बहुत अमूर्त)।
MIND-Skill एक नया सिस्टम है जिसे AI एजेंटों को स्वचालित रूप से परफेक्ट, उच्च-गुणवत्ता वाली नियम पुस्तिकाएं लिखने में मदद करने के लिए डिज़ाइन किया गया है। यह इसे एक चतुर "शिक्षक और छात्र" के खेल का उपयोग करके करता है जो गारंटी देता है कि नियम वास्तव में काम करते हैं।
यह यहाँ कैसे काम करता है, इसके सरल भाग दिए गए हैं:
1. दो पात्र: शिक्षक और छात्र
सिस्टम दो AI एजेंटों का उपयोग करता है जो एक साथ मिलकर काम करते हैं:
- शिक्षक (Induction Agent): यह एजेंट किसी कार्य को सफलतापूर्वक किए जाने के एक वीडियो को देखता है। इसका काम एक सामान्य नियम पुस्तिका (एक "कौशल") लिखना है जो यह समझाए कि कैसे कार्य किया जाए, बिना किसी विशिष्ट नाम या नंबरों का उल्लेख किए।
- छात्र (Deduction Agent): यह परीक्षण है। इसे केवल शिक्षक द्वारा लिखी गई नियम पुस्तिका और मूल कार्य का विवरण दिया जाता है। यह केवल उन निर्देशों का उपयोग करके कार्य को शुरू से करने का प्रयास करता है।
2. "पुनर्गठन" (Reconstruction) परीक्षण
यह जादू वाला हिस्सा है। सिस्टम केवल यह नहीं पूछता है, "क्या छात्र ने सही उत्तर प्राप्त किया?" बल्कि यह पूछता है, "क्या छात्र ने मूल वीडियो के समान तर्क का पालन किया?"
- यदि शिक्षक एक नियम पुस्तिका लिखता है जिसमें कहता है "लाल बटन दबाएं," लेकिन मूल वीडियो में नीला बटन दबाया गया था, तो छात्र विफल हो जाएगा। सिस्टम इसे पकड़ लेता है।
- यदि शिक्षक की नियम पुस्तिका बहुत अस्पष्ट है (जैसे, "वह चीज़ करो"), तो छात्र भ्रमित हो जाएगा और विफल हो जाएगा।
- यदि शिक्षक की नियम पुस्तिका बहुत विशिष्ट है (जैसे, "User #123 के लिए बटन दबाएं"), तो सिस्टम को एहसास होगा कि यह किसी और के लिए काम नहीं करेगा।
सिस्टम छात्र के प्रदर्शन की तुलना मूल वीडियो से करता है। यदि वे मेल खाते हैं, तो नियम पुस्तिका अच्छी है। यदि वे नहीं मिलते, तो सिस्टम जानता है कि नियम पुस्तिका त्रुटिपूर्ण है।
3. तीन "रिपोर्ट कार्ड"
यह सुनिश्चित करने के लिए कि नियम पुस्तिका एकदम सही हो, सिस्टम हर प्रयास के बाद शिक्षक को तीन विशिष्ट रिपोर्ट कार्ड (जिन्हें "लॉस" कहा जाता है) देता है:
- "क्या आपने चरणों का पालन किया?" कार्ड (Reconstruction Loss): क्या छात्र ने मूल वीडियो के समान रणनीति का पालन किया? (जैसे, क्या उन्होंने पहले ईमेल चेक किया, फिर भेज दिया?)
- "क्या आपने काम पूरा किया?" कार्ड (Outcome Loss): क्या छात्र ने वास्तविक दुनिया में कार्य को सफलतापूर्वक पूरा किया?
- "क्या यह एक अच्छी नियमावली है?" कार्ड (Rubric Loss): क्या नियम पुस्तिका अच्छी तरह से लिखी गई है? क्या यह स्पष्ट है? क्या यह विशिष्ट विवरणों (जैसे नाम या आईडी) की नकल करने से बचती है जो वहां नहीं होने चाहिए? यह सुनिश्चित करता है कि नियम पुस्तिका एक उपयोगी उपकरण है, न कि केवल एक विशिष्ट घटना की कॉपी-पेस्ट।
4. सुधार का चक्र (Loop of Improvement)
यह सिस्टम इस खेल को बार-बार चलाता है।
- शिक्षक एक ड्राफ्ट लिखता है।
- छात्र इसे आज़माता है।
- सिस्टम तीन रिपोर्ट कार्ड का उपयोग करके ड्राफ्ट को ग्रेड देता है।
- सिस्टम शिक्षक को ठीक-ठीक बताता है कि क्या गलत था (जैसे, "आपने एक विशिष्ट नाम शामिल किया; इसे हटा दें," या "आप सुरक्षा जांच को छोड़ गए")।
- शिक्षक फीडबैक के आधार पर नियम पुस्तिका को फिर से लिखता है।
यह स्वचालित रूप से होता है, नियम पुस्तिका को तब तक परिष्कृत करता है जब तक कि वह त्रुटिहीन न हो जाए।
यह विशेष क्यों है?
पिछले अधिकांश तरीकों ने केवल एक स्मार्ट AI से वीडियो को "सारांशित" करने के लिए कहकर नियम पुस्तिका लिखने की कोशिश की। लेकिन AI अक्सर गलतियाँ करता है—या तो बहुत अस्पष्ट या बहुत विशिष्ट हो जाता है।
MIND-Skill अलग है क्योंकि यह नियम पुस्तिका का तुरंत परीक्षण करता है। यह एक शेफ द्वारा रेसिपी लिखने और फिर तुरंत उसे अपने सहायक शेफ को डिश पकाने के लिए देने जैसा है। यदि सहायक शेफ खाना जला देता है या गलत सामग्री का उपयोग करता है, तो शेफ को पता चल जाता है कि रेसिपी खराब थी और इससे पहले कि कोई और इसे आज़माए, वह इसे ठीक कर देता है।
परिणाम
पेपर का परीक्षण दो कठिन दुनियाओं पर किया गया:
- AppWorld: वास्तविक ऐप्स (जैसे पैसे भेजना, टिकट बुक करना, फाइलें प्रबंधित करना) का उपयोग करने का एक सिमुलेशन।
- BFCL-v3: कंप्यूटर फंक्शन को सही ढंग से कॉल करने का एक टेस्ट।
परिणामों ने दिखाया कि MIND-Skill की नियम पुस्तिकाओं का उपयोग करने वाले एजेंट, अन्य तरीकों से बनाई गई नियम पुस्तिकाओं का उपयोग करने वाले एजेंटों की तुलना में नए, अनदेखे कार्यों को हल करने में बहुत बेहतर थे। भले ही "शिक्षक" AI उपलब्ध सबसे स्मार्ट मॉडल नहीं था, फिर भी परीक्षण प्रक्रिया ने अंतिम नियम पुस्तिकाओं को इतना अच्छा बना दिया कि वे सबसे स्मार्ट मॉडलों द्वारा बनाई गई पुस्तिकाओं के समान प्रदर्शन करने लगे।
संक्षेप में: MIND-Skill AI एजेंटों को अपने स्वयं के परफेक्ट निर्देश मैनुअल लिखने वाले आत्म-सुधार करने वाले शिक्षकों में बदल देता है, जो लगातार यह परीक्षण करते हैं कि उनके मैनुअल वास्तव में काम करते हैं या नहीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।