Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents
यह शोध पत्र कोलाबोरेटिव एजेंट रीजनिंग इंजीनियरिंग (CARE) को प्रस्तुत करता है, जो एक व्यवस्थित, स्टेज-गेटेड कार्यप्रणाली है जो वैज्ञानिक डोमेन में विश्वसनीय एआई एजेंटों की इंजीनियरिंग के लिए अनौपचारिक डोमेन इंटेंट को कठोर, सत्यापन योग्य विशिष्टताओं में बदलने हेतु विषय-विशेषज्ञों (Subject-Matter Experts), डेवलपर्स और एलएलएम हेल्पर एजेंटों के त्रिपक्षीय वर्कफ़्लो का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अत्यधिक कुशल रोबोटिक सहायक बनाने की कोशिश कर रहे हैं जो वैज्ञानिकों को एक विशाल पुस्तकालय में विशिष्ट डेटा खोजने में मदद कर सके। अतीत में, लोगों ने इन रोबोटों को केवल उनसे बात करके, अंदाज़ा लगाकर कि क्या कहना है, और बेहतर होने की उम्मीद करके सिखाने की कोशिश की थी। यह एक कुत्ते को केवल यादृच्छिक शब्द चिल्लाकर जटिल गणित करने के लिए सिखाने जैसा है; कभी-कभी यह काम करता है, लेकिन ज्यादातर यह प्रयास और त्रुटि (trial and error) का एक झमेला होता है।
यह शोध पत्र CARE (कोलेबोरेटिव एजेंट रीजनिंग इंजीनियरिंग) पेश करता है, जो इन AI सहायकों को बनाने का एक नया, अनुशासित तरीका है। केवल अंदाज़ा लगाने के बजाय, CARE इन AI सहायकों को बनाने को एक पुल बनाने की तरह मानता है: आपको एक सख्त ब्लूप्रिंट, विशेषज्ञों की एक टीम और एक चरण-दर-चरण निरीक्षण प्रक्रिया की आवश्यकता होती है।
यहाँ बताया गया है कि CARE कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
तीन-पक्षीय टीम
CARE केवल एक इंसान द्वारा कंप्यूटर से बात करना नहीं है। यह तीन तरफा बातचीत है:
- विषय-विशेषज्ञ (Subject-Matter Experts - SMEs): वे वैज्ञानिक जो खेल के नियम जानते हैं (जैसे, "हम केवल 2020 के डेटा पर भरोसा करते हैं," या "उत्तर का अनुमान कभी न लगाएं")।
- डेवलपर्स (Developers): वे इंजीनियर जो रोबोट बनाना जानते हैं।
- "हेल्पर एजेंट" (Helper Agents): ये विशेष AI सहायक हैं जिनका एकमात्र काम इंसानों को एक-दूसरे से बात करने में मदद करना है। उन्हें एक अति-कुशल लेखक (scribe) या अनुवादक के रूप में सोचें। वे वैज्ञानिकों की बातें सुनते हैं, स्पष्टीकरण के लिए प्रश्न पूछते हैं, और नियमों को एक स्पष्ट, संरचित प्रारूप में लिखते हैं जिसे डेवलपर्स समझ सकें।
समस्या: "जग्ड फ्रंटियर" (ऊबड़-खाबड़ सीमा)
शोध पत्र बताता है कि AI एक ऊबड़-खाबड़ पर्वत श्रृंखला की तरह है। कभी-कभी यह अविश्वसनीय रूप से स्मार्ट और मददगार होता है; अन्य समय में, यह भ्रमित हो जाता है और तथ्य गढ़ने लगता है। यदि आप एक विशेषज्ञ हैं, तो आप सुरक्षित रास्तों पर नेविगेट करना जानते हैं। यदि आप एक नौसिखिया हैं, तो आप खाई में गिर सकते हैं। CARE का लक्ष्य AI को इस तरह बनाना है कि वह उपयोग करने वाले व्यक्ति के रूप में, चाहे वह कोई भी हो, एक विशेषज्ञ की तरह कार्य करे।
CARE प्रक्रिया: एक पाँच-चरणीय निर्माण स्थल
केवल एक प्रॉम्प्ट टाइप करने और बेहतर परिणाम की उम्मीद करने के बजाय, CARE एक "स्टेज-गेटेड" (चरण-दर-चरण स्वीकृत) प्रक्रिया का उपयोग करता है। इसका मतलब है कि आप अगले चरण पर तब तक नहीं जा सकते जब तक कि वर्तमान चरण को मनुष्यों द्वारा अनुमोदित न किया जाए।
- स्कोप और डिकंपोज़ (Scope and Decompose): टीम लक्ष्य को परिभाषित करती है। इस रोबोट को वास्तव में क्या करना चाहिए? हेल्पर एजेंट सीमाओं को लिखने में मदद करता है।
- प्रमुख सूचना निष्कर्षण (Key Information Elicitation): टीम "उपकरणों" और "संदर्भ" को एकत्र करती है। रोबोट किन डेटाबेस तक पहुँच सकता है? एक सही उत्तर कैसा दिखता है? हेल्पर एजेंट इन उत्तरों को एक चेकलिस्ट में बदल देता है।
- रीज़निंग पॉलिसी और गार्डरेल्स (Reasoning Policy and Guardrails): यह सबसे महत्वपूर्ण हिस्सा है। टीम तय करती है कि रोबोट कैसे सोचेगा। उसे मदद कब मांगनी चाहिए? उसे कब कहना चाहिए "मुझे नहीं पता"? हेल्पर एजेंट इन नियमों का मसौदा तैयार करता है, और मनुष्य उन्हें अनुमोदित करते हैं।
- प्रॉम्प्ट आर्किटेक्चर (Prompt Architecture): केवल नियमों के सेट होने के बाद ही टीम AI के लिए वास्तविक निर्देश (प्रॉम्प्ट) लिखती है। क्योंकि नियम पहले से ही स्पष्ट हैं, इसलिए प्रॉम्प्ट केवल अनुमोदित नियमों का एक अनुवाद है, न कि कोई अंदाज़ा।
- बेंचमार्किंग और वेरिफिकेशन (Benchmarking and Verification): काम पर जाने से पहले, रोबोट एक परीक्षण देता है। टीम प्रश्नों का एक सेट बनाती है ताकि यह देखा जा सके कि क्या रोबोट वास्तव में उन नियमों का पालन करता है जो उन्होंने लिखे थे।
"हेल्पर एजेंट" का सादृश्य
हेल्पर एजेंट को एक निर्माण फोरमैन (construction foreman) के रूप में सोचें।
- वैज्ञानिक (SME) कहता है, "मुझे एक दीवार चाहिए जो सुरक्षित और मजबूत हो।"
- डेवलपर कहता है, "ठीक है, मैं इसे बनाऊंगा।"
- फोरमैन के बिना, वे इस पर बहस कर सकते हैं कि "मजबूत" का क्या अर्थ है, या डेवलपर एक ऐसी दीवार बना सकता है जो दिखने में अच्छी हो लेकिन ढह जाए।
- हेल्पर एजेंट के साथ, वह हस्तक्षेप करता है और कहता है, "वैज्ञानिक, क्या 'मजबूत' का अर्थ है कि यह 500 पाउंड सहन कर सकता है? डेवलपर, क्या आपकी योजना उस 500-पाउंड की आवश्यकता को पूरा करती है?" वह उन विशिष्टताओं को एक अनुबंध (आर्टिफैक्ट) में लिख देता है। यदि बाद में योजना बदलती है, तो अनुबंध को अपडेट किया जाता है, और सभी को पता होता है कि क्या बदला गया है।
वास्तविक दुनिया का परीक्षण: नासा (NASA) केस स्टडी
यह साबित करने के लिए कि यह काम करता है, टीम ने नासा के लिए एक AI एजेंट बनाया जो पृथ्वी विज्ञान डेटा (NASA Common Metadata Repository) के माध्यम से खोजने का काम करता है।
- प्रतियोगिता: उन्होंने दो एजेंट बनाए।
- एजेंट A (CARE एजेंट): जिसे हेल्पर एजेंट के साथ सख्त 5-चरणी CARE प्रक्रिया का उपयोग करके बनाया गया था।
- एजेंट B (बेसलाइन): जिसे "पुराने तरीके" से बनाया गया था (उसी AI मॉडल और उपकरणों का उपयोग करके, लेकिन बिना सख्त CARE प्रक्रिया के)।
- परिणाम:
- 621 प्रश्नों के एक बड़े, स्वचालित परीक्षण पर, CARE एजेंट ने पहली बार 71.7% बार सही उत्तर पाया, जबकि पुराने तरीके ने केवल 69.1% बार।
- वास्तविक नासा वैज्ञानिकों द्वारा बनाए गए एक छोटे, कठिन परीक्षण (43 प्रश्न) पर, CARE एजेंट ने शीर्ष 5 परिणामों में सही उत्तर 27.2% बार पाया, जबकि पुराने तरीके ने 20.2% बार।
मुख्य निष्कर्ष
शोध पत्र का दावा है कि एक ऐसी संरचित प्रक्रिया का उपयोग करके जहाँ मनुष्य और "हेल्पर एजेंट" मिलकर AI बनाने से पहले स्पष्ट नियम लिखने के लिए मिलकर काम करते हैं, आपको अधिक विश्वसनीय, सुरक्षित और बेहतर प्रदर्शन करने वाला रोबोट मिलता है। यह "प्रॉम्प्ट इंजीनियरिंग" की अराजक कला को एक अनुमानित इंजीनियरिंग अनुशासन में बदल देता है।
महत्वपूर्ण नोट: इस शोध पत्र ने केवल वैज्ञानिक डेटा खोजने पर इसका परीक्षण किया है। यह दावा नहीं करता है कि यह विधि चिकित्सा निदान, कानूनी सलाह या अन्य विशिष्ट क्षेत्रों के लिए काम करती है जब तक कि भविष्य के कार्यों में इन क्षेत्रों का स्पष्ट रूप से उल्लेख न किया गया हो, जिसे यह शोध पत्र कवर नहीं करता है। सफलता पूरी तरह से प्रदान किए गए नासा डेटा खोज उदाहरण तक सीमित है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।