Perspective independence, more than personas, drives LLM teams - and where they reverse
यह अध्ययन प्रदर्शित करता है कि जहाँ लार्ज लैंग्वेज मॉडल्स की मल्टी-एजेंट टीमें विशेषज्ञ व्यक्तित्वों (specialist personas) के बजाय परिप्रेक्ष्य स्वतंत्रता (perspective independence) और मध्यम संश्लेषण (moderated synthesis) के माध्यम से बेंचमार्क डेटासेट्स पर नैदानिक स्मरण (diagnostic recall) में सुधार करती हैं, वहीं यह लाभ वास्तविक दुनिया के आपातकालीन मामलों में उलट जाता है जहाँ विशेषज्ञ भूमिका सूचियाँ (specialist role lists) बेहतर प्रदर्शन प्रदान करती हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से विकसित होती दुनिया में, शोधकर्ता इस बात की खोज कर रहे हैं कि कंप्यूटर प्रोग्रामों को भाषा समझने में अधिक विश्वसनीय कैसे बनाया जाए, विशेष रूप से तब जब उनसे कठिन समस्याओं को हल करने के लिए कहा जाता है। एक लोकप्रिय रणनीति में कंप्यूटर को यह व्यवहार करने के लिए कहना शामिल है जैसे कि वह विभिन्न विशेषज्ञों की एक टीम हो, जिनमें से प्रत्येक का एक विशिष्ट कार्य हो, जैसे कि एक हृदय रोग विशेषज्ञ या एक सर्जन, जो निष्कर्ष तक पहुँचने के लिए मिलकर काम करते हैं। यह दृष्टिकोण इस विचार पर आधारित है कि विभिन्न विशिष्ट आवाजों के होने से एक एकल, सीधा उत्तर देने के बजाय बेहतर उत्तर प्राप्त होंगे। हालाँकि, यह स्पष्ट नहीं रहा है कि सुधार इन विशेषज्ञों के विशिष्ट शीर्षकों से आता है, या केवल इस तथ्य से कि कंप्यूटर एक ही निष्कर्ष निकालने से पहले कई स्वतंत्र विचार उत्पन्न कर रहा है। यह प्रश्न चिकित्सा जैसे उच्च-जोखिम वाले क्षेत्रों में बहुत महत्वपूर्ण है, जहाँ सही निदान और छूटे हुए निदान के बीच का अंतर जीवन बदलने वाला हो सकता है।
एक हालिया अध्ययन ने वास्तविक चिकित्सा मामलों पर विभिन्न सेटअपों के प्रदर्शन का परीक्षण करके इन दो संभावनाओं को सुलझाने का प्रयास किया। शोधकर्ताओं ने एक मानक, एकल अनुरोध की तुलना दो अधिक जटिल विधियों से की। एक विधि में, उन्होंने कंप्यूटर को एक ही बातचीत के भीतर पांच अलग-अलग विशेषज्ञ भूमिकाएं अपनाने के लिए कहा। दूसरी विधि में, उन्होंने कंप्यूटर के पांच अलग-अलग, पृथक उदाहरण बनाए, जिनमें से प्रत्येक एक अलग विशेषज्ञ के रूप में कार्य करता है, और फिर एक छठे उदाहरण का उपयोग एक मॉडरेटर के रूप में किया जो उन सभी को सुनता है और उनके उत्तरों को संश्लेषित करता है। उन्होंने आपातकालीन कक्ष के दौरों और जटिल चिकित्सा तर्क से जुड़े सैकड़ों मामलों पर इन दृष्टिकोणों का परीक्षण किया, जिसमें परिणामों को स्कोर करने के लिए एक ऐसी प्रणाली का उपयोग किया गया जो एक चिकित्सक के निर्णय की नकल करती है।
परिणामों ने समस्या के प्रकार के आधार पर प्रदर्शन के एक आश्चर्यजनक विभाजन को प्रकट किया। जब टीम ने चिकित्सा मामलों के एक व्यापक सेट पर इन प्रणालियों का परीक्षण किया जिसे यह जांचने के लिए डिज़ाइन किया गया था कि कंप्यूटर कितने सही विकल्पों को सूचीबद्ध कर सकता है, तो पृथक एजेंटों की टीम ने एकल प्रत्यक्ष कॉल की तुलना में बेहतर प्रदर्शन किया। पृथक समूह ने शीर्ष तीन और शीर्ष पांच सुझावों में अधिक सही उत्तर पाए, और यह अंतर सांख्यिकीय रूप से महत्वपूर्ण था। आगे के विश्लेषण से पता चला कि यह सफलता इसलिए नहीं थी क्योंकि कंप्यूटर एक विशेषज्ञ होने का ढोंग कर रहा था। इसके बजाय, यह लाभ इस तथ्य से आया कि एजेंट स्वतंत्र रूप से अपने विचार उत्पन्न कर रहे थे और फिर एक मॉडरेटर उन्हें संयोजित कर रहा था। एजेंटों को दिए गए विशिष्ट शीर्षकों या भूमिकाओं ने कोई अतिरिक्त मूल्य नहीं जोड़ा; लाभ पूरी तरह से समानांतर में काम करने वाले अलग-अलग दिमागों और फिर उनके एक साथ आने की संरचना में निहित था।
हालाँकि, कहानी पूरी तरह से बदल गई जब शोधकर्ताओं ने इन समान विधियों को वास्तविक दुनिया के आपातकालीन कक्ष के परिदृश्यों पर लागू किया। इस अधिक अराजक और समय-संवेदनशील वातावरण में, एकल प्रत्यक्ष कॉल ने पृथक एजेंटों की टीम से बेहतर प्रदर्शन किया। एकल कॉल ने लगभग 40 प्रतिशत मामलों में प्राथमिक समस्या की सही पहचान की, जबकि टीम के दृष्टिकोण में यह केवल लगभग 34 प्रतिशत मामलों में ही सफल हो सका। इस विशिष्ट संदर्भ में, लाभ पलट गया, और यह लाभ विचारों के स्वतंत्र सृजन के बजाय विशेषज्ञ भूमिका सूचियों द्वारा संचालित था। अध्ययन बताता है कि इन आर्टिफिशियल इंटेलिजेंस टीमों को व्यवस्थित करने का कोई एक सबसे अच्छा तरीका नहीं है। सबसे प्रभावी दृष्टिकोण पूरी तरह से पूछे गए विशिष्ट प्रश्न और उपलब्ध जानकारी की प्रकृति पर निर्भर करता है, जिसका अर्थ है कि एक रणनीति जो एक प्रकार की चिकित्सा चुनौती के लिए काम करती है, वह दूसरी के लिए विफल हो सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।