Agentopic: A Generative AI Agent Workflow for Explainable Topic Modeling
ओनटोपिक (Ontopic) एक नवीन जनरेटिव एआई एजेंट वर्कफ़्लो है जो सहयोगी तर्क (collaborative reasoning) के माध्यम से व्याख्या योग्य टॉपिक मॉडलिंग करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे अत्याधुनिक मॉडलों के समान उच्च सटीकता प्राप्त होती है और साथ ही पारदर्शी, पदानुक्रमित विषय संरचनाएं और प्राकृतिक भाषा व्याख्याएं भी प्रदान की जाती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास हजारों समाचार लेखों से भरी एक विशाल, अव्यवस्थित लाइब्रेरी है। आपका लक्ष्य उन्हें ढेर में छाँटना है ताकि आप बाद में जो चाहिए उसे ढूँढ सकें।
पुराना तरीका ("ब्लैक बॉक्स" लाइब्रेरियन)
पारंपरिक रूप से, हमने इस छंटनी को करने के लिए LDA या BERTopic जैसे कंप्यूटर प्रोग्रामों का उपयोग किया है। इन्हें बहुत तेज़, सुपर-स्मार्ट रोबोट की तरह समझें जो एक किताब पढ़ सकते हैं और तुरंत अनुमान लगा सकते हैं कि उसे किस शेल्फ पर होना चाहिए। वे इसमें अच्छे हैं, लेकिन वे "ब्लैक बॉक्स" हैं। यदि आप उनसे पूछते हैं, "आपने नए फोन के बारे में इस लेख को 'बिजनेस' के बजाय 'टेक्नोलॉजी' के ढेर में क्यों रखा?" तो वे वास्तव में उत्तर नहीं दे सकते। वे बस कहते हैं, "मुझ पर भरोसा करें, यह सही जगह है।" वे आपको उत्तर तो देते हैं, लेकिन यह नहीं बताते कि वे वहाँ तक कैसे पहुँचे। वे कोई स्पष्टीकरण नहीं देते।
नया तरीका: एजेंटोपिक (Agentopic)
यह पेपर एजेंटोपिक को पेश करता है, जो एक रोबोट के बजाय विशेषज्ञ मानव लाइब्रेरियन की एक टीम को काम पर रखने जैसा है। केवल अनुमान लगाने के बजाय, यह टीम एक चरण-दर-चरण प्रक्रिया में मिलकर काम करती है, और हर एक चरण के साथ उनकी सोच को समझाने वाला एक लिखित नोट आता है।
एजेंटोपिक टीम इस प्रकार काम करती है (एक रचनात्मक वर्कफ़्लो का उपयोग करते हुए):
- द स्काउट (विषय की पहचान): यह एजेंट लेख को पढ़ता है और कहता है, "मुझे लगता है कि यह खेल (sports) के बारे में है।" लेकिन वे केवल अनुमान नहीं लगाते; वे एक नोट लिखते हैं: "मुझे लगता है कि यह स्पोर्ट्स है क्योंकि इसमें 'दौड़ना', 'पदक' और 'प्रशिक्षण' का उल्लेख है।"
- द एडिटर (विषय की समीक्षा): यह एजेंट स्काउट के काम की जाँच करता है। वे पूछते हैं, "क्या वह एक अच्छा कारण है? क्या यह हमारे नियमों में फिट बैठता है?" यदि स्काउट ने गलती की है, तो एडिटर उसे दोबारा करने के लिए वापस भेज देता है।
- द ऑर्गनाइज़र (विषयों का समूहीकरण): एक बार विषय स्वीकृत हो जाने के बाद, यह एजेंट उन्हें समूह में व्यवस्थित करता है। वे कह सकते हैं, "सभी 'दौड़ना' और 'तैरना' वाले विषयों को 'एथलेटिक्स' नामक एक बड़े छाते (umbrella) के नीचे रखा जाना चाहिए।" वे समझाते हैं कि ये एक साथ क्यों फिट बैठते हैं।
- द आर्किटेक्ट (पदानुक्रम निर्माण): यह एजेंट एक विशाल फैमिली ट्री बनाता है। वे विषयों को व्यापक (जैसे "खेल") से लेकर बहुत विशिष्ट (जैसे "ओलंपिक तैराकी") तक व्यवस्थित करते हैं।
- द स्टोरीटेलर (व्याख्यात्मकता): प्रत्येक चरण में, टीम एक सरल अंग्रेजी (plain-English) स्पष्टीकरण लिखती है। वे आपको केवल एक लेबल नहीं देते; वे आपको उस लेबल के चुने जाने के पीछे की कहानी देते हैं।
उन्होंने क्या पाया?
शोधकर्ताओं ने इस टीम का परीक्षण 2,225 बीबीसी (BBC) समाचार लेखों के डेटासेट पर किया। यहाँ परिणाम दिए गए हैं:
- सटीकता (Accuracy): एजेंटोपिक टीम लेखों को छाँटने में सबसे अच्छे रोबोटों (GPT-4 और BERTopic) के समान ही सक्षम थी। उन्हें 0.95 आउट ऑफ 1.0 का स्कोर मिला, जो कि उत्कृष्ट है।
- गहराई (Depth): जबकि पुराने बीबीसी डेटासेट में केवल 5 बड़े वर्ग (बिजनेस, एंटरटेनमेंट, पॉलिटिक्स, स्पोर्ट, टेक) थे, एजेंटोपिक वहीं नहीं रुका। इसने उन 5 श्रेणियों को एक फैमिली ट्री के 6 स्तरों में व्यवस्थित करते हुए 2,045 सूक्ष्म, विशिष्ट उप-विषयों में तोड़ दिया।
- उपमा: यदि पुराना तरीका केवल किताबों को "फिक्शन" और "नॉन-फिक्शन" में छाँटना था, तो एजेंटोपिक ने उन्हें "फिक्शन > मिस्ट्री > 1990 का दशक > डिटेक्टिव स्टोरीज > प्राइवेट आई" में छाँटा।
- विश्वास (Trust): क्योंकि प्रत्येक चरण में एक लिखित स्पष्टीकरण है, आप उनके काम को देख सकते हैं और कह सकते हैं, "आह, मैं समझ गया कि उन्होंने इस लेख को यहाँ क्यों रखा।" यह इसे पारदर्शी बनाता है, जो कि "ब्लैक बॉक्स" रोबोटों के विपरीत है।
मुख्य निष्कर्ष (The Bottom Line)
एजेंटोपिक साबित करता है कि आपको स्पष्टता पाने के लिए सटीकता से समझौता करने की आवश्यकता नहीं है। आप एक ऐसा सिस्टम रख सकते हैं जो समाचार लेखों को सबसे स्मार्ट AI की तरह ही छाँटता है, लेकिन केवल परिणाम देने के बजाय, यह एक सहायक मार्गदर्शक की तरह कार्य करता है जो हर मोड़ पर अपने तर्क को समझाता है। यह इसे मनुष्यों के लिए विश्वसनीय बनाता है, विशेष रूप से तब जब उन्हें यह समझने की आवश्यकता हो कि कोई निर्णय क्यों लिया गया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।