← नवीनतम पेपर
💬 NLP

AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering

यह शोध पत्र AMATA को प्रस्तुत करता है, जो एक अनुकूलन योग्य मल्टी-एजेंट फ्रेमवर्क है जो एजेंट सहयोग को एक नवीन इंट्रा-ट्रैजेक्टरी और इंटर-एजेंट डिपेंडेंसी लर्निंग तकनीकों के साथ ट्रैजेक्टरी प्रेफरेंस अलाइनमेंट समस्या के रूप में औपचारिक रूप देकर ज्ञान-गहन प्रश्न उत्तर (knowledge-intensive question answering) में तथ्यात्मक निरंतरता और व्याख्यात्मकता को बढ़ाता है।

मूल लेखक: Taolin Zhang, Dongyang Li, Chen Chen, Qizhou Chen, Jiuheng Wan, Xiaofeng He, Chengyu Wang, Richang Hong

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taolin Zhang, Dongyang Li, Chen Chen, Qizhou Chen, Jiuheng Wan, Xiaofeng He, Chengyu Wang, Richang Hong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन ट्रिविया प्रश्न हल करने की कोशिश कर रहे हैं, जैसे कि "लिट (Lit) बैंड का सबसे प्रसिद्ध गाना कौन सा है?" यदि आप एक मानक AI (एक लार्ज लैंग्वेज मॉडल) से पूछते हैं, तो वह जो कुछ भी उसने याद किया है उसके आधार पर अनुमान लगाने की कोशिश करते हुए आत्मविश्वास के साथ गलत उत्तर दे सकता है। यह "हलुसिनेशन" (hallucination) कहलाता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने AMATA नामक एक नया सिस्टम बनाया है। AMATA को एक अकेले जीनियस के रूप में नहीं, बल्कि एक कारखाने में छह विशिष्ट कामगारों की एक विशेषज्ञ टीम के रूप में समझें, जिनमें से प्रत्येक का एक विशिष्ट कार्य है।

AMATA कैसे काम करता है, इसे एक सरल उपमा के माध्यम से समझाया गया है:

छह कामगरों की टीम

एक व्यक्ति द्वारा सब कुछ करने के बजाय, AMATA एक "मल्टी-एजेंट" सिस्टम का उपयोग करता है। एक जटिल मामले को सुलझाने वाली जासूसी एजेंसी की कल्पना करें:

  1. अनुवादक (इन्टेंट रिकंस्ट्रक्टर - Intent Reconstructor): आपके उलझे हुए प्रश्न को पढ़ता है और स्पष्ट करता है कि आप वास्तव में क्या पूछ रहे हैं।
  2. लाइब्रेरियन (नॉलेज रिट्रीवर - Knowledge Retriever): विषय के बारे में किताबें या लेख खोजने के लिए पुस्तकालय (बाहरी ज्ञान) जाता है।
  3. संपादक (नॉलेज फिल्टर - Knowledge Filter): लाइब्रेरियन द्वारा खोजी गई किताबों को देखता है और उन पन्नों को हटा देता है जो अप्रासंगिक या भ्रमित करने वाले हैं।
  4. हाइलाइटर (नॉलेज लोकेटर - Knowledge Locator): शेष पन्नों में उस सटीक वाक्य या पैराग्राफ को खोजता है जिसमें उत्तर छिपा है।
  5. लेखक (रिस्पॉन्स जनरेटर - Response Generator):at हाइलाइट किए गए तथ्यों का उपयोग करके अंतिम उत्तर लिखता है।
  6. निरीक्षक (आंसर वेरीफायर - Answer Verifier): लेखक के उत्तर की दोबारा जांच करता है ताकि यह सुनिश्चित हो सके कि वह वास्तव में सत्य है और कोई मनगढ़ंत कहानी नहीं है।

पुराने टीमों के साथ समस्या

पिछली विधियों में दो मुख्य कमियां थीं:

  • "असेंबली लाइन" की समस्या: पुराने सिस्टम में, प्रत्येक कार्यकर्ता को एक निश्चित क्रम में अपना काम करना पड़ता था, भले ही उसकी आवश्यकता न हो। "2+2 क्या है?" जैसे सरल प्रश्न के लिए, आपको लाइब्रेरियन या इंस्पेक्टर की आवश्यकता नहीं है। लेकिन पुराने सिस्टम अभी भी प्रश्न को उनके पास भेज देंगे, जिससे समय और ऊर्जा बर्बाद होगी।
  • "साइलो" (Silos) की समस्या: अन्य सिस्टम में, कार्यकर्ताओं को अलग-अलग प्रशिक्षित किया गया था। लाइब्रेरियन को यह नहीं पता था कि संपादक कैसे काम करता है, इसलिए वे ऐसी जानकारी आगे बढ़ा सकते थे जिसे संपादक ठीक न कर सके।

AMATA कैसे अलग है: "स्मार्ट मैनेजर"

AMATA इन दो चतुर नवाचारों के माध्यम से इस टीम को बेहतर ढंग से काम करने के लिए पेश करता है:

1. "डायनेमिक स्कोरकार्ड" (इंट्रा-ट्रैजेक्टरी प्रेफरेंस लर्निंग - Intra-Trajectory Preference Learning)
कल्पना कीजिए कि एक मैनेजर जो आपके विशिष्ट प्रश्न को देखता है और यह तय करने के लिए कि इस विशिष्ट कार्य के लिए प्रत्येक कार्यकर्ता कितना महत्वपूर्ण है, प्रत्येक को एक "स्कोर" देता है।

  • यदि आप किसी दुर्लभ रॉक बैंड के बारे में कठिन प्रश्न पूछते हैं, तो मैनेजर लाइब्रेरियन और संपादक को उच्च स्कोर (5 में से 5) देता है क्योंकि वे अत्यंत महत्वपूर्ण हैं।
  • यदि लाइब्रेरियन एक बहुत ही स्पष्ट उत्तर पाता है, तो मैनेजर निरीक्षक को कम स्कोर (5 में से 1) देता है क्योंकि उत्तर पहले से ही स्पष्ट है और उसे दोबारा देखने की आवश्यकता नहीं है।
  • परिणाम: सिस्टम केवल उन्हीं कामगरों का उपयोग करता है जिनकी उसे वास्तव में आवश्यकता होती है, जिससे कंप्यूटर की शक्ति (टोकन) की भारी बचत होती है।

2. "टीम केमिस्ट्री" का सबक (इंटर-एजेंट डिपेंडेंसी लर्निंग - Inter-Agent Dependency Learning)
AMATA कार्यकर्ताओं को एक साथ काम करना सिखाता है। यह सीखता है कि यदि लाइब्रेरियन को बुलाया जाता है, तो संपादक और हाइलेटर को तुरंत बाद भी बुलाया जाना अनिवार्य है। यह सीखता है कि ये कार्यकर्ता एक "पैकेज डील" हैं।

  • सिस्टम एक विशेष प्रशिक्षण पद्धति (जिसे DA-DPO कहा जाता है) का उपयोग यह सीखने के लिए करता है कि कौन से कार्यकर्ताओं के संयोजन सबसे अच्छे उत्तरों की ओर ले जाते हैं। यह उन खराब संयोजनों को अनदेखा करना सीख जाता है जहाँ कार्यकर्ता तालमेल में नहीं होते हैं।

परिणाम

शोधकर्ताओं ने इस सिस्टम का परीक्षण पांच अलग-अलग कठिन ट्रिविया और तथ्य-जांच चुनौतियों पर किया।

  • बेहतर सटीकता: AMATA ने अन्य उन्नत AI सिस्टमों, जिनमें भारी मात्रा में डेटा या जटिल सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करने वाले सिस्टम शामिल हैं, की तुलना में अधिक प्रश्नों के सही उत्तर दिए।
  • बहुत तेज़/सस्ता: क्योंकि AMATA जानता है कि कुछ कामगरों का उपयोग कब नहीं करना है, यह अन्य मजबूत सिस्टमों की तुलना में लगभग 70% कम कंप्यूटर शक्ति (टोकन) का उपयोग करता है। यह पूरे बॉक्स को मेज पर खाली करने के बजाय केवल उन्हीं टुकड़ों का उपयोग करके पहेली सुलझाने जैसा है जिनकी आपको आवश्यकता है।

सारांश में

AMATA एक स्मार्ट फ्रेमवर्क है जो AI एजेंटों को एक लचीली, सहकारी टीम के रूप में मानता है। प्रत्येक एजेंट को हर समस्या पर काम करने के लिए मजबूर करने के बजाय, यह गतिशील रूप से तय करता है कि किसकी आवश्यकता है और उन्हें एक-दूसरे पर निर्भर होना सिखाता है। इससे प्राप्त उत्तर न केवल अधिक सटीक (कम झूठ/हलुसिनेशन) होते हैं, बल्कि उन्हें तैयार करना बहुत अधिक कुशल भी होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →