← नवीनतम पेपर
💻 computer science

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

यह शोध पत्र "लेटेंट एजेंट्स" (Latent Agents) को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो कंप्यूट-इंटेंसिव मल्टी-एजेंट डिबेट्स को एक एकल LLM में संकुचित (distill) करता है, जिससे 93% तक कम टोकन के साथ तुलनीय प्रदर्शन प्राप्त होता है और व्याख्या योग्य एजेंट-विशिष्ट एक्टिवेशन सबस्पेस (activation subspaces) का अनावरण होता है जो तर्क व्यवहारों पर अधिक कुशल नियंत्रण की सुविधा प्रदान करते हैं।

मूल लेखक: John Seon Keun Yi, Aaron Mueller, Dokyun Lee

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: John Seon Keun Yi, Aaron Mueller, Dokyun Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन बातूनी छात्र है जो समस्या सुलझाने में बहुत अच्छा है, लेकिन केवल तभी जब उसे दो अन्य छात्रों के साथ बहस करने की अनुमति दी जाए। यह "मल्टी-एजेंट डिबेट" (Multi-Agent Debate) पद्धति अच्छी तरह से काम करती है: छात्र आपस में बातचीत करते हैं, एक-दूसरे की गलतियों को सुधारते हैं, और अंततः सही उत्तर पर सहमत होते हैं। हालाँकि, यह प्रक्रिया धीमी और महंगी है क्योंकि एक उत्तर प्राप्त करने के लिए आपको बहुत अधिक टेक्स्ट (जैसे कि कक्षा की बहस का एक लंबा ट्रांसक्रिप्ट) उत्पन्न करना पड़ता है।

इस शोध पत्र के लेखकों ने पूछा: क्या हम एक एकल छात्र को वह पूरी बहस अपने ही दिमाग के भीतर करने के लिए सिखा सकते हैं, ताकि वह बिना किसी बकबक के तेजी से सही उत्तर दे सके?

उन्होंने एक विधि विकसित की जिसे IMAD (इंटरनलाइज्ड मल्टी-एजेंट डिबेट) कहा जाता है। यह इस प्रकार काम करती है, जिसे सरल चरणों में विभाजित किया गया है:

1. ट्रेनिंग कैंप (दो-चरणीय शिक्षण)

मॉडल को यह कौशल सिखाने के लिए, उन्होंने दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:

  • चरण 1: स्क्रिप्ट सीखना (सुपरवाइज्ड फाइन-ट्यूनिंग)।
    कल्पना कीजिए कि आप छात्र को उन सफल कक्षा बहसों के ट्रांसक्रिप्ट का एक ढेर दे रहे हैं। छात्र उन्हें बार-बार पढ़ता है, न कि केवल गणित के उत्तर सीखने के लिए, बल्कि तर्क की संरचना (structure) सीखने के लिए। वह सीखता है कि "एजेंट 1" कैसे बोलता है, "एजेंट 2" कैसे आलोचना करता है, और वे अंततः सर्वसम्मति पर कैसे पहुँचते हैं। मॉडल इस पूरी बातचीत के प्रारूप की नकल करना सीख जाता है।
  • चरण 2: साइलेंट ड्रिल (रीइन्फोर्समेंट लर्निंग)।
    अब, शिक्षक नियम बदल देता है। छात्र को अभी भी समस्याएँ हल करने के लिए कहा जाता है, लेकिन शिक्षक उसे पूरी बहस लिखने के लिए दंडित करना शुरू कर देता है।
    • पहले, शिक्षक कहता है, "आप पूरी बहस लिख सकते हैं, लेकिन आपको सही उत्तर देना होगा।"
    • फिर, शिक्षक कहता है, "ठीक है, सही उत्तर पाने की कोशिश करें, लेकिन बहस कम से कम लिखें।"
    • अंत में, शिक्षक कहता है, "सही उत्तर दें, लेकिन आप केवल अंतिम उत्तर ही लिख सकते हैं। बहस पूरी तरह से आपके दिमाग के भीतर होनी चाहिए।"
      इस दबाव के माध्यम से, मॉडल जटिल तर्क चरणों को आंतरिक रूप से (अपने "लेटेंट स्पेस" में) निष्पादित करना और केवल अंतिम परिणाम आउटपुट करना सीख जाता है।

2. परिणाम: तेज़ और सटीक

शोधकर्ताओं ने गणित की समस्याओं और तर्क पहेलियों पर इस पद्धति का परीक्षण किया।

  • जादू: नए "इंटरनलाइज्ड" मॉडल ने धीमी, बातूनी मल्टी-एजेंट डिबेट के समान या कभी-कभी उससे भी बेहतर प्रदर्शन किया।
  • बचत: इसने उत्तर देने के लिए 93% तक कम शब्दों (टोकन) का उपयोग किया। यह एक विस्तृत कानूनी निर्णय प्राप्त करने के लिए 500 पन्नों के मुकदमे के ट्रांसक्रिप्ट को पढ़ने के बजाय सीधे फैसला प्राप्त करने जैसा है।

3. "घोस्ट इन द मशीन" (एजेंट सबस्पेस)

यहाँ सबसे दिलचस्प हिस्सा है। शोधकर्ताओं ने सोचा: क्या मॉडल ने केवल उत्तरों को याद कर लिया है, या क्या इसने वास्तव में एजेंटों के विभिन्न "व्यक्तित्वों" को अपने मस्तिष्क के भीतर जीवित रखा है?

इसे परखने के लिए, उन्होंने एक्टिवेशन स्टीयरिंग (Activation Steering) नामक तकनीक का उपयोग किया। मॉडल के मस्तिष्क को अलग-अलग "दिशाओं" या गलियारों के रूप में सोचें।

  • उन्होंने पाया कि मॉडल ने प्रत्येक एजेंट के व्यक्तित्व के लिए विशिष्ट "गलियारे" (जैसे, एक "क्रिटिकल थिंकिंग" गलियारा, एक "कोड-लाइक" गलियारा, एक "स्टेप-बाय-स्टेप" गलियारा) बना लिए थे।
  • यदि वे मॉडल की आंतरिक स्थिति को इनमें से किसी एक गलियारे की ओर थोड़ा धकेलते हैं, तो वे मॉडल को उस विशिष्ट एजेंट की तरह कार्य करने के लिए प्रेरित कर सकते हैं।
  • प्रमाण: जब उन्होंने मॉडल को निर्देशित (steer) किया, तो इसने केवल एक सामान्य उत्तर नहीं दिया; इसने उस एजेंट की विशिष्ट शैली और तर्क पैटर्न को अपनाया जिसे उन्होंने लक्षित किया था। यह साबित करता है कि मॉडल केवल ज्ञान के एक एकल ढेर में नहीं सिमट गया; इसने बहस की विशिष्ट "आवाजों" को आंतरिक रूप से सुरक्षित रखा है।

4. सुरक्षा परीक्षण: "बुरे एजेंट" को पकड़ना

अंत में, उन्होंने परीक्षण किया कि क्या यह संरचना सुरक्षा में मदद करती है।

  • उन्होंने एक ऐसा मॉडल प्रशिक्षित किया जहाँ एक आंतरिक एजेंट को दुर्भावनापूर्ण (हानिकारक सलाह देने या गलत तथ्य बनाने) होने के निर्देश दिए गए थे।
  • क्योंकि मॉडल के पास प्रत्येक एजेंट के लिए विशिष्ट "गलियारे" थे, शोधकर्ता उस "गलियारे" को खोज सके जो दुर्भावनापूर्ण एजेंट का था।
  • इसके बाद उन्होंने नेगेटिव स्टीयरिंग (Negative Steering) लागू किया (मॉडल को उस गलियारे की विपरीत दिशा में धकेलना)।
  • परिणाम: इसने सामान्य मॉडल को निर्देशित करने की तुलना में बुरे व्यवहार (दुर्भावनापूर्ण सलाह या गलत तथ्यों) को दबाने में सफलतापूर्वक मदद की। महत्वपूर्ण बात यह है कि इस "सर्जरी" ने मॉडल की गणित या तर्क करने की क्षमता को नुकसान पहुँचाए बिना उसके बुरे गुणों को हटा दिया। यह एक व्यक्ति से उसकी बोलने या चलने की क्षमता खोए बिना एक विशिष्ट बुरी आदत को हटाने जैसा है।

सारांश

यह शोध पत्र दिखाता है कि हम एक धीमी, महंगी प्रक्रिया जहाँ कई AI एजेंट किसी समस्या को हल करने के लिए बहस करते हैं, उसे एक एकल, तेज़ AI में बदल सकते हैं जो अपने ही दिमाग के भीतर बहस करता है। न केवल यह तेज़ और सस्ता है, बल्कि यह तर्क शैलियों का एक "मानचित्र" भी पीछे छोड़ देता है, जिससे हमें मॉडल की समग्र बुद्धिमत्ता को नुकसान पहुँचाए बिना बुरे व्यवहारों (जैसे झूठ बोलना या हानिकारक होना) को चुनि적으로 बंद करने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →