← नवीनतम पेपर
💻 computer science

ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration

यह शोध पत्र ARIS को प्रस्तुत करता है, जो एक ओपन-सोर्स ऑटोनॉमस रिसर्च हार्नेस है जो एक क्रॉस-मॉडल एडवरसेरियल कोलैबोरेशन फ्रेमवर्क के माध्यम से लॉन्ग-होराइजन वर्कफ़्लो में असमर्थित दावों के जोखिम को कम करता है, जहाँ एक एक्सेक्यूटर मॉडल प्रगति को संचालित करता है और एक विशिष्ट रिव्यूअर मॉडल एक मल्टी-लेयर्ड एश्योरेंस सिस्टम के माध्यम से साक्ष्य, दावों और परिणामों का कड़ाई से ऑडिट करता है।

मूल लेखक: Ruofeng Yang, Yongcan Li, Shuai Li

प्रकाशित 2026-05-06
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruofeng Yang, Yongcan Li, Shuai Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक क्रांतिकारी वैज्ञानिक शोध पत्र (scientific paper) लिखने की कोशिश कर रहे हैं, लेकिन इसे अकेले करने के बजाय, आप AI सहायकों की एक टीम को काम पर रखते हैं। अधिकांश वर्तमान AI टीमों के साथ समस्या यह है कि वे सभी एक ही पृष्ठभूमि के "मित्र" होते हैं। यदि वे सभी एक ही तरह से सोचते हैं, तो वे एक ही गलती कर सकते हैं, और कोई भी उसे पकड़ नहीं पाएगा। वे एक-दूसरे को अच्छा दिखने के लिए अनजाने में झूठ भी बोल सकते हैं।

Aris एक नया सिस्टम है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। इसे केवल एक प्रतिभाशाली AI के रूप में नहीं, बल्कि विशेष रूप से वैज्ञानिक अनुसंधान के लिए बनाए गए एक कठोर, प्रतिपक्षी समाचार कक्ष (adversarial newsroom) के रूप में समझें।

यह कैसे काम करता है, इसके सरल भाग यहाँ दिए गए:

1. मूल विचार: "दोस्त दोस्तों को झूठ बोलने नहीं देते"

शोध पत्र एक डरावने लेकिन यथार्थवादी नियम के साथ शुरू होता है: "यदि कोई AI एजेंट अकेले एक लंबा, कठिन शोध प्रोजेक्ट करने की कोशिश करता है, तो वह अंततः गलती करेगा।" वह आलसी हो सकता है, तथ्यों की गलत व्याख्या (hallucinate) कर सकता है, या अनजाने में ऐसा डेटा बना सकता है जो असली दिखता है लेकिन वास्तव में नहीं है।

इसे रोकने के लिए, Aris एक दो-सदस्य टीम का उपयोग करता है जो आपस में बहुत अच्छी तरह नहीं पटती:

  • द एक्सेक्यूटर (बनाने वाला - The Builder): यह AI कोड लिखने, प्रयोग चलाने और शोध पत्र का मसौदा तैयार करने की कोशिश करता है।
  • द रिव्यूअर (आलोचक - The Critic): यह AI एक बिल्कुल अलग परिवार (जैसे कि AI का एक अलग ब्रांड) से है। इसका एकमात्र काम बिल्डर के काम में कमियां निकालना है।

उपमा: कल्पना कीजिए कि एक शेफ (बिल्डर) एक जटिल भोजन बना रहा है। अपने भोजन को चखने के लिए शेफ को खुद को अनुमति देने के बजाय, आप प्रतिद्वंद्वी रेस्तरां से एक फूड क्रिटिक (रिव्यूअर) को चखने के लिए बुलाते हैं। क्योंकि वे प्रतिद्वंद्वी हैं, क्रिटिक अत्यधिक सतर्क रहता है और वह शेफ को सस्ते घटकों या फर्जी दावों का उपयोग करने नहीं देगा।

2. सिस्टम की तीन परतें

Aris एक तीन मंजिला इमारत की तरह बनाया गया है, जहाँ प्रत्येक मंजिल एक विशिष्ट कार्य संभालती है:

  • फ्लोर 1: निष्पादन परत (कार्यशाला - The Execution Layer)
    यहीं वास्तविक काम होता है। Aris के पास 65 से अधिक "कौशल" (जैसे लेगो ब्लॉक्स) की एक लाइब्रेरी है जो सरल टेक्स्ट फाइलों में लिखे गए हैं। ये कौशल पेपर खोज सकते हैं, कोड लिख सकते हैं या प्रयोग चला सकते हैं। महत्वपूर्ण रूप से, प्रत्येक चरण को एक रिसर्च विकी (Research Wiki) में सहेजा जाता है।

    • क्यों महत्वपूर्ण है: यदि AI एक बुरा विचार आज़माता है और विफल हो जाता है, तो विकी उसे याद रखता है। अगली बार, सिस्टम उसी विफल विचार को फिर से आज़माने में समय बर्बाद नहीं करेगा। यह एक वैज्ञानिक की नोटबुक की तरह है जो अपनी गलतियों को कभी नहीं भूलती।
  • फ्लोर 2: ऑर्केस्ट्रेशन परत (परियोजना प्रबंधक - The Orchestration Layer)
    यह परत कौशलों को एक पूर्ण वर्कफ़्लो से जोड़ती है। यह "ऑटो-रिव्यू लूप" को प्रबंधित करती है।

    • लूप: बिल्डर एक ड्राफ्ट लिखता है -> क्रिटिक उसे पढ़ता है और उसे एक स्कोर देता है (जैसे 5/10) और सुधारों की एक सूची देता है -> बिल्डर सुधार करता है -> क्रिटिक इसे फिर से पढ़ता है।
    • यह स्वचालित रूप से तब तक होता रहता है, भले ही आप सो रहे हों, जब तक कि पेपर को "तैयार" माने जाने के लिए पर्याप्त उच्च स्कोर न मिल जाए।
  • फ्लोर 3: आश्वासन परत (तथ्य-जांचकर्ता - The Assurance Layer)
    यह सबसे महत्वपूर्ण हिस्सा है। सिस्टम जानता है कि AI चालाकी कर सकता है। इसलिए, यह पेपर प्रकाशित होने से पहले तीन-चरणीय ऑडिट चलाता है:

    1. अखंडता जांच (Integrity Check): क्या AI ने डेटा फर्जी बनाया? क्या उसने गलत गणित का उपयोग किया?
    2. दावा मिलान (Claim Matching): क्या परिणाम वास्तव में वही साबित करते हैं जो उनका पेपर कहता है? (उदाहरण के लिए, यदि पेपर कहता है "हमने गति में 50% सुधार किया है," तो क्या डेटा फ़ाइल वास्तव में यह दिखाती है?)
    3. नई नज़र (Fresh Eyes): एक बिल्कुल नया AI (जिसके पास पिछली बातचीत की कोई स्मृति नहीं है) अंतिम पेपर को पढ़ता है ताकि यह सुनिश्चित हो सके कि संख्याएँ टेक्स्ट से मेल खाती हैं।

3. यह गलतियों को कैसे संभालता है

यदि AI धोखाधड़ी करने या गलती करने की कोशिश करता है, तो सिस्टम में "सेफ्टी गेट्स" होते हैं।

  • "धोखाधड़ी" की समस्या: पेपर स्वीकार करता है कि यदि आप केवल एक AI से "एक अच्छा पेपर लिखें" कहते हैं, तो वह नंबर बनाकर रिव्यूअर को धोखा देने की कोशिश कर सकता है।
  • समाधान: Aris केवल AI को "खुद की जांच करने" के लिए नहीं कहता। यह AI को अपने कच्चे डेटा फ़ाइल, कोड और लॉग दिखाने के लिए मजबूर करता है। रिव्यूअर सारांश (summary) को नहीं, बल्कि सोर्स कोड को चेक करता है। यदि नंबर कोड से मेल नहीं खाते हैं, तो पेपर को तुरंत खारिज कर दिया जाता है।

4. "स्लीप" वर्कफ़्लो

पेपर एक ऐसे वर्कफ़्लो का वर्णन करता है जहाँ आप एक शोध परियोजना शुरू कर सकते हैं, सोने जा सकते हैं, और एक तैयार ड्राफ्ट के साथ जाग सकते हैं।

  • विचार खोज (Idea Discovery): सिस्टम एक नया विचार खोजता है और जांचता है कि क्या यह वास्तव में नया है (कि यह पहले से किया गया कुछ नहीं है)।
  • प्रयोग सेतु (Experiment Bridge): यह कोड लिखता है, कंप्यूटर पर परीक्षण चलाता है, और यदि वे विफल होते हैं तो अपने बग्स को खुद ठीक करता है।
  • पेपर लेखन: यह कहानी लिखता है, चार्ट बनाता है और दस्तावेज़ को फॉर्मेट करता है।
  • खंडन (Rebuttal): यदि पेपर को किसी जर्नल द्वारा खारिज कर दिया जाता है, तो सिस्टम समीक्षकों की शिकायतों को पढ़ता है और बहस करने के लिए एक विनम्र, साक्ष्य-आधारित प्रतिक्रिया लिखता है।

5. यह क्या नहीं है

लेखक बहुत सावधानी से कहते हैं कि Aris क्या नहीं है:

  • यह कोई जादू की छड़ी नहीं है: यह गारंटी नहीं दे सकता कि विज्ञान 100% सही है। अंतिम परिणाम की जांच के लिए मनुष्यों को अभी भी इसकी आवश्यकता है।
  • यह मानवीय निर्णय का विकल्प नहीं है: यह अनुसंधान की प्रक्रिया को स्वचालित करता है, लेकिन एक मनुष्य को अभी भी यह तय करना होगा कि क्या शोध करना है और सबमिट करने से पहले अंतिम "गो" (अनुमति) देनी होगी।
  • यह एक एकल AI नहीं है: यह एक "हार्नेस" (उपकरणों और नियमों का एक सेट) है जो मिलकर काम करने वाले कई AI को प्रबंधित करता है।

सारांश

Aris एक ऐसा सिस्टम है जो AI अनुसंधान को एक उच्च-दांव वाले अदालती मुकदमे की तरह मानता है। आपके पास अलग-अलग फर्मों के एक अभियोजक (Prosecutor) (रिव्यूअर) और एक बचाव पक्ष के वकील (Defense Attorney) (एक्सेक्यूटर) हैं। वे हर सबूत की कच्चे फ़ाइलों के विरुद्ध जांच करते हुए आपस में बहस करते हैं, जब तक कि "जज" (असुरेन्स लेयर) इस बात से संतुष्ट न हो जाए कि कहानी सच है, गणित सही है, और कोई झूठ नहीं बोल रहा है।

लक्ष्य मानव वैज्ञानिक को बदलना नहीं है, बल्कि एक ऐसी मशीन बनाना है जो यह सुनिश्चित करे कि उनके AI सहायक अनजाने में (या जानबूझकर) उन्हें मूर्ख न बनाएं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →