← नवीनतम पेपर
🤖 AI

PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents

यह शोधपत्र PACE को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), किसी भी समय वैध (anytime-valid) सांख्यिकीय ढांचा है, जो स्वयं-विकसित एजेंटों में अविश्वसनीय लालची स्वीकृति नियमों (greedy acceptance rules) को गलत कमिट और प्रदर्शन विचलन को रोकने तथा मूल्यांकन लागत को महत्वपूर्ण रूप से कम करने के लिए एक कठोर अनुक्रमिक परिकल्पना परीक्षण (sequential hypothesis test) से बदल देता है।

मूल लेखक: Zayx Shawn

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zayx Shawn

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: वह "स्वयं-सुधारने वाला" रोबोट जो भ्रमित हो जाता है

कल्पना कीजिए कि आपके पास एक रोबोट है जो खुद को बेहतर बनाने की कोशिश कर रहा है। हर दिन, वह अपने स्वयं के निर्देश मैनुअल (उसका "प्रॉम्ट") का एक नया संस्करण लिखता है और पूछता है, "क्या यह नया संस्करण पुराने वाले से बेहतर है?"

यदि नया संस्करण एक छोटे से अभ्यास परीक्षण पर थोड़ा अधिक स्कोर करता है, तो रोबोट कहता है, "हाँ! इसे रखें!" और पुराने मैनुअल को हटा देता है। वह ऐसा सैकड़ों बार करता है।

समस्या: यह पेपर तर्क देता है कि यह रोबोट वास्तव में खुद को धोखा दे रहा है। क्योंकि अभ्यास परीक्षण छोटा और शोर भरा (जैसे सिक्के को कुछ बार उछालना) है, रोबोट अक्सर एक यादृच्छिक संयोग (fluke) को वास्तविक सुधार समझ लेता है। वह ऐसे बदलाव करता रहता है जो अभ्यास परीक्षण पर तो अच्छे दिखते हैं, लेकिन वास्तव में उस रोबोट को उसके असली काम में बदतर बना देते हैं। यह एक ऐसे छात्र की तरह है जो अपने उत्तरों को बार-बार केवल इसलिए बदलता रहता है क्योंकि उसे लगता है कि वह भाग्यशाली है, और अंततः वह सब कुछ गलत कर देता है।

लेखक इसे "p-hacking" (डेटा में गलत पैटर्न खोजने के लिए एक सांख्यिकीय शब्द) कहते हैं। रोबोट "चर्निंग" (churning) कर रहा है—बिना किसी कारण के लगातार खुद को बदल रहा है, और अपनी बुद्धिमत्ता से दूर जा रहा है।

समाधान: PACE (स्मार्ट गेटकीपर)

लेखक एक नया नियम प्रस्तावित करते हैं जिसे PACE (Paired Anytime-valid Commit Evaluation) कहा जाता है। PACE को एक सख्त, निष्पक्ष रेफरी के रूप में सोचें जो रोबोट और उसके नए विचारों के बीच खड़ा है।

केवल स्कोर देखने के बजाय, PACE यह तय करने के लिए कि क्या कोई बदलाव वास्तविक है, एक चतुर सट्टेबाजी के खेल (betting game) का उपयोग करता है।

उपमा: सिक्के के उछाल की शर्त (The Coin Flip Bet)

कल्पना कीजिए कि रोबोट एक नया निर्देश प्रस्तावित करता है। रेफरी (PACE) केवल अंतिम स्कोर नहीं देखता। इसके बजाय, वह एक आमने-सामने का मुकाबला आयोजित करता है:

  1. वह पुराने रोबोट और नए रोबोट को लेता है।
  2. वह उन्हें ठीक वही 100 गणित की समस्याएं हल करने के लिए देता है।
  3. वह उन समस्याओं को अनदेखा कर देता है जहाँ दोनों ने सही उत्तर दिया या दोनों ने गलत उत्तर दिया (टाई/बराबरी)।
  4. वह केवल उन समस्याओं की परवाह करता है जहाँ एक ने सही उत्तर दिया और दूसरे ने गलत।

अब, रेफरी एक सट्टेबाजी का खेल शुरू करता है:

  • रेफरी $1.00 से शुरुआत करता है।
  • हर बार जब नया रोबोट पुराने रोबोट के खिलाफ एक समस्या जीतता है, तो रेफरी उस पैसे का एक छोटा हिस्सा दांव पर लगाता है और जीत को दोगुना कर देता है।
  • हर बार जब पुराना रोबोट जीतता है, तो रेफरी वह दांव हार जाता है।

नियम:

  • यदि नया रोबोट केवल अनुमान लगा रहा है (कोई वास्तविक सुधार नहीं है), तो जीत और हार एक-दूसरे को रद्द कर देगी, और पैसा लगभग $1.00 के आसपास ही रहेगा।
  • यदि नया रोबोट वास्तव में बेहतर है, तो वह अधिक बार जीतेगा, और पैसा तेजी से बढ़ेगा।
  • निर्णय: रेफरी रोबोट को नया निर्देश तभी रखने देता है जब पैसा बहुत बड़ी राशि (जैसे $20) तक बढ़ जाता है। यह साबित करता है कि रोबोट केवल भाग्यशाली नहीं है; वह वास्तव में बेहतर है।

यदि रोबोट परीक्षण के लिए उपलब्ध समस्याओं को समाप्त कर देता है और पैसा पर्याप्त रूप से नहीं बढ़ा है, तो रेफरी कहता है, "पर्याप्त अच्छा नहीं है," और बदलाव को खारिज कर देता है।

यह पुराने तरीके से बेहतर क्यों है?

इस पेपर का परीक्षण विभिन्न AI मॉडलों (Qwen2.5) पर गणित और विज्ञान के कार्यों के लिए किया गया। यहाँ क्या हुआ:

  1. पुराना तरीका (Greedy): रोबोट किसी भी बदलाव को रख लेता था जिससे स्कोर ऊपर जाता था, भले ही वह बहुत मामूली हो।

    • परिणाम: इसने एक रन में लगभग 13 से 20 बदलाव किए।
    • पकड़ (The Catch): उनमें से 72% से 100% बदलाव नकली थे! वे छोटे परीक्षण पर अच्छे दिखे लेकिन वास्तव में बुरे थे।
    • परिणाम: रोबोट समय के साथ बदतर होता गया, विशेष रूप से छोटे, नाजशील मॉडल। वह बिना किसी कारण के लगातार अपना विचार बदल रहा था।
  2. नया तरीका (PACE): रोबोट केवल उन्हीं बदलावों को रखता है जो सख्त सट्टेबाजी परीक्षण पास करते हैं।

    • परिणाम: जब कोई वास्तविक सुधार नहीं था, तो इसने लगभग शून्य बदलाव किए।
    • पकड़ (The Catch): इसने वास्तविक सुधारों को मिस नहीं किया। जब शोर के बीच कोई वास्तव में बेहतर निर्देश छिपा हुआ था, तो PACE ने उसे खोजा और रखा।
    • परिणाम: रोबोट स्थिर रहा। वह भटकने या बदतर होने से बचा। इसने कंप्यूटिंग पावर (पैसा) भी बचाया क्योंकि इसने जवाब पता चलते ही परीक्षण करना बंद कर दिया।

सरल भाषा में मुख्य बातें

  • शांत कमजोरी (The Silent Weakness): हर कोई इस बात पर ध्यान केंद्रित करता है कि रोबोट के लिए नए विचार कैसे बनाए जाएं। यह पेपर कहता है कि असली समस्या यह है कि हम उन्हें रखने का निर्णय कैसे लेते हैं। निर्णय लेने का नियम बहुत ढीला था।
  • शोर बनाम संकेत (Noise vs. Signal): छोटे परीक्षण शोर भरे होते हैं। एक "Greedy" रोबोट शोर (यादृच्छिक भाग्य) को संकेत (वास्तविक कौशल) समझ लेता है। PACE शोर को छान देता है।
  • सुरक्षा सर्वोपरि: PACE गारंटी देता है कि एक बुरे बदलाव को स्वीकार करने की संभावना बहुत कम है (उपयोगकर्ता द्वारा निर्धारित, जैसे 5%)। यह यह काम हर बार करता है जब वह कोई निर्णय लेता है, न कि केवल औसत पर।
  • दक्षता (Efficiency): क्योंकि PACE परीक्षण तब रोक देता है जब सबूत स्पष्ट हो जाते हैं (या तो "निश्चित रूप से बेहतर" या "पर्याप्त अच्छा नहीं"), यह वास्तव में ग्रीडी (greedy) पद्धति की तुलना में कम प्रश्न परीक्षण करता है, जो अंधाधुंध सब कुछ टेस्ट करता है।

सारांश

पेपर दिखाता है कि स्व-विकसित एजेंट वर्तमान में "भ्रमित" (hallucinating) होने के प्रति संवेदनशील हैं क्योंकि वे छोटे, शोर भरे परीक्षणों पर बहुत अधिक भरोसा करते हैं। "स्कोर बढ़ने पर रखो" वाले सरल नियम को एक सांख्यिकीय सट्टेबाजी गेट (PACE) से बदलकर, हम रोबोट को बेकार के बदलाव करने से रोक सकते हैं, जबकि उसे तब भी सीखने देते हैं जब वह वास्तव में स्मार्ट बनता है। यह एक अराजक, भटकने वाली प्रक्रिया को एक स्थिर, विश्वसनीय प्रक्रिया में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →