← नवीनतम पेपर
💻 computer science

The Last Harness You'll Ever Build

यह शोध पत्र एक दो-स्तरीय ढांचे को प्रस्तुत करता है जो व्यक्तिगत कार्यों के लिए 'हारनेस इवोल्यूशन लूप' के माध्यम से और एक सार्वभौमिक प्रोटोकॉल सीखने वाले 'मेटा-इवोल्यूशन लूप' के माध्यम से AI एजेंट हार्नेस के निर्माण और अनुकूलन को स्वचालित करता है, जो अंततः एजेंटों को नए डोमेन में अनुकूलित करने के लिए मैनुअल हार्नेस इंजीनियरिंग की आवश्यकता को समाप्त कर देता है।

मूल लेखक: Haebin Seong, Li Yin, Haoran Zhang

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haebin Seong, Li Yin, Haoran Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान इंटर्न है। यह इंटर्न (AI मॉडल) दुनिया की हर चीज़ जानता है, इसने हर किताब पढ़ी है, और यह मन ही मन जटिल गणित की समस्याओं को हल कर सकता है। लेकिन एक पेच है: इस इंटर्न ने वास्तव में पहले कभी कोई काम नहीं किया है। इसे नहीं पता कि कंप्यूटर कैसे इस्तेमाल करते हैं, यह उलझी हुई हिदायतों से भ्रमित हो जाता है, और यह अक्सर अपना काम दोबारा चेक करना भूल जाता है।

इसे उपयोगी बनाने के लिए, आपको इसके लिए एक वर्कस्टेशन (कार्यस्थल) बनाना होगा। आप इसे एक चेकलिस्ट, औजारों का एक सेट, इसके काम की समीक्षा करने के लिए एक मैनेजर और इससे बात करने का एक विशिष्ट तरीका देते हैं। तकनीकी दुनिया में, इस "वर्कस्टेशन" को हार्नेस (Harness) कहा जाता है।

समस्या: वर्कस्टेशन बनाना कठिन है

अभी, यदि आप चाहते हैं कि आपका AI इंटर्न कोई विशिष्ट कार्य करे—जैसे "इस कोड के बग्स ठीक करें" या "एक CEO के लिए फ्लाइट बुक करें"—तो आपको एक मानव विशेषज्ञ द्वारा उनके लिए एक कस्टम वर्कस्टेशन बनाना पड़ता है।

  • उन्हें एकदम सटीक निर्देश लिखने होते हैं।
  • उन्हें उन टूल्स (औजारों) का निर्माण करना होता है जिनकी AI को आवश्यकता है।
  • उन्हें AI के काम को ग्रेड करने के लिए एक सिस्टम स्थापित करना होता है।

यह ऐसा है जैसे हर नए कार्य के लिए अपने इंटर्न के लिए एक कस्टम डेस्क बनाने के लिए एक मास्टर बढ़ई को काम पर रखना। यह धीमा है, महंगा है, और इसके लिए बहुत अधिक मानवीय कौशल की आवश्यकता होती है।

समाधान: एक स्व-सुधारने वाली कार्यशाला (Self-Improving Workshop)

यह पेपर एक ऐसी प्रणाली का परिचय देता है जो इस पूरी प्रक्रिया को स्वचालित (automate) करती है। यह ऐसा है जैसे आपने अपने इंटर्न को एक जादुई कार्यशाला दे दी है जो बिना आपके एक उंगली भी हिलाए, किसी भी काम के लिए खुद को बेहतर बनाने के लिए फिर से डिजाइन कर सकती है।

यह दो स्तरों पर होता है:

स्तर 1: "कोशिश करो, आलोचना करो, सुधारो" लूप (The Harness Evolution Loop)

कल्पना कीजिए कि आपका इंटर्न केक बनाने की कोशिश कर रहा है।

  1. द वर्कर (The Worker): इंटर्न अपनी वर्तमान हिदायतों का उपयोग करके केक बनाने की कोशिश करता है।
  2. द क्रिटिक (The Critic): एक सख्त फूड क्रिटिक (इवैल्यूएटर) केक चखता है। केवल "बुरा है" कहने के बजाय, वह एक विस्तृत रिपोर्ट लिखता है: "मैदा बहुत पुराना था, आपने इसे बहुत तेज़ी से मिलाया, और आप चीनी डालना भूल गए।"
  3. द आर्किटेक्ट (The Architect): एक सीनियर इंजीनियर (इवोल्यूशन एजेंट) उस रिपोर्ट को पढ़ता है। वे केवल केक को ठीक नहीं करते; वे रेसिपी बुक को फिर से लिखते हैं और रसोई के औजारों को बदल देते हैं। शायद वे एक टाइमर जोड़ते हैं, मिक्सिंग बाउल को बदलते हैं, या निर्देशों को बदलकर यह कहते हैं कि "धीरे-धीरे मिलाएं।"

वे इस चक्र को दोहराते हैं: बेक करें → आलोचना करें → रसोई को फिर से डिजाइन करें → फिर से बेक करें। अंततः, रसोई उस विशिष्ट केक को त्रुटिहीन रूप से बनाने के लिए पूरी तरह से ट्यून हो जाती है।

पेपर में: यह लूप स्वचालित रूप से AI के प्रॉम्प्ट्स, टूल्स और लॉजिक को तब तक बदलता रहता है जब तक कि वह एक एकल कार्य में महारत हासिल न कर ले।

स्तर 2: "मास्टर टीचर" (The Meta-Evolution Loop)

यहाँ चीज़ें वास्तव में बहुत दिलचस्प हो जाती हैं।

अब तक, हमने कार्यशाला को एक विशिष्ट केक बनाना सिखाया है। लेकिन क्या होगा अगर आप अगली बार पिज्जा बनाना चाहते हैं? या एक सूफ़ले (soufflé)? आपको "कोशिश, आलोचना, सुधार" लूप को फिर से शुरू से शुरू करना होगा।

मेटा-इवोल्यूशन लूप (The Meta-Evolution Loop) एक मास्टर टीचर की तरह है जो पूरी प्रक्रिया को देखता है।

  • मास्टर टीचर देखता है कि कार्यशाला ने केक बनाना सीखा, फिर पिज्जा, फिर पाई।
  • वे पैटर्न देखते हैं: "हे, हर बार जब हम एक खाली रेसिपी से शुरू करते हैं, तो इसे सही करने में 10 प्रयास लगते हैं। लेकिन अगर हम एक 'स्टार्टर गाइड' और एक 'क्विक-चेक टूल' के साथ शुरू करते हैं, तो हमें केवल 2 प्रयास लगते हैं!"
  • मास्टर टीचर फिर कार्यशाला के नियमों को ही फिर से लिख देता है। वे यह बदलते हैं कि क्रिटिक फीडबैक कैसे देता है और आर्किटेक्ट रसोई को कैसे डिजाइन करता है।

परिणाम: कार्यशाला सीखना सीख जाती है। अब, जब आप इसे एक नया कार्य (जैसे "एक वेबसाइट डिजाइन करें") देते हैं, तो इसे शून्य से शुरू करने की आवश्यकता नहीं होती। यह तुरंत जान जाता है कि रसोई को सेटअप करने का सबसे अच्छा तरीका क्या है, काम की आलोचना करने का सबसे अच्छा तरीका क्या है, और गलतियों को सुधारने का सबसे अच्छा तरीका क्या है।

बड़ी तस्वीर (The Big Picture)

  • पुराना तरीका: एक मानव विशेषज्ञ हर नए काम के लिए एक कस्टम रोबोट बनाता है।
  • नया तरीका (यह पेपर): हम एक ऐसा रोबोट बनाते हैं जो रोबोट बनाता है। और फिर, हम एक ऐसी प्रणाली बनाते हैं जो उस रोबोट को रोबोट बनाने में तेज़ और बेहतर होने का तरीका सिखाती है।

लेखक इसे "द लास्ट हार्नेस यू विल एवर बिल्ड" (वह आखिरी हार्नेस जिसे आप कभी बनाएंगे) कहते हैं। विचार यह है कि एक बार जब यह प्रणाली प्रशिक्षित हो जाती है, तो आपको अब "हार्नेस इंजीनियरिंग" का विशेषज्ञ होने की आवश्यकता नहीं होगी। आप बस एक सामान्य AI को एक नई, कठिन समस्या की ओर निर्देशित कर सकते हैं, और सिस्टम स्वचालित रूप से उसे हल करने के लिए एकदम सही सेटअप विकसित कर लेगा।

संक्षेप में: उन्होंने एक ऐसी प्रणाली बनाई है जो केवल समस्याओं को हल नहीं करती; बल्कि यह समस्या को हल करती है कि AI को समस्या हल करना कैसे सिखाया जाए

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →