← नवीनतम पेपर
🤖 AI

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

यह शोध पत्र "बेस सीक्वेंस एनालिसिस" (Base Sequence Analysis) प्रस्तुत करता है, जो एक जीनोमिक-प्रेरित ढांचा है जो उच्च-जोखिम वाले पैटर्न और सत्यापन संबंधी कमियों की पहचान करने के लिए LLM एजेंट व्यवहारों को प्रतीकात्मक अनुक्रमों (symbolic sequences) में एनकोड करता है, जिससे "गवर्नर" (Governor) का विकास होता है, जो एक रनटाइम गवर्नेंस सिस्टम है जो स्वायत्त एजेंटों में कार्य सफलता दर में उल्लेखनीय सुधार करता है और टोकन खपत को कम करता है।

मूल लेखक: Sidi Deng

प्रकाशित 2026-06-16✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sidi Deng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक (एक AI एजेंट) है जो आपको समस्याएँ हल करने में मदद करता है, जैसे कि कोड लिखना या वेब खोजना। आमतौर पर, जब हम यह जाँचते हैं कि क्या यह रोबोट अच्छा काम कर रहा है, तो हम केवल अंतिम परिणाम देखते हैं: "क्या इसने कार्य पूरा किया? हाँ या नहीं?"

यह शोध पत्र तर्क देता है कि केवल अंतिम परिणाम देखना एक मैराथन धावक को केवल इस आधार पर आंकने जैसा है कि क्या उसने फिनिश लाइन पार की या नहीं, बिना यह देखे कि वह कैसे दौड़ा। क्या वह स्प्रिंट कर रहा था, जॉग कर रहा था, या चक्कर काटते हुए भटक गया था?

लेखक इन रोबters को देखने का एक नया तरीका प्रस्तावित करते हैं: "एजेंट जीनोम" (The Agent Genome)।

1. चार-अक्षर वाला वर्णमाला (जीनोम)

जिस तरह मानव DNA चार अक्षरों (A, C, G, T) से बना होता है, लेखक कहते हैं कि AI द्वारा की जाने वाली प्रत्येक क्रिया को चार "आधार" अक्षरों में से एक में बदला जा सकता है:

  • X (Explore - अन्वेषण): रोबोट जानकारी जुटा रहा है (फाइलें पढ़ रहा है, वेब खोज रहा है)।
  • E (Execute - निष्पादन): रोबोट काम कर रहा है (एक फाइल लिख रहा है, एक कमांड चला रहा है)।
  • P (Plan - योजना): रोबोट अपनी रणनीति के बारे में सोच रहा है या फिर से सोच रहा है।
  • V (Verify - सत्यापन): रोबोट अपने काम की जाँच कर रहा है (टेस्ट चला रहा है, दोबारा जाँच रहा है)।

हर बार जब रोबोट काम करता है, तो वह इन अक्षरों का एक "अनुक्रम" (sequence) बनाता है, जैसे कि एक वाक्य: X-X-P-E-E-V

2. उन्होंने क्या पाया (निदान)

शोधकर्ताओं ने 347 वास्तविक दुनिया के कार्यों का विश्लेषण किया और पाया कि ये रोबोट कैसे काम करते हैं, इसमें तीन प्रमुख "व्यवहार संबंधी बीमारियाँ" हैं:

  • "ओवर-थिंकर" चक्र (P-X-P): सबसे खतरनाक पैटर्न तब होता है जब एक रोबोट योजना बनाता है, फिर अन्वेषण करता है, और फिर वास्तव में कुछ भी किए बिना फिर से योजना बनाता है। यह एक ऐसे व्यक्ति की तरह है जो मानचित्र पढ़ता है, फिर गोल-गोल घूमता है, और फिर फिर से मानचित्र पढ़ने के लिए रुक जाता है। इस विशिष्ट पैटर्न ने रोबोट को 10% अधिक बार विफल कर दिया।
  • "चेक न करने" की आदत (E→V घाटा): जब एक रोबोट कार्य पूरा करता है (E), तो वह लगभग कभी भी अपने काम की जाँच (V) नहीं करता है। डेटा से पता चला कि केवल 2.1% बार ही किसी रोबोट ने काम करने के तुरंत बाद अपने काम को सत्यापित किया। यह एक छात्र को बिना उत्तर देखे परीक्षा जमा करने जैसा है।
  • बहुत अधिक सोचना: एक रोबोट "करने" (Do) मोड के सापेक्ष "योजना" (Plan) मोड में जितना अधिक समय बिताता है, उसके विफल होने की संभावना उतनी ही अधिक होती है।

3. समाधान: "गवर्नर" (The Cerebellum)

इसे ठीक करने के लिए, लेखकों ने गवर्नर (Governor) नामक एक प्रणाली बनाई।

AI के मुख्य मस्तिष्क (LLM) को सेरेब्रम (Cerebrum) (सोचने और रचनात्मकता के लिए जिम्मेदार) के रूप में सोचें। लेखक गवर्नर की तुलना मानव मस्तिष्क के सेरेबेलम (Cerebellum) से करते हैं। सेरेबेलम सोचता नहीं है; यह गति का समन्वय करता है और आपको लड़खड़ाने से बचाता है।

गवर्नर कैसे काम करता है:

  • यह पहले वाले को देखने के लिए दूसरे AI का उपयोग नहीं करता है (जो धीमा और महंगा होगा)।
  • इसके बजाय, यह वास्तविक समय में "चार-अक्षर वाले अनुक्रम" को देखता है।
  • यदि यह देखता है कि रोबोट "योजना-अन्वेषण-योजना" के लूप में फंस गया है, तो गवर्नर तुरंत रोबोट को एक छोटा, सरल नोट भेजता है: "हे, तुम बहुत देर से सोच रहे हो। अन्वेषण करना बंद करो और बस काम करो।"
  • यह एक "सॉफ्ट" इशारा है, आदेश नहीं। रोबोट इसे अनदेखा करने का विकल्प चुन सकता है, लेकिन आमतौर पर, वह सुनता है।

4. परिणाम

जब उन्होंने गवर्नर को चालू किया:

  • सफलता दर: 6.2% बढ़ गई (एक ऐसे सिस्टम के लिए एक बड़ी छलांग जो पहले से ही अच्छा था)।
  • लागत: "ब्रेन पावर" (टोकन) का उपयोग 44% कम हो गया।
  • क्यों? क्योंकि रोबोट ने अन्वेषण और सोचने के अंतहीन लूपों में समय बर्बाद करना बंद कर दिया।

5. "यूनिवर्सल ट्रांसलेटर"

शोधकर्ताओं ने परीक्षण किया कि क्या यह विचार अन्य रोबोटों पर काम करता है। उन्होंने सॉफ्टवेयर इंजीनियरिंग के लिए उपयोग किए जाने वाले एक अलग रोबोट सिस्टम (SWE-agent) पर अपना "चार-अक्षर वाला वर्णमाला" लागू किया।

  • परिणाम: वही बुरी आदतें दिखाई दीं! दूसरे रोबोट को भी "एक्सप्लोरेशन स्पाइरल" में फंसने और अपने काम की जाँच करने में बहुत कम समय लेने की समस्या थी।
  • मॉडल फिंगरप्रिंट्स: उन्होंने यह भी देखा कि बड़े, स्मार्ट मॉडल छोटे मॉडलों की तुलना में स्वाभाविक रूप से अपने काम की जाँच अधिक बार करते हैं। यह सुझाव देता है कि "चार-अक्षर वाला अनुक्रम" अलग-अलग AI मॉडलों को उनके व्यवहार के आधार पर पहचानने के लिए एक फिंगरप्रिंट के रूप में कार्य कर सकता है।

सारांश

यह शोध पत्र दावा करता है कि जटिल AI व्यवहार को एक सरल चार-अक्षर वाले कोड में बदलकर, हम बुरी आदतों (जैसे बहुत अधिक सोचना या काम की जाँच करने में विफल होना) को पहचान सकते हैं और वास्तविक समय में उन्हें धीरे से सुधार सकते हैं। यह AI एजेंटों को तेज़, सस्ता और अधिक विश्वसनीय बनाता है, जो एक "सेरेबेलम" के रूप में कार्य करता है जो AI के मस्तिष्क को बिना खुद के मस्तिष्क को पुन: प्रशिक्षित किए, उसकी गतिविधियों को समन्वित करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →