← नवीनतम पेपर
🤖 AI

LACUNA: Safe Agents as Recursive Program Holes

LACUNA LLM एजेंटों के लिए एक सुरक्षित प्रोग्रामिंग मॉडल है जो क्रियाओं (actions) को मॉडल द्वारा भरे जाने वाले टाइप किए गए प्रोग्राम होल्स (program holes) के रूप में मानता है और निष्पादन से पहले स्टैटिक टाइप-चेकिंग के माध्यम से उन्हें मान्य करता है, जिससे एजेंट कंट्रोल फ्लो को जनरेटेड कोड के साथ एकीकृत किया जाता है और रनटाइम विफलताओं को रोका जाता है तथा टूल एक्सेस को सीमित किया जाता है।

मूल लेखक: Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

प्रकाशित 2026-05-28
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंपनी के CEO हैं, और आपने अपना काम करने के लिए एक प्रतिभाशाली लेकिन थोड़ी अविश्वसनीय सहायक (AI) को काम पर रखा है।

पुराना तरीका (वर्तमान एजेंट्स):
आमतौर पर, आप सहायक को एक विशिष्ट, छोटा निर्देश देते हैं: "फोन कंपनी को कॉल करें।" सहायक ठीक वही करता है और फिर रुक जाता है और आपके अगले आदेश की प्रतीक्षा करता है। आप क्लिपबोर्ड थामे रहते हैं, कार्यों का क्रम तय करते हैं, और कार्यालय की चाबियाँ अपने पास रखते हैं। सहायक बैंक को कॉल करने या कार्यालय के नियमों को फिर से लिखने का निर्णय नहीं ले सकता, क्योंकि उसके पास एक बार में केवल एक ही बटन दबाने की अनुमति है।

समस्या:
कभी-कभी, सहायक आपके द्वारा लिखे गए किसी पेचीदा नोट (एक "प्रॉम्प्ट इंजेक्शन") से भ्रमित हो जाता है, या वह किसी कार्य के बीच में ही कोई गलती कर देता है, जिससे कार्यालय अव्यवस्थित और असंगत स्थिति में रह जाता है। क्योंकि सहायक को केवल बटन दबाने की अनुमति है, वे इमारत को नुकसान नहीं पहुँचा सकते, लेकिन वे उस कमरे के भीतर बहुत अधिक अराजकता पैदा कर सकते हैं जिसमें वे काम कर रहे हैं।

नया तरीका (LACUNA):
LACUNA इस रिश्ते को बदल देता है। सहायक को एक बटन दबाने के बजाय, आप उन्हें एक अनुबंध में खाली स्थान (एक "टाइप्ड होल") देते हैं और कहते हैं, "इस समस्या को हल करने के लिए आपको जिस भी कोड की आवश्यकता है उसे इस स्थान में भरें, लेकिन यह हमारे कानूनी अनुबंध में पूरी तरह से फिट होना चाहिए।"

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. "जादुई अनुबंध" (Typed Holes)

कल्पना कीजिए कि आपके पास एक अनुबंध है जो कहता है, "इस अनुभाग का अंतिम परिणाम एक संख्याओं की सूची (List of Numbers) होना चाहिए।"

  • आप AI से पूछते हैं: "इस सूची में अभाज्य संख्याएँ (prime numbers) खोजें।"
  • AI इसे हल करने के लिए निर्देशों का एक पूरा पैराग्राफ (कोड) लिखता है।
  • सुरक्षा जाँच (The Safety Check): AI को वास्तव में कुछ भी करने की अनुमति देने से पहले, एक सख्त निरीक्षक (कंपाइलर) AI के पैराग्राफ की जाँच करता है।
    • क्या पैराग्राफ वास्तव में एक "संख्याओं की सूची" परिणाम देता है? यदि AI "सेब की सूची" (List of Apples) लौटाने की कोशिश करता है, तो निरीक्षक इसे तुरंत अस्वीकार कर देता है।
    • क्या AI ने उन उपकरणों का उपयोग करने की कोशिश की जिन्हें छूने की उसे अनुमति नहीं है? (जैसे, ऐसी फ़ाइल खोलने की कोशिश करना जिसकी उसके पास चाबी नहीं है)। निरीक्षक इसे भी पकड़ लेता है।
    • परिणाम: यदि AI कोई गलती करता है, तो कोई भी कार्य शुरू होने से पहले ही अनुबंध को अस्वीकार कर दिया जाता है। कार्यालय साफ रहता है। AI को अस्वीकृति का नोटिस मिलता है, वह फिर से प्रयास करता है, और एक बेहतर पैराग्राफ लिखता है।

2. "सब-कुछ-या-कुछ-भी-नहीं" का नियम (The "All-or-Nothing" Rule)

पुराने तरीके में, यदि एक AI "फ़ाइल डिलीट करने" और फिर "योग (sum) की गणना करने" का प्रयास करता है, और गणना विफल हो जाती है, तो फ़ाइल पहले ही डिलीट हो सकती है।
LACUNA में, यह मिट्टी के एक एकल, अविभाज्य ब्लॉक की तरह है।

  • AI पूरे ब्लॉक को आकार देता है।
  • निरीक्षक एक ही बार में पूरे ब्लॉक की जाँच करता है।
  • यदि मूर्तिकला का कोई भी हिस्सा गलत है (गलत आकार, गलत सामग्री), तो पूरा ब्लॉक फेंक दिया जाता है। कुछ भी नहीं होता। कार्यालय बिल्कुल वैसा ही रहता है जैसा AI के शुरू करने से पहले था। यह "आधे-अधूरे" विनाश को रोकता है।

3. "चाबियों का गुच्छा" (Capabilities)

पेपर क्षमताओं (Capabilities) के बारे में भी बात करता है। कल्पना कीजिए कि AI को काम के लिए चाबियों का एक विशिष्ट सेट (चाबियों का गुच्छा) दिया गया है।

  • यदि काम "मेन्यू पढ़ना" है, तो AI को "मेन्यू की चाबी" मिलती है।
  • यदि काम "ईमेल भेजना" है, तो AI को "ईमेल की चाबी" मिलती है।
  • भले ही AI को एक बुरे नोट से trick किया जाए जिसमें लिखा हो, "पैसे चुराने के लिए बैंक की चाबी का उपयोग करें," वह भौतिक रूप से ऐसा नहीं कर सकता। उसके पास बैंक की चाबी नहीं है। लॉक घुमाने से पहले निरीक्षक उनके चाबियों के गुच्छे की जाँच करता है।
  • इसका अर्थ है कि यदि कोई हैकर AI को कुछ बुरा करने के लिए बहलाता है, तो भी AI के पास उन दरवाजों को खोलने के लिए आवश्यक "चाबियाँ" नहीं होती हैं।

4. "नेस्टेड रशियन डॉल्स" (Recursion)

AI ऐसा कोड लिख सकता है जिसमें उसके लिए और अधिक निर्देश शामिल हों।

  • आप पूछते हैं: "तीन विषयों पर एक रिपोर्ट लिखें।"
  • AI एक योजना लिखता है जो कहती है: "पहले, मैं AI से विषय A, फिर विषय B, और फिर विषय C पर शोध करने के लिए कहूँगा, और अंत में उन्हें मिलाऊँगा।"
  • उन सभी छोटे अनुरोधों में से प्रत्येक एक "होल" (hole) है जिसे चलने से पहले निरीक्षक द्वारा जाँच किया जाता है। यह रशियन डॉल्स (Russian nesting dolls) के एक सेट की तरह है, जहाँ हर एक छोटी डॉल को खुलने की अनुमति देने से पहले उसकी जाँच की जाती है।

शोध में वास्तव में क्या पाया गया

शोधकर्ताओं ने इस प्रणाली (LACUNA) का परीक्षण करने के लिए Scala 3 नामक प्रोग्रामिंग भाषा का उपयोग किया।

  • सुरक्षा (Safety): उन्होंने पाया कि "निरीक्षक" ने AI के लगभग 8.6% प्रयासों को चलने से पहले ही पकड़ लिया। ये वे प्रयास थे जो या तो गलत आकार के थे या उन उपकरणों का उपयोग करने की कोशिश कर रहे थे जिनके लिए AI के पास अनुमति नहीं थी।
  • पुनः प्रयास (Retry): जब AI ने गलती की, तो सिस्टम ने उसे फिर से प्रयास करने के लिए कहा। औसतन, इसे एक वैध उत्तर प्राप्त करने में केवल 0.7 प्रयास लगे।
  • प्रदर्शन (Performance): इस प्रणाली ने कठिन शोध कार्यों के लगभग 27% और ग्राहक सेवा कार्यों के 76% को हल किया। यह अन्य मानक AI एजेंट्स के लगभग बराबर था, जिससे सिद्ध हुआ कि सख्त सुरक्षा जाँच जोड़ने से AI "कम बुद्धिमान" नहीं हुआ, बल्कि केवल अधिक सुरक्षित हुआ।
  • सुरक्षा (Security): उन्होंने प्रॉम्प्ट इंजेक्शन के माध्यम से AI को धोखा देने की कोशिश करने वाले हैकर्स के खिलाफ इस प्रणाली का परीक्षण किया। क्योंकि AI अपने "चाबियों के गुच्छे" (क्षमताओं) द्वारा सीमित था, हैकर्स AI को उसके अनुमत दायरे से बाहर के काम करने के लिए मजबूर नहीं कर सके, भले ही वे AI को कुछ करने के लिए सफलतापूर्वक बहलाने में सफल रहे हों।

कमी (सीमाएँ)

पेपर कुछ बातें स्वीकार करता है:

  • यह पूर्ण नहीं है: निरीक्षक इस बात की जाँच करता है कि क्या AI ने नियमों का पालन किया (क्या उसने सही उपकरणों का उपयोग किया? क्या उसने सही प्रकार का उत्तर दिया?), लेकिन यह इस बात की जाँच नहीं करता कि क्या AI ने तार्किक रूप से सही काम किया। यदि AI एक आदर्श कोड लिखता है जो गलत गणित की गणना करता है, तो निरीक्षक उसे जाने देता है।
  • इसे एक स्मार्ट AI की आवश्यकता है: यदि AI कोड लिखने में बहुत अच्छा नहीं है, तो उसे बार-बार अस्वीकार किया जाएगा, और प्रक्रिया धीमी हो जाएगी।
  • यह धीमा है: क्योंकि सिस्टम को हर बार कोड को रोकने, जाँचने और फिर से जाँचने की आवश्यकता होती है, इसलिए इसमें केवल बटन दबाने की अनुमति देने की तुलना में अधिक समय और कंप्यूटिंग शक्ति लगती है।

संक्षेप में: LACUNA AI को एक बटन दबाने वाले से बदलकर एक ऐसे ठेकेदार (contractor) में बदल देता है जिसे कोई भी काम शुरू करने से पहले अनुमोदन के लिए एक पूर्ण योजना प्रस्तुत करनी होती है। यदि योजना नियमों को तोड़ती है, तो काम कभी शुरू ही नहीं होता, जिससे सिस्टम गलतियों और धोखों से सुरक्षित रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →