← नवीनतम पेपर
🤖 AI

Making Failure Safe: A Constrained, Verifiable Agent Framework for Open-Web Data Collection

यह शोधपत्र एक नियंत्रित, सत्यापन योग्य एजेंट फ्रेमवर्क प्रस्तावित करता है जो विश्वसनीय ओपन-वेब डेटा संग्रह को नियत (deterministic), कम लागत वाला और पुन: प्रयोज्य बनाने के लिए अविश्वसनीय मुक्त-रूप (free-form) LLM कोड जनरेशन को टाइप्ड JSON कलेक्टर कॉन्फ़िगरेशन और स्टैटिक निष्पादन पाइपलाइनों से बदल देता है।

मूल लेखक: Bo Chen

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपको एक रोबोट को काम पर रखना है जो हर दिन हजारों अलग-अलग वेबसाइटों से विशिष्ट जानकारी इकट्ठा करने जाए। आप बस रोबोट को कह सकते हैं, "जाओ समाचार लेकर आओ," और उम्मीद कर सकते हैं कि वह खुद समझ जाएगा कि इसे कैसे करना है। लेकिन जैसा कि यह शोध पत्र बताता है, यह "खुली छूट" वाला दृष्टिकोण एक बच्चे को बिना किसी निर्देश के पुस्तकालय में भेजने जैसा है; वह गलत किताबें उठा सकता है, कुर्सियों से टकराकर गिर सकता है, या पृष्ठों का एक उलझा हुआ ढेर लेकर वापस आ सकता है।

यह पेपर इन डेटा-इकट्ठा करने वाले रोबोटों (जिन्हें "एजेंट्स" कहा जाता है) को बनाने का एक नया तरीका प्रस्तावित करता है जो इसे सुरक्षित, अनुमानित और ठीक करने में आसान बनाता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: वेब स्क्रेपिंग का "वाइल्ड वेस्ट" (अराजकता)

वर्तमान में, यदि आप किसी AI को किसी वेबसाइट को स्क्रैप करने के लिए कोड लिखने को कहते हैं, तो वह अक्सर हर बार शून्य से एक नया स्क्रिप्ट लिखने की कोशिश करता है।

  • समस्या: वेबसाइटें अव्यवस्थित होती हैं और अक्सर बदलती रहती हैं। यदि AI यह अनुमान लगाने में गलती कर देता है कि पेज पर प्राइस टैग (कीमत का लेबल) कहाँ स्थित है, तो पूरा स्क्रिप्ट टूट जाता है।
  • परिणाम: आपको त्रुटियां (errors), टूटा हुआ डेटा, या ऐसे स्क्रिप्ट मिलते हैं जो वेबसाइट का लेआउट बदलते ही काम करना बंद कर देते हैं। यह हर बार ईंट बिछाते समय यह अनुमान लगाने जैसा है कि ईंटें कहाँ लगानी हैं।

2. समाधान: "LEGO किट" दृष्टिकोण

AI को मुक्त रूप से कोड लिखने देने के बजाय (जैसे कोई उपन्यास लिखना), लेखक AI को एक संरचित फॉर्म भरने के लिए मजबूर करते हैं (जैसे LEGO निर्देश शीट भरना)।

  • वर्गीकरण (6 प्रकार): सिस्टम पहले पूछता है, "यह किस तरह का काम है?" यह कार्यों को छह विशिष्ट प्रकारों में वर्गीकृत करता है, जैसे कि एक मेनू:

    1. सर्च (Search): कीवर्ड के आधार पर लिंक खोजना।
    2. लिस्ट (List): वस्तुओं के पेजों (जैसे समाचार संग्रह) के माध्यम से आगे बढ़ना।
    3. डिटेल (Detail): एक एकल पेज की पूरी सामग्री को पढ़ना।
    4. API: सीधे कंप्यूटर से डेटा मांगना (जैसे मेनू से ऑर्डर करना)।
    5. इंटरैक्टिव (Interactive): डायनेमिक पेजों पर बटन क्लिक करना या टाइप करना।
    6. फाइल (File): PDF या Excel शीट डाउनलोड करना।
    • उपमा: एक शेफ को "रात का खाना बनाओ" कहने के बजाय, आप उसे बताते हैं, "आप सूप बना रहे हैं," और वह केवल सूप के लिए उपलब्ध उपकरणों और व्यंजनों का ही उपयोग करता है। यह उसे सूप के बजाय केक बनाने की कोशिश करने से रोकता है।
  • सीमाएं (सुरक्षा रेलिंग): AI को नया कोड बनाने की अनुमति नहीं है। इसे "यूटिलिटी फंक्शन्स" (पहले से बने टूल्स) के एक पूर्व-अनुमोदित पुस्तकालय में से चुनना होगा और एक टेम्पलेट में खाली स्थान भरने होंगे।

    • उपमा: इसे "मैड लिब्स" (Mad Libs) गेम की तरह समझें जहाँ AI को पूरी कहानी लिखने के बजाय केवल दिए गए विशिष्ट रिक्त स्थानों को भरना होता है। यह सुनिश्चित करता है कि आउटपुट हमेशा ऐसे प्रारूप में हो जिसे कंप्यूटर समझ सके।

3. प्रक्रिया: "टेस्ट ड्राइव" लूप

यह फ्रेमवर्क रोबोट को तुरंत काम पर नहीं भेजता है। यह एक सख्त "जेनरेट → चेक → फिक्स" लूप का उपयोग करता है:

  1. जेनरेट (Generate): AI उपयोगकर्ता के अनुरोध के आधार पर एक कॉन्फ़िगरेशन फ़ाइल (एक JSON योजना) बनाता है।
  2. टेस्ट ड्राइव (वैलिडेशन): पूरे काम को चलाने से पहले, सिस्टम केवल कुछ पेजों पर एक छोटा, सस्ता परीक्षण चलाता है।
  3. गुणवत्ता जांच (रेफरी): एक नियम-आधारित सिस्टम (AI नहीं) परिणामों की जांच करता है। वह पूछता है: "क्या हमें सही फील्ड मिले? क्या डेटा खाली है? क्या सिस्टम क्रैश हो गया?"
    • महत्वपूर्ण बिंदु: यदि टेस्ट विफल होता है, तो सिस्टम केवल यह नहीं कहता कि "फिर से प्रयास करें।" यह एक विशिष्ट "ब्लैकलिस्ट" बनाता है कि क्या नहीं करना है (जैसे, "कीमत को फुटर में न खोजें")।
  4. फिक्स (Fix): AI फिर से प्रयास करता है, लेकिन इस बार उसे उन गलतियों से बचने के लिए मजबूर किया जाता है जो उसने अभी की थीं।
  5. स्केल अप (Scale Up): केवल तभी जब टेस्ट ड्राइव सफल हो जाता है, सिस्टम पूरा कलेक्शन कार्य चलाता है।

4. परिणाम: गति बनाम पूर्णता

लेखकों ने 138 विभिन्न डेटा संग्रह कार्यों पर इसका परीक्षण किया। उन्होंने पाया:

  • वन-शॉट क्वालिटी: यदि आप अभी केवल एक बार डेटा लेना चाहते हैं, तो अन्य तरीके जो AI को फ्री कोड लिखने देते हैं, तुरंत थोड़े बेहतर परिणाम दे सकते हैं (लगity 70% सफलता बनाम इस तरीके के लिए 50%)।
  • समझौता (Trade-off): हालांकि, लेखकों का तरीका बार-बार चलाने के लिए बहुत तेज़ और बहुत सस्ता है।
    • जादू: एक बार योजना बन जाने के बाद, वास्तविक संग्रह कार्य बिना किसी AI के चलता है। यह केवल पूर्व-निर्मित योजना को निष्पादित करता है।
    • उपमा: अन्य तरीके हर वाक्य को पढ़ने के लिए एक मानव अनुवादक को काम पर रखने जैसे हैं। यह तरीका एक बार अनुवादक को एक शब्दकोश लिखने के लिए काम पर रखने और फिर उस शब्दकोश का हमेशा के लिए उपयोग करने जैसा है।
  • विश्वसनीयता: जब सिस्टम विफल हुआ, तो वह चुपचाप विफल नहीं हुआ। इसने एक स्पष्ट त्रुटि रिपोर्ट (error report) दी, जिससे "फिक्स" लूप को सुधार करने में मदद मिली। उनके परीक्षणों में, इस फीडबैक लूप ने एक विफल होते सिस्टम (0% पास रेट) को एक पूर्ण सिस्टम (100% पास रेट) में बदल दिया।

सारांश

यह पेपर तर्क देता है कि हमें AI को वेब को स्क्रैप करने का अनुमान लगाने में "परफेक्ट" बनाने की कोशिश नहीं करनी चाहिए। इसके बजाय, हमें AI को सख्त नियमों का पालन करने, पूर्व-निर्मित टूल्स का उपयोग करने और वास्तविक काम करने से पहले एक "टेस्ट ड्राइव" चलाने के लिए प्रतिबंधित (constrain) करना चाहिए।

एक प्रारंभिक पूर्णता (perfection) के बदले एक ऐसे सिस्टम को चुनकर जो सत्यापन योग्य, पुन: प्रयोज्य और चलाने में सस्ता है, यह फ्रेमवर्क स्वचालित डेटा संग्रह को वास्तविक दुनिया के निर्धारित उपयोग (जैसे हर सुबह समाचार या सरकारी डेटा एकत्र करना) के लिए विश्वसनीय बनाता है, जिसमें वेबसाइट बदलने पर हर बार कोड को ठीक करने के लिए इंसान की आवश्यकता नहीं होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →