← नवीनतम पेपर
🤖 AI

Agentic Interpretation: Lattice-Structured Evidence for LLM-Based Program Analysis

यह शोध पत्र "एजेंटिक इंटरप्रिटेशन" (agentic interpretation) प्रस्तावित करता है, जो एक ऐसा ढांचा है जो विश्लेषण लक्ष्यों को एक सीमित-ऊंचाई वाले लैटिस (lattice) के भीतर ट्रैक किए गए स्थानीय दावों में विभाजित करके, एलएलएम-संचालित प्रोग्राम रीजनिंग पर लैटिस-आधारित स्टैटिक एनालिसिस सिद्धांतों को लागू करता है, जिससे भंगुर वन-शॉट दृष्टिकोणों की तुलना में अधिक सुदृढ़, साक्ष्य-आधारित और पुनरावृत्तिपूर्ण प्रोग्राम विश्लेषण सक्षम होता है।

मूल लेखक: Jacqueline L. Mitchell, Chao Wang

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jacqueline L. Mitchell, Chao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बड़े, जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं: "क्या यह कंप्यूटर प्रोग्राम उपयोग के लिए सुरक्षित है?"

अतीत में, इस उत्तर तक पहुँचने के दो मुख्य तरीके थे:

  1. रोबोट जासूस (स्टैटिक एनालाइज़र - Static Analyzer): यह एक सख्त, नियम मानने वाली मशीन है। यह केवल स्क्रीन पर लिखे गए कोड को देखती है। यह गणितीय त्रुटियों को खोजने में माहिर है, लेकिन यह यूजर मैनुअल नहीं पढ़ सकती, हाल ही के सुरक्षा हैक्स के लिए समाचारों की जाँच नहीं कर सकती, या इस बात को नहीं समझ सकती कि किसी लाइब्रेरी को कैसे काम करना चाहिए जिसके "अलिखित नियम" होते हैं।
  2. मानव विशेषज्ञ (LLM): यह एक सुपर-स्मार्ट AI है जो मैनुअल पढ़ सकता है, सुरक्षा समाचारों की जाँच कर सकता है और संदर्भ (context) को समझ सकता है। लेकिन यदि आप इससे एक बड़े सवाल में पूछते हैं, "क्या यह पूरा प्रोग्राम सुरक्षित है?", तो यह अक्सर एक अस्थिर उत्तर देता है। यह एक महत्वपूर्ण विवरण को मिस कर सकता है क्योंकि यह एक बार में बहुत अधिक जानकारी को निगलने की कोशिश कर रहा है, या यह बिना एहसास किए खुद का खंडन कर सकता है।

यह पेपर काम करने का एक नया तरीका प्रस्तावित करता है: एजेंटिक इंटरप्रिटेशन (Agentic Interpretation)

इसे ऐसा न समझें कि आप AI से एक बार में पूरा पहेली सुलझाने के लिए कह रहे हैं, बल्कि इसे ऐसे समझें जैसे आप AI को एक सख्त प्रोजेक्ट मैनेजर के तहत काम करने वाली विशेषज्ञ जांचकर्ताओं की एक टीम के रूप में नियुक्त कर रहे हैं।

मूल विचार: रहस्य को छोटे-छोटे सुरागों में तोड़ना

AI से "क्या प्रोग्राम सुरक्षित है?" पूछने के बजाय, यह फ्रेमवर्क बड़े सवाल को सैकड़ों छोटे, विशिष्ट दावों (claims) में तोड़ देता है।

  • दावा 1: "क्या यह विशिष्ट लाइब्रेरी खराब डेटा को सुरक्षित रूप से संभालती है?"
  • दावा 2: "क्या सुरक्षा जाँच सभी सही फ़ील्ड्स को कवर करती है?"
  • दावा 3: "यदि जाँच विफल हो जाती है, तो क्या प्रोग्राम वास्तव में रुक जाता है?"

AI (एक "एजेंट") एक-एक करके प्रत्येक छोटे दावे की जांच करता है। लेकिन असली जादू यहाँ है: प्रोजेक्ट मैनेजर (फ्रेमवर्क) प्रत्येक दावे के लिए एक बहुत ही विशिष्ट स्कोरकार्ड रखता है।

स्कोरकार्ड: "लैटिस" (Lattice)

कल्पना कीजिए कि एक स्कोरकार्ड है जो केवल "हाँ" या "नहीं" नहीं कहता। यह प्रत्येक दावे के पक्ष और विपक्ष में साक्ष्य की शक्ति को ट्रैक करता है।

  • समर्थन (Support): क्या हमारे पास प्रमाण है कि यह सुरक्षित है? (कमजोर, मजबूत, या कोई नहीं?)
  • खंडन (Refutation): क्या हमारे पास प्रमाण है कि यह असुरक्षित है? (कमजोर, मजबूत, या कोई नहीं?)

इस स्कोरकार्ड को लैटिस (Lattice) कहा जाता है। यह एक ग्रिड की तरह है जहाँ आप नई जानकारी मिलने पर ऊपर या नीचे जा सकते हैं।

  • यदि AI को पता चलता है कि एक लाइब्रेरी में बग है, तो "खंडन" स्कोर बढ़कर मजबूत (Strong) हो जाता है।
  • यदि AI को एक मैनुअल मिलता है जो कहता है कि यह सुरक्षित है, तो "समर्थन" स्कोर बढ़कर मजबूत (Strong) हो जाता है।

कार्यप्रवाह (Workflow): "वर्कलिस्ट" गेम

सिस्टम प्रबंधन के लिए एक "वर्कलिस्ट" (जैसे टू-डू लिस्ट) का उपयोग करता है। यहाँ यह गेम कैसे खेला जाता है, पेपर के एक वास्तविक उदाहरण का उपयोग करते हुए:

  1. सेटअप: प्रोग्राम एक "ब्लैक बॉक्स" लाइब्रेरी का उपयोग करता है (हम इसका कोड नहीं देख सकते, केवल इसका नाम देख सकते हैं)। लक्ष्य यह देखना है कि क्या यह सुरक्षित है।
  2. राउंड 1 (व्यापक खोज): AI लाइब्रेरी के सामान्य दस्तावेज़ों को देखता है।
    • परिणाम: "हमें कोई स्पष्ट बग नहीं मिला, लेकिन मैनुअल अस्पष्ट है।"
    • स्कोरकार्ड: कमजोर समर्थन (शायद सुरक्षित), कमजोर खंडन (शायद नहीं)।
  3. "आहा!" क्षण (फीडबैक लूप): सिस्टम बड़े चित्र को देखता है। इसे एहसास होता है: "रुको, मुख्य प्रोग्राम इस लाइब्रेरी पर हैकर्स को रोकने के लिए निर्भर करता है, लेकिन लाइब्रेरी का दस्तावेज़ अस्पष्ट है। यह एक जोखिम है!"
    • प्रोजेक्ट मैनेजर AI को एक फीडबैक सिग्नल भेजता है: "वापस जाओ और विशेष रूप से इस लाइब्रेरी में 'ऑब्जेक्ट-शेप' हमलों के लिए खोजो।"
  4. राउंड 2 (लक्षित खोज): AI, अब यह जानते हुए कि उसे क्या खोजना है, गहराई से खुदाई करता है।
    • परिणाम: "मिल गया! इस संस्करण में एक विशिष्ट बग के बारे में एक ज्ञात सुरक्षा अलर्ट है।"
    • स्कोरकार्ड अपडेट: "खंडन" स्कोर बढ़कर मजबूत (Strong) हो जाता है।
  5. स्थिरीकरण (Stabilization): सिस्टम बड़े चित्र को अपडेट करता है। क्योंकि लाइब्रेरी अब असुरक्षित साबित हो गई है, पूरे प्रोग्राम के लिए अंतिम निष्कर्ष "शायद सुरक्षित" से बदलकर "असुरक्षित" हो जाता है। सिस्टम तब रुक जाता है जब कोई नया सुराग नहीं मिल पाता।

यह सिर्फ AI से पूछने से बेहतर क्यों है

  • "ब्लैक बॉक्स" उत्तर नहीं: आपको एक एकल, भ्रमित करने वाला पैराग्राफ नहीं मिलता। आपको एक स्पष्ट मानचित्र मिलता है जो दिखाता है कि प्रोग्राम का कौन सा हिस्सा जोखिम भरा है और कौन सा साक्ष्य इसे सिद्ध करता है।
  • स्व-सुधार (Self-Correction): यदि AI कोई गलती करता है या कोई सुराग छोड़ देता है, तो "फीडबैक लूप" उसे पकड़ लेता है। सिस्टम AI को अपने काम की पुन: जांच करने के लिए मजबूर करता है यदि बड़ा चित्र मेल नहीं खाता है।
  • यह रुक जाता है: क्योंकि स्कोरकार्ड की एक सीमा होती है (आप "मजबूत से अधिक" नहीं प्राप्त कर सकते), सिस्टम को पता चल जाता है कि कब रुकना है। यह सोचने के अनंत लूप में नहीं फँसेगा।

निष्कर्ष

यह पेपर पेश करता है कि कैसे एक फ्रेमवर्क बड़े भाषा मॉडलों (LLMs) को केवल जादुई उत्तर देने वाली मशीनों के रूप में नहीं, बल्कि साक्ष्य-एकत्र करने वाले एजेंटों के रूप में उपयोग करता है। उन्हें बड़े समस्याओं को छोटे दावों में तोड़ने, एक संरचित स्कोरकार्ड पर अपने साक्ष्य की शक्ति को ट्रैक करने, और बड़े चित्र के विरुद्ध अपने काम की लगातार जाँच करने के लिए मजबूर करके, हम उनकी बुद्धिमत्ता का उपयोग जटिल सॉफ़्टवेयर का सुरक्षित और विश्वसनीय रूप से विश्लेषण करने के लिए कर सकते हैं—भले ही उसमें रहस्यमय, तीसरे पक्ष के हिस्से शामिल हों जिन्हें हम देख नहीं सकते।

यह एक अराजक, एक-बार के अनुमान को एक अनुशासित, ऑडिट योग्य जांच में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →