← नवीनतम पेपर
🤖 AI

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

यह शोध पत्र AgentFootprint को प्रस्तुत करता है जो एक ऐसा बेंचमार्क है जो यह प्रकट करता है कि LLM एजेंटों के निरंतर स्टोरेज फुटप्रिंट (persistent storage footprints) कार्य की सटीकता से स्वतंत्र रूप से विभिन्न फ्रेमवर्क और कॉन्फ़िगरेशन में नाटकीय रूप से भिन्न होते हैं, जबकि यह भी प्रदर्शित करता है कि कंटेंट-एड्रेस्ड स्टोरेज डेटा की पुनर्रचना क्षमता (data reconstructability) से समझौता किए बिना इस ओवरहेड को महत्वपूर्ण रूप से कम कर सकता है।

मूल लेखक: Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li

प्रकाशित 2026-07-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शानदार रोबोट जासूस को रहस्य सुलझाते हुए देख रहे हैं। वह सुराग पढ़ता है, सवाल पूछता है और अपना अंतिम उत्तर लिखता है। जब जासूस सही उत्तर दे देता है, तो हर कोई खुशी से झूम उठता है, और वे यह भी देखते हैं कि उसने कितनी तेज़ी से सोचा और उसे चलाने में कितना खर्च आया। लेकिन कोई भी उस गंदगी पर ध्यान नहीं देता जो जासूस फर्श पर छोड़ जाता है।

यह शोध पत्र, जिसका नाम The Hidden Footprint (द हिडन फुटप्रिंट) है, एक सफाईकर्मी की रिपोर्ट की तरह है। यह पूछता है: "जब जासूस काम खत्म करता है, तो वह कमरे में कितनी गंदगी छोड़ जाता है?"

बड़ी हैरानी: गंदगी बहुत ज़्यादा है

मुख्य निष्कर्ष चौंकाने वाला है: दो जासूस एक ही रहस्य को बिल्कुल सटीक रूप से सुलझा सकते हैं, लेकिन एक जासूस दूसरे की तुलना में 15.7 गुना बड़ा कचरे का ढेर पीछे छोड़ देता है।

इसे ऐसे समझें: आप और आपका दोस्त दोनों एक बेहतरीन चॉकलेट केक बनाते हैं। आप केक (परिणाम) सौंपते हैं। लेकिन जहाँ आपने काउंटर साफ कर दिया, वहीं आपके दोस्त ने 15 कटोरे, 30 कप आटा और चिपचिपे रैपरों का एक पहाड़ पीछे छोड़ दिया। केक एक जैसा दिखता है, लेकिन आपके दोस्त की रसोई एक तबाही का मंज़र बन गई है।

वास्तविक दुनिया में, यह "कचरा" केवल कागज नहीं है; यह हार्ड ड्राइव पर स्टोर किए गए डिजिटल बाइट्स हैं। शोधकर्ताओं ने पाया कि एक एकल कार्य के लिए, कुछ फ्रेमवर्क्स 131 MB डेटा पीछे छोड़ देते हैं, जबकि वास्तविक उत्तर (वह "डिलीवर किया गया केक") केवल 2.6 MB था। इसका मतलब है कि फ्रेमवर्क का "अवशेष" उस वास्तविक काम से 24,033 गुना बड़ा था जिसे उसे करना था!

"अदृश्य" डबल-काउंटिंग का तरीका

यहाँ पेचीदा बात है: यदि आप केवल कंप्यूटर पर फाइलों को गिनते हैं, तो आपको लग सकता है कि गंदगी इतनी बुरी नहीं है। यह शोध पत्र तर्क देता है कि मानक गिनती एक जाल है।

कल्पना कीजिए कि आप कागज पर "Hello" शब्द लिखते हैं। फिर, आप उस कागज की फोटोकॉपी करते हैं, लेकिन फोटोकॉपी करने वाली मशीन हर प्रति में एक छोटा सा "अदृश्य स्याही" का स्टैम्प जोड़ देती है। यदि आप कागज गिनते हैं, तो आप एक शीट देखते हैं। लेकिन यदि आप स्याही को देखते हैं, तो आप देखते हैं कि "Hello" शब्द बारह बार लिखा गया है।

शोधकर्ताओं ने पाया कि कंप्यूटर डेटा को कैसे सेव करते हैं (जैसे "SQLite" पेज और "JSON" एस्केपिंग का उपयोग करके), इसके कारण वही जानकारी बार-बार सिस्टम के अंदर छिपी हुई स्टोर हो जाती है।

  • नाइव काउंटिंग (साधारण गिनती) ने कहा: "ओह, यहाँ बहुत कम दोहराव है।"
  • शोध पत्र की स्मार्ट काउंटिंग ने कहा: "असल में, वही सामग्री 12.1 बार स्टोर की गई है!"

उन्होंने साबित किया कि यदि आप "अदृश्य स्याही" के अंदर नहीं देखते हैं, तो आप गंदगी के वास्तविक आकार को एक बहुत बड़े अंतर से चूक जाते हैं।

"ग्रोथ" (वृद्धि) की समस्या

शोध पत्र ने यह भी परीक्षण किया कि क्या होता है जब जासूस को एक ही सुराग को 200 बार जांचना पड़ता है।

  • कुछ फ्रेमवर्क्स (जैसे LangGraph और AutoGen) एक ऐसी गिलहरी की तरह व्यवहार करते हैं जो कुछ भी नहीं भूलती। हर बार जब वह सुराग की जांच करता है, तो वह पूरी हिस्ट्री को फिर से लिख देता है। इससे स्टोरेज सुपरलीनियरली (तेजी से और तेजी से) बढ़ता है। 200 राउंड के बाद, उन्होंने एक छोटी सी फाइल के लिए 323 MB डेटा पीछे छोड़ दिया।
  • अन्य फ्रेमवर्क्स (जैसे OpenAI Agents) एक स्मार्ट नोट-टेकर की तरह काम करते हैं। वे केवल नई चीज़ें लिखते हैं। उनका स्टोरेज धीरे-धीरे बढ़ा, लगभग एक सीधी रेखा में।

शोध पत्र ने इस विकास दर (जिसे α\alpha कहा जाता है) को मापा और पाया कि यह 0.73 (छोटा होता जा रहा है!) से लेकर 1.95 (आकार में विस्फोट हो रहा है!) तक था।

क्या बड़ा कचरा मतलब स्मार्ट जासूस?

आप सोच सकते हैं, "शायद कचरा फैलाने वाला जासूस अधिक सावधान है, इसलिए वह स्मार्ट है?"
शोध पत्र कहता है: नहीं।

उन्होंने एक प्रसिद्ध कोडिंग चुनौती (SWE-bench) से 108 वास्तविक सबमिशन का अध्ययन किया। उन्होंने पाया कि इन सिस्टमों द्वारा निर्यात किए गए डेटा में 1,617 गुना का अंतर था (छोटी फाइलों से लेकर विशाल फाइलों तक)। लेकिन असली बात यह है: इस बात का कोई संबंध नहीं था कि कचरे की मात्रा और सिस्टम ने समस्या को कितनी अच्छी तरह सुलझाया।

वास्तव में, सहसंबंध (correlation) इतना कमजोर था कि वह लगभग शून्य था। एक सिस्टम ढेर सारा डेटा छोड़ सकता है और फिर भी विफल हो सकता है, या बहुत कम निशान छोड़ सकता है और सफल हो सकता है। शोध पत्र स्पष्ट रूप से इस विचार को खारिज करता है कि "अधिक स्टोरेज = बेहतर प्रदर्शन।"

"मैजिक इरेज़र" (लेकिन अभी इसे न खरीदें)

शोधकर्ताओं ने केवल समस्या की ओर इशारा नहीं किया; उन्होंने इसे ठीक करने का एक तरीका भी दिखाया, लेकिन वे सावधानी से कहते हैं कि यह एक प्रूफ ऑफ कॉन्सेप्ट है, न कि कोई तैयार उत्पाद।

उन्होंने एक "कंटेंट-एड्रेस्ड स्टोर" बनाया। कल्पना कीजिए कि एक लाइब्रेरी है जहाँ, हर किताब को शेल्फ पर रखने के बजाय, आप किताब के अद्वितीय फिंगरप्रिंट की फोटो लेते हैं। यदि दो किताबें समान हैं, तो आप केवल एक फोटो और एक नोट रखते हैं कि "यह वाला उसी के समान है।"

जब उन्होंने इस "मैजिक इरेज़र" को अव्यवस्थित फ्रेमवर्क्स पर लागू किया:

  • इसने स्टोरेज को 4.8 से 32.7 गुना तक कम कर दिया।
  • महत्वपूर्ण रूप से, उन्होंने साबित किया कि उस पूरे डेटा को हटाने के बाद भी, आप पूरी बातचीत के इतिहास को पूरी तरह से पुनर्गठित कर सकते हैं। जासूस के विचारों को फिर से चलाने (replay) की क्षमता के लिए "स्कोर" बिल्कुल वही रहा।

यह शोध पत्र किन बातों को खारिज करता है

  • यह इस विचार को खारिज करता है कि हमें स्टोरेज को अनदेखा करना चाहिए क्योंकि "यह सस्ता है।" शोध पत्र का तर्क है कि स्टोरेज एक निरंतर ऋण (persistent debt) है जो समय के साथ जमा होता रहता है, जबकि AI चलाने की लागत कार्य समाप्त होने पर समाप्त हो जाती है।
  • यह इस विचार को खारिज करता है कि मानक फाइल काउंटर सटीक हैं। उन्होंने दिखाया कि साधारण गिनती सिस्टम के कोड के भीतर छिपे दोहराव को मिस कर देती है।
  • यह इस विचार को खारिज करता है कि बड़े डेटा ट्रेल का मतलब बेहतर परिणाम हैं। डेटा दिखाता है कि आकार और सफलता के बीच कोई संबंध नहीं है।

वे कितने आश्वस्त हैं?

लेखक अपने द्वारा किए गए मापन के बारे में बहुत आश्वस्त हैं। उन्होंने सुनिश्चित करने के लिए कि किसी और चीज़ का हस्तक्षेप न हो, 1,061 प्रयोग अलग-थलग, साफ कंप्यूटर रूम (सैंडबॉक्स) में चलाए। उन्होंने समान कार्यों और मॉडलों का उपयोग करके 8 अलग-अलग फ्रेमवर्क्स (जैसे LangGraph, CrewAI, और AutoGen) का परीक्षण किया।

उन्होंने केवल अनुमान नहीं लगाया; उन्होंने मापा। उन्होंने पाया कि समान परिस्थितियों के तहत, सबसे अच्छे और सबसे खराब प्रदर्शन करने वालों के बीच छोड़े गए डेटा में 15.7 गुना का अंतर था। उन्होंने यह भी दिखाया कि यह अंतर इसलिए नहीं है क्योंकि एक फ्रेमवर्क दूसरे की तुलना में "स्मार्ट" है, बल्कि इसलिए है क्योंकि उन्हें डेटा बचाने के लिए कैसे बनाया गया है।

मुख्य निष्कर्ष (The Takeaway)

शोध पत्र निष्कर्ष निकालता है कि हमें AI एजेंटों के "फुटप्रिंट" को मापने की शुरुआत करनी चाहिए, ठीक वैसे ही जैसे हम उनकी गति या लागत को मापते हैं। अभी, हम कुछ सिस्टमों को डिजिटल कचरे के पहाड़ छोड़ने दे रहे हैं जबकि अन्य लगभग कुछ भी नहीं छोड़ते, और यह पता चलता है कि कचरा फैलाने वाले सिस्टम बेहतर काम नहीं कर रहे हैं।

लेखक सुझाव देते हैं कि यदि हम इन एजेंटों को बड़े पैमाने पर चलाना चाहते हैं (जैसे प्रतिदिन 10,000 रोबोटों का बेड़ा), तो एक "साफ" फ्रेमवर्क और एक "गंदे" फ्रेमवर्क के बीच का अंतर यह तय कर सकता है कि आपको हर दिन 3 GB स्टोरेज की आवश्यकता होगी या 51 GB की। यह एक बहुत बड़ा अंतर है, खासकर उस समस्या के लिए, जैसा कि उन्होंने दिखाया है, जो रोबोट को स्मार्ट नहीं बनाती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →