← नवीनतम पेपर
🤖 AI

BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data

BatchDAG एक स्केलेबल सिस्टम है जो समानांतर, एंटिटी-अवेयर बैच ऑपरेशन्स को ऑर्केस्ट्रेट करने के लिए टाइप किए गए डायरेक्टेड एसाइक्लिक ग्राफ्स जनरेट करने हेतु LLMs का लाभ उठाता है, जिससे बड़े एंटरप्राइज डेटासेट्स पर कुशल और सटीक एड-हॉक विश्लेषण सक्षम होता है और अनुक्रमिक एजेंट दृष्टिकोणों की तुलना में मतिभ्रम (hallucinations) और लागत को काफी कम करता है।

मूल लेखक: Anupreet Walia

प्रकाशित 2026-07-22
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anupreet Walia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक सुपर-स्मार्ट रोबोट दोस्त है जो एक अकेली किताब पढ़ सकता है और आपको बता सकता है कि उसमें क्या हुआ था। यह रोबोट एक कहानी का सारांश बताने में माहिर है, लेकिन क्या होगा अगर आप उससे 50,000 किताबें पढ़ने और यह सवाल पूछने के लिए कहें, "क्या इन किताबों में हर एक पात्र ने कभी पैसे के बारे में बात की?" यदि आप रोबोट को एक साथ सारी किताबें थमा देते हैं, तो बहुत अधिक जानकारी से उसका दिमाग फट जाएगा। यदि आप उसे एक-एक करके पढ़ने के लिए कहते हैं, तो उसे खत्म करने में वर्षों लग जाएंगे। यह समस्या आधुनिक "लार्ज लैंग्वेज मॉडल्स" (LLMs) के सामने है—जो कई चैटबॉट्स के पीछे के AI दिमाग हैं। वे व्यक्तिगत दस्तावेजों को समझने में शानदार हैं, लेकिन जब उन्हें एक साथ विशाल, अव्यवस्थित डेटा संग्रह (जैसे हजारों व्यावसायिक बैठकें) का विश्लेषण करने के लिए कहा जाता है, तो वे संघर्ष करते हैं। वे भ्रमित हो जाते हैं, इस बात का ध्यान खो देते हैं कि कौन सा तथ्य किस बैठक से संबंधित है, और काम पूरा करने में बहुत समय लेते हैं।

यहाँ प्रवेश होता है BatchDAG का, एक नया सिस्टम जिसे एक विशाल ऑर्केस्ट्रा के मास्टर कंडक्टर की तरह काम करने के लिए डिज़ाइन किया गया है। AI रोबोट को सब कुछ खुद करने देने के बजाय, BatchDAG का उपयोग केवल एक विस्तृत "रेसिपी" या "नक्शा" लिखने के लिए किया जाता है कि क्या किया जाना है। फिर, एक सुपर-फास्ट, बिना सोचे-समझे काम करने वाला कंप्यूटर इंजन उस नक्शे का पालन करता है, जो उबाऊ, दोहराव वाले गणित और खोज को तुरंत करता है, और केवल तभी "स्मार्ट" AI को बुलाता है जब वास्तव में आवश्यक हो। परिणाम? यह सिस्टम एक मिनट से भी कम समय में हजारों बैठकों के बारे में जटिल सवालों के जवाब दे सकता है, जिसकी लागत डॉलरों के बजाय कुछ पैसे होती है, और यह मनगढ़ंत तथ्य नहीं बनाता है।

समस्या: "एक-एक करके" का जाल

50,000 मीटिंग ट्रांसक्रिप्ट्स की लाइब्रेरी में एक विशिष्ट बातचीत खोजने की कोशिश करने के बारे में सोचें। यदि आप एक मानक AI एजेंट (जैसे एक ReAct बॉट) का उपयोग करते हैं, तो वह एक ऐसे व्यक्ति की तरह कार्य करता है जो लाइब्रेरी में घूम रहा है, एक किताब उठा रहा है, उसे पढ़ रहा है, उसे रख रहा है, अगली किताब उठा रहा है, और इसी तरह।

  • दिमाग पर बोझ (The Brain Overload): यदि आप AI को एक साथ सभी किताबें खिलाने की कोशिश करते हैं, तो वह "कॉन्टेक्स्ट लिमिट" से टकरा जाता है—उसकी मेमोरी सब कुछ रखने के लिए बहुत भरी हुई होती है।
  • एट्रिब्यूशन का नुकसान (The Attribution Loss): यदि AI सभी किताबों में "पैसे" की तलाश करता है, तो वह आपको बता सकता है, "हाँ, पैसे का उल्लेख किया गया था!" लेकिन वह आपको यह नहीं बता पाएगा कि किस मीटिंग में ऐसा कहा गया था। वह तथ्य और स्रोत के बीच के संबंध को खो देता है।
  • समय की बर्बादी (The Time Sink): इसे एक-एक करके करना बेहद धीमा है। यदि आपको 3,000 सौदे (deals) चेक करने हैं, और प्रत्येक में कुछ सेकंड लगते हैं, तो आप घंटों इंतजार करेंगे।

समाधान: "मास्टर प्लानर" और "असेंबली लाइन"

BatchDAG काम को दो अलग-अलग भूमिकाओं में विभाजित करके खेल बदल देता है: प्लानर (Planner) और वर्कर (Worker)

1. प्लानर (द AI आर्किटेक्ट)
जब आप "क्या हमारी सेल्स टीम ने हर मीटिंग में अच्छे सवाल पूछे?" जैसा सवाल पूछते हैं, तो AI अभी पढ़ना शुरू नहीं करता है। इसके बजाय, वह एक आर्किटेक्ट की तरह एक ब्लूप्रिंट (खाका) तैयार करता है। वह एक डायरेक्टेड एसाइक्लिक ग्राफ (DAG) बनाता है।

  • सरल अनुवाद: कल्पना कीजिए कि लेगो ब्लॉक्स से बना एक फ्लोचार्ट। प्रत्येक ब्लॉक एक विशिष्ट कार्य है: "डेटाबेस में खोजें," "परिणामों को फ़िल्टर करें," "मीटिंग के आधार पर समूह बनाएं," या "AI को विश्लेषण करने के लिए कहें।"
  • AI इस मानचित्र को एक सख्त, संरचित प्रारूप (JSON) में लिखता है, न कि अव्यवस्थित वाक्यों में। यह सुनिश्चित करता है कि कंप्यूटर भ्रमित हुए बिना जानता है कि आगे क्या करना है।

2. वर्कर (द डिटरमिनिस्टिक इंजन)
एक बार जब नक्शा बन जाता है, तो एक सुपर-फास्ट कंप्यूटर इंजन कमान संभाल लेता है। इसे "स्मार्ट" होने की आवश्यकता नहीं है; इसे बस तेज़ और आज्ञाकारी होने की आवश्यकता है।

  • समानांतर लहरें (Parallel Waves): कार्यों को एक-एक करके करने के बजाय, इंजन नक्शे को देखता है और देखता है कि कौन से ब्लॉक एक ही समय में किए जा सकते हैं। यह उन्हें "लहरों" में चलाता है। एक स्टेडियम वेव (stadium wave) की कल्पना करें: पहले सेक्शन A के सभी लोग एक साथ खड़े होते हैं, फिर सेक्शन B, फिर सेक्शन C। यह प्रक्रिया को अविश्वसनीय रूप से तेज़ बनाता है।
  • जीरो-LLM स्टेप्स: नक्शे के अधिकांश ब्लॉकों (जैसे डेटाबेस में खोजना या नंबरों को सॉर्ट करना) को AI की बिल्कुल आवश्यकता नहीं होती है। ये नियमित कोड द्वारा किए जाते हैं, जो मुफ्त और तत्काल हैं। AI को केवल तभी बुलाया जाता है जब नक्शा कहता है, "अब, इस विशिष्ट समूह का विश्लेषण करने के लिए अपने दिमाग का उपयोग करें।"

सीक्रेट सॉस: "एंटिटी-अवेयर बैचिंग" (Entity-Aware Batching)

यह पेपर की सबसे बड़ी चाल है। कल्पना कीजिए कि आपके पास 121 बैठकें हैं, और प्रत्येक बैठक में 48 पृष्ठों का टेक्स्ट है।

  • पुराना तरीका (Row-Level): यदि आप AI को एक बार में 5 पृष्ठ देते हैं, तो आप मीटिंग A के पहले 5 पृष्ठ भेज सकते हैं, फिर मीटिंग A के अगले 5 पृष्ठ, और इसी तरह। आप AI को एक ही मीटिंग को 10 बार भेज रहे हैं, लेकिन हर बार वह केवल एक छोटा, भ्रमित करने वाला अंश ही देख पाता है। यह संसाधनों की बर्बादी है और गलत अनुमानों की ओर ले जाता है।
  • BatchDAG का तरीका (Entity-Aware): सिस्टम पहले मीटिंग ID के आधार पर पृष्ठों को समूहित करता है। यह कहता है, "यहाँ 5 पूर्ण बैठकें हैं, जिसमें उनके सभी पृष्ठ शामिल हैं।" यह AI को 100 छोटे टुकड़ों के बजाय 5 पूरी कहानियाँ भेजता है।
  • परिणाम: इस सरल समूहीकरण ने AI को कॉल करने की संख्या को 47 गुना कम कर दिया। यह एक जासूस को शहर में बिखरे हुए 235 अलग-अलग कमरों के बजाय 5 पूरे घरों की जांच करने के लिए भेजने जैसा है।

उन्होंने क्या पाया

शोधकर्ताओं ने इस सिस्टम का परीक्षण Brevian.ai के वास्तविक दुनिया के डेटा पर किया, जिसमें 50,000 से अधिक बैठकें और 3,000 व्यावसायिक सौदे शामिल हैं।

  • गति (Speed): उन्होंने 60 सेकंड से भी कम समय में 3,000 सौदों का विश्लेषण किया। एक मानक AI एजेंट को यही काम करने में लगभग 100 मिनट लगते।
  • लागत (Cost): क्योंकि यह सिस्टम हर एक चरण के लिए महंगे AI ब्रेन को कॉल करने से बचता है, इसलिए लागत नाटकीय रूप रूप से गिर गई। एक साधारण डेटाबेस क्वेरी की लागत केवल 0.02थी।यहाँतककिहजारोंबैठकोंकेजटिलविश्लेषणकीलागतभीप्रतिक्वेरीकेवललगभग0.02** थी। यहाँ तक कि हजारों बैठकों के जटिल विश्लेषण की लागत भी प्रति क्वेरी केवल लगभग **0.24 थी।
  • सटीकता (Accuracy): यह सिस्टम एक मानव विशेषज्ञ द्वारा डिज़ाइन किए गए कस्टम वर्कफ़्लो के समान ही प्रभावी था (मानव-डिज़ाइन किए गए पाइपलाइन के 3.25 के मुकाबले 3.74 आउट ऑफ 5 स्कोर किया) और एक मानक AI एजेंट की तुलना में काफी बेहतर था।
  • सत्यनिष्ठा (Truthfulness): सबसे महत्वपूर्ण बात यह है कि BatchDAG अपने उत्तरों को साबित करने में बहुत बेहतर था। यह 77% समय सटीक ट्रांसक्रिप्ट साक्ष्य दिखा सका, जबकि अन्य तरीकों के लिए यह केवल 46–60% था। यह उन व्यवसायों के लिए अत्यंत महत्वपूर्ण है जिन्हें यह जानने की आवश्यकता है कि AI ने कोई दावा क्यों किया।

यह क्यों मायने रखता है

पेपर सुझाव देता है कि बड़े डेटा समस्याओं के लिए, हमें केवल AI को "स्मार्ट" बनाने की आवश्यकता नहीं है। इसके बजाय, हमें AI को भारी काम करने से रोकने की आवश्यकता है। सबसे अच्छा दृष्टिकोण यह है कि AI को काम की योजना (plan) बनाने दें, और फिर एक तेज़, उबाऊ, विश्वसनीय मशीन को वह काम करने (do) दें।

संरचित डेटा (जैसे स्प्रेडशीट में साफ पंक्तियाँ) का उपयोग करके, सिस्टम ने "हैलुसिनेशन" (मनगढ़ंत तथ्य) को भी 27% कम कर दिया। लेखकों ने पाया कि जब AI चरणों के बीच साधारण अंग्रेजी में सारांश लिखता है, तो वह विवरणों को खो देता है। लेकिन जब वह संरचित डेटा पास करता है, तो तथ्य अपनी जगह पर सुरक्षित रहते हैं।

संक्षेप में, BatchDAG AI को जीनियस बनाने के बारे में नहीं है; यह AI को एक बेहतरीन मैनेजर बनाने के बारे के बारे में है जो जानता है कि विशेषज्ञों को कब बुलाना है और कब असेंबली लाइन को काम करने देना है। यह एक धीमी, महंगी और त्रुटिपूर्ण प्रक्रिया को एक तेज़, सस्ती और विश्वसनीय प्रक्रिया में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →