← नवीनतम पेपर
🤖 AI

VESTA: Visual Exploration with Statistical Tool Agents

यह शोध पत्र VESTA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विजन-लैंग्वेज मॉडल्स को डेटा ट्रांसफॉर्मेशन और डायग्नोस्टिक विज़ुअलाइज़ेशन के गतिशील रूप से बढ़ते टूलकिट से सुसज्जित करके सांख्यिकीय मॉडलिंग को बढ़ाता है, जो नए DAWN बेंचमार्क में पाए जाने वाले जटिल कार्यों पर मौजूदा एजेंट-आधारित प्रणालियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: William Rudman, Abhishek Divekar, Kanishk Jain, Sebastian Joseph, Stella S. R. Offner, Matthew Lease, Kyle Mahowald, Greg Durrett, Junyi Jessy Li

प्रकाशित 2026-06-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: William Rudman, Abhishek Divekar, Kanishk Jain, Sebastian Joseph, Stella S. R. Offner, Matthew Lease, Kyle Mahowald, Greg Durrett, Junyi Jessy Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपके सुराग उंगलियों के निशान नहीं, बल्कि संख्याएं और ग्राफ हैं। आपका काम उस "नियम" या "फॉर्मूला" का पता लगाना है जिसने उन संख्याओं को बनाया है। विज्ञान की दुनिया में, इसे डेटा पर मॉडल फिट करना (fitting a model to data) कहा जाता है।

लंबे समय से, कंप्यूटर यह करने में बेहतर होते जा रहे हैं, लेकिन वे अक्सर अटक जाते हैं। वे एक नियम का अनुमान लगा सकते हैं, ग्राफ को देख सकते हैं, कहते हैं "यह ठीक लग रहा है," और आगे बढ़ जाते हैं, भले ही वह नियम वास्तव में गलत हो। उनमें वास्तव में डेटा को देखने और यह पूछने की क्षमता की कमी होती है कि, "रुको, यह हिस्सा अजीब क्यों दिख रहा है?"

यह पेपर VESTA को पेश करता है, जो एक नए प्रकार का AI जासूस है जो केवल अनुमान नहीं लगाता; बल्कि यह अपने स्वयं के आवर्धक लेंस (magnifying glasses) बनाता है।

समस्या: "एक ही आकार के लिए सभी" वाला जासूस

पिछले AI सिस्टमों ने इसे एक स्मार्ट कंप्यूटर (एक लार्ज लैंग्वेज मॉडल) को कोड लिखने, परिणाम देखने और फिर टेक्स्ट विवरण के आधार पर नया कोड लिखने के लिए कहकर हल करने की कोशिश की।

इसे एक ऐसे छात्र की तरह समझें जो गणित की परीक्षा दे रहा है जिसे केवल शिक्षक की लिखित टिप्पणियों को पढ़ने की अनुमति है। यदि शिक्षक कहता है, "आपका ग्राफ दाईं ओर थोड़ा अजीब लग रहा है," तो छात्र को यह अनुमान लगाने के लिए संघर्ष करना पड़ता है कि इसे कैसे ठीक किया जाए, क्योंकि वह ज़ूम इन करने, विशिष्ट वक्र (curve) को हाइलाइट करने, या एक विशेष परीक्षण चलाने में सक्षम नहीं है जिससे यह देखा जा सके कि क्या वह वक्र एक सीधी रेखा है या एक लहर।

समाधान: VESTA का "टूलबेल्ट"

VESTA (विजुअल एक्सप्लोरेशन विद स्टैटिस्टिकल टूल एजेंट्स) खेल बदल देता है। टेक्स्ट पढ़ने के बजाय, VESTA को एक डायनेमिक टूलबेल्ट दिया जाता है।

यह कैसे काम करता है, इस रचनात्मक उपमा का उपयोग करते हुए:

कल्पना कीजिए कि VESTA एक शेफ है जो तैयार डिश की फोटो से गुप्त रेसिपी को फिर से बनाने की कोशिश कर रहा है।

  1. पहला अनुमान: VESTA फोटो देखता है और अनुमान लगाता है, "शायद यह एक चॉकलेट केक है।" वह रेसिपी लिखता है और एक टेस्ट केक बेक करता है।
  2. स्वाद परीक्षण (आलोचना): AI केक चखता है। उसे एहसास होता है, "हम्म, यह बहुत सूखा है, और बनावट (texture) गलत है।"
  3. पुराना तरीका: एक पुराना AI बस कहेगा, "ठीक है, मैं अगली बार इसमें अधिक दूध डालने की कोशिश करूँगा।"
  4. VESTA का तरीका: VESTA को एहसास होता है कि उसे केक को जांचने के लिए एक बेहतर तरीके की आवश्यकता है। इसलिए, वह एक नया टूल बनाता है
    • वह बनावट को वैज्ञानिक रूप से जांचने के लिए एक "मॉइस्चर मीटर" (नमी मापने वाला यंत्र) टूल बना सकता है।
    • वह यह देखने के लिए एक "क्रंब एनालाइजर" टूल बना सकता है कि केक बहुत घना तो नहीं है।
    • वह यह जांचने के लिए एक "फ्लेवर प्रोफाइल" टूल बना सकता है कि यह वास्तव में चॉकलेट है या सिर्फ कोको पाउडर।

महत्वपूर्ण बात यह है कि VESTA इन टूल्स को सहेज कर रखता है। यदि उसने पहले केक के लिए एक "मॉइस्चर मीटर" बनाया है, तो वह उसे अपने बेल्ट में रखता है। यदि वह बाद में किसी अन्य रेसिपी को आज़माता है, तो वह उसी मीटर का पुन: उपयोग कर सकता है। वह केवल टूल को फेंक नहीं देता; वह कस्टम-मेड डायग्नोस्टिक टूल्स का एक बढ़ता हुआ पुस्तकालय संचित करता है।

"DAWN" बेंचमार्क

यह परीक्षण करने के लिए कि यह नया जासूस कितना अच्छा था, शोधकर्ताओं ने एक परीक्षण बनाया जिसे DAWN (डेटासेट फॉर ऑटोमेटेड वर्कफ़्लो एंड न्यूमेरिकल मॉडलिंग) कहा जाता है।

DAWN को कठिनाई के बढ़ते स्तर वाले पहेलियों की एक श्रृंखला के रूप में समझें:

  • आसान पहेलियाँ: सरल आकार, जैसे एक सीधी रेखा या एक साधारण लहर।
  • कठिन पहेलियाँ: जटिल आकार, जैसे एक लहर जो एक साथ तेज़ और ऊंची होती जाती है, या दो अलग-अलग पैटर्न का मिश्रण।
  • एस्ट्रो पहेलियाँ: वास्तविक दुनिया की खगोल विज्ञान की चुनौतियाँ। उदाहरण के लिए, "इनिशियल मास फंक्शन" (कितने बड़े तारे बनाम कितने छोटे तारे जन्म लेते हैं) का पता लगाना या टकराते हुए ब्लैक होल से आने वाले "चर्प" संकेतों का विश्लेषण करना। ये डेटा पहेलियों के "फाइनल बॉस" स्तर हैं।

उन्होंने क्या पाया

शोधकर्ताओं ने इन पहेलियों पर VESTA को अन्य AI सिस्टमों (जैसे BoxLM और PyVision) के विरुद्ध चलाया।

  1. "बिना टूल्स के" बनाम "डायनेमिक टूल्स" का परीक्षण:

    • जब VESTA के पास कोई टूल नहीं था, तो वह आसान पहेलियों में ठीक था लेकिन कठिन पहेलियों में संघर्ष कर रहा था।
    • जब VESTA को अपने स्वयं के टूल्स बनाने की अनुमति दी गई, तो वह काफी बेहतर हो गया। वह एक अजीब वक्र को देख सकता था, उस वक्र को मापने के लिए एक विशिष्ट टूल बना सकता था, और फिर उस माप का उपयोग अपनी रेसिपी को ठीक करने के लिए कर सकता था।
    • परिणाम: डायनेमिक टूल्स के साथ VESTA ने अन्य AI सिस्टमों को पछाड़ दिया, विशेष रूप से कठिन और खगोल विज्ञान की पहेलियों में।
  2. "विशेषज्ञ" के साथ तुलना:

    • शोधकर्ताओं ने VESTA को मानव सांख्यिकीविदों द्वारा लिखे गए टूल्स का एक सेट ( "एक्सपर्ट टूलकिट") भी दिया।
    • आश्चर्य: VESTA ने केवल मानव टूल्स की नकल नहीं की; उसने अक्सर ऐसे टूल्स बनाए जो अधिक स्मार्ट थे। वह एक साथ तीन चीजों की जांच करने के लिए तीन अलग-अलग मानव टूल्स को मिलाकर एक "सुपर-टूल" बना सकता था।
    • हालांकि, मानव-लिखित टूल्स अभी भी समग्र रूप से थोड़े बेहतर थे। यह सुझाव देता है कि जबकि VESTA टूल्स बनाने में महान है, मानव विशेषज्ञ अभी भी कुछ ऐसी तरकीबें जानते हैं जिन्हें AI ने अभी तक नहीं समझा है (जैसे कि एक बहुत ही जटिल, मल्टी-पैनल ग्राफ की व्याख्या कैसे की जाए)।

"विजुअल" लाभ

पेपर इस बात पर जोर देता है कि VESTA की सुपरपावर उसकी दृष्टि (vision) है।

  • पुराने AI ग्राफ के टेक्स्ट विवरण पढ़ते थे।
  • VESTA ग्राफ को देखता है।
  • जब VESTA एक टूल बनाता है, तो वह अक्सर एक मल्टी-पैनल इमेज (जैसे 6 अलग-अलग चार्ट वाला डैशबोर्ड) बनाता है। फिर वह यह तय करने के लिए कि आगे क्या करना है, उस डैशबोर्ड को देखता है।

शोधकर्ताओं ने पाया कि VESTA ऐसे टूल्स बनाता है जो अन्य AI सिस्टमों की तुलना में बहुत अधिक परिष्कृत होते हैं। उदाहरण के लिए, खगोल विज्ञान की पहेलियों में, VESTA ने महसूस किया कि उसे डेटा के "टेल्स" (चरम मानों) को देखने की आवश्यकता है और उसने उन टेल्स पर ज़ूम करने के लिए विशिष्ट टूल्स बनाए, जिसे अन्य AI ने मिस कर दिया था।

सीमाएँ

पेपर ईमानदारी से बताता है कि VESTA कहाँ संघर्ष करता है:

  • "ब्लाइंड स्पॉट" (अंधा बिंदु): कभी-कभी VESTA एक बहुत ही जटिल, मल्टी-पैनल ग्राफ बनाता है, लेकिन उसे देखने वाला AI (क्रिटिक) जटिलता से भ्रमित हो जाता है। यह एक अत्यंत जटिल डैशबोर्ड बनाने जैसा है लेकिन फिर ड्राइवर ऐसा है जो सभी गेज को एक साथ नहीं पढ़ सकता।
  • गति: क्योंकि VESTA प्रयास करता रहता है, टूल्स बनाता है, और पुन: परीक्षण करता है, इसलिए उसे एक समस्या को हल करने में उस सिस्टम की तुलना में अधिक समय लगता है जो केवल एक बार अनुमान लगाता है।
  • सिंथेटिक डेटा: परीक्षण कंप्यूटर-जनरेटेड डेटा पर किए गए थे जहाँ "सही उत्तर" ज्ञात था। पेपर नोट करता है कि हमें अभी यह नहीं पता कि यह वास्तविक दुनिया के, अव्यवस्थित (messy) डेटा पर कितनी अच्छी तरह काम करता है जहाँ हमें उत्तर ज्ञात नहीं होता।

सारांश

VESTA एक ऐसा AI है जो जटिल डेटा पहेलियों को हल करना सीखता है क्योंकि वह अपने स्वयं के आवर्धक लेंस बनाता है। केवल अनुमान लगाने और जांचने के बजाय, वह डेटा को मापने और विज़ुअलाइज़ करने के नए तरीके आविष्कार करता है, उन आविष्कारों को सहेज कर रखता है, और सत्य के करीब पहुँचने के लिए उनका उपयोग करता है। इसने साबित किया कि AI को अपने स्वयं के डायग्नोस्टिक टूल्स बनाने की क्षमता देने से जटिल पैटर्न को समझने में बहुत मदद मिलती है, विशेष रूप से खगोल विज्ञान जैसे क्षेत्रों में जहाँ डेटा पेचीदा होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →