← नवीनतम पेपर
💻 computer science

LiveFigure: Generating Editable Scientific Illustration with VLM Agents

LiveFigure एक विजन-लैंग्वेज मॉडल्स द्वारा संचालित एक एजेंटिक फ्रेमवर्क है जो पावरपॉइंट स्क्रिप्ट्स के माध्यम से पूरी तरह से संपादन योग्य, वेक्टरकृत वैज्ञानिक चित्र उत्पन्न करने के लिए मानव शोधकर्ताओं के बहु-चरणीय वर्कफ़्लो की नकल करता है, जो प्रकाशन की तत्परता और मानवीय प्राथमिकता में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Chenyang Shao, Jiahe Liu, Fengli Xu, Yong Li

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenyang Shao, Jiahe Liu, Fengli Xu, Yong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वैज्ञानिक हैं जिसने अभी-अभी एक शानदार नया विचार खोजा है। आपको दुनिया को समझाने के लिए एक आरेख (diagram) बनाने की आवश्यकता है। अतीत में, आपको सॉफ़्टवेयर जैसे कि पावरपॉइंट या इलस्ट्रेटर में घंटों तक मैन्युअल रूप से बॉक्स खींचने, तीर बनाने और फ़ॉन्ट को ठीक करने में बिताना पड़ता। यह उबाऊ था, जैसे चिमटी से ईंट-दर-ईंट घर बनाना।

हाल ही में, AI इमेज जनरेटर्स (जैसे वे जो टेक्स्ट से सुंदर चित्र बनाते हैं) ने यह सब आपके लिए करने का वादा किया था। लेकिन उनमें एक बड़ी खामी थी: उन्होंने कैनवास पर एक चित्र बनाया और फिर उस पर वार्निश लगा दिया। एक बार चित्र बन जाने के बाद, आप पूरे चित्र को फिर से बनाए बिना एक भी बॉक्स को हिला नहीं सकते थे या टाइपो (लिखने की गलती) को ठीक नहीं कर सकते थे। यदि आप "Weighted Sum" बॉक्स को नीचे ले जाना चाहते थे, तो AI पूरे चित्र को फिर से बनाने की कोशिश करता, जिससे अक्सर चित्र का बाकी हिस्सा गलत हो जाता।

LiveFigure एक नया सिस्टम है जो खेल बदल देता है। एक स्थिर चित्र बनाने के बजाय, यह एक सुपर-स्मार्ट, अत्यधिक व्यवस्थित आर्किटेक्ट की तरह काम करता है जो आपके आरेख का पूरी तरह से संपादन योग्य (editable) मॉडल बनाता है।

यह कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:

1. "ब्लूप्रिंट" चरण (विजुअल प्लानिंग)

कुछ भी बनाने से पहले, एक मानव वास्तुकार (architect) सफल इमारतों को देखता है कि क्या काम करता है। LiveFigure भी ऐसा ही करता है। यह शीर्ष जर्नल्स से हजारों उच्च-गुणवत्ता वाले वैज्ञानिक आरेखों को स्कैन करता है ताकि वह "सड़क के नियमों" को सीख सके।

  • उपमा: कल्पना कीजिए कि आप एक ट्रीहाउस बना रहे हैं। शाखाएँ कहाँ होनी चाहिए इसका अनुमान लगाने के बजाय, आप अब तक के सबसे अच्छे ट्रीहाउस की तस्वीरों को देखते हैं। आप सीखते हैं कि सीढ़ी आमतौर पर बाईं ओर होती है और खिड़की सूरज की ओर होती है। LiveFigure कोड की एक भी लाइन लिखने से पहले आपके आरेख का एक मानसिक ब्लूप्रिंट तैयार करने के लिए इस "विजुअल मेमोरी" का उपयोग करता है।

2. "निर्माण" चरण (प्रोसीजरल जनरेशन)

यहीं पर LiveFigure अन्य AI से अलग है। पिक्सेल पेंट करने के बजाय, यह कोड लिखता है (विशेष रूप से, पायथन स्क्रिप्ट जो माइक्रोसॉफ्ट पावरपॉइंट से बात करती हैं)।

  • उपमा: अन्य AI को एक ऐसे चित्रकार के रूप में सोचें जो पैलेट पर रंग मिलाता है। LiveFigure एक रोबोटिक बढ़ई (carpenter) है जिसके पास पहले से बने हुए, एकदम सही हिस्सों का टूलबॉक्स है। यह एक बॉक्स कैसे बनाया जाए इसका "अनुमान" नहीं लगाता; यह एक परीक्षण किए गए टूल add_box() का उपयोग करता है। यह तीर कैसे बनाया जाए इसका अनुमान नहीं लगाता; यह add_connector() नामक टूल का उपयोग करता है।
  • "अनुभव" का नुस्खा: कभी-कभी, यहाँ तक कि रोबोट भी गलतियाँ करते हैं (जैसे हथौड़े को पेचकस की तरह इस्तेमाल करने की कोशिश करना)। LiveFigure गलतियों की एक "डायरी" रखता है। यदि इसने पहले कुछ ऐसा करने की कोशिश की जिससे प्रोग्राम क्रैश हो गया था, तो इसे याद रहता है: "ऐसा फिर कभी मत करना!" यह सुनिश्चित करता है कि यह ऐसा कोड लिखे जो पहली बार में ही काम करे।

3. "क्वालिटी चेक" चरण (लक्षित परिशोधन)

एक बार जब रोबोट आरेख बना लेता है, तो एक "विजुअल इंस्पेक्टर" (एक अन्य AI) परिणाम को देखता है।

  • उपमा: कल्पना कीजिए कि एक बढ़ई एक शेल्फ बनाता है, लेकिन इंस्पेक्टर देखता है कि एक पेंच बाहर निकला हुआ है या शेल्फ थोड़ा टेढ़ा है। पूरे शेल्फ को गिराकर फिर से शुरू करने के बजाय, इंस्पेक्टर उस विशिष्ट पेंच की ओर इशारा करता है और कहता है, "इसे घड़ी की दिशा में घुमाएं।"
  • LiveFigure कोड में ये सूक्ष्म, सटीक समायोजन करता है। यह बाकी आरेख को छुए बिना टेढ़े तीर या ओवरलैपिंग टेक्स्ट बॉक्स को ठीक करता है।

परिणाम: एक "लेगो" आरेख

अंतिम आउटपुट एक सपाट छवि (जैसे JPEG) नहीं है। यह एक पावरपॉइंट फ़ाइल है जहाँ प्रत्येक बॉक्स, तीर और शब्द एक अलग, हटाने योग्य वस्तु है।

  • यह क्यों मायने रखता है: यदि आप एक बॉक्स का रंग बदलना चाहते हैं, तो आप बस उस पर क्लिक करते हैं और रंग बदलते हैं। यदि आप एक पूरा हिस्सा हटाना चाहते हैं, तो आप उसे खींचते हैं, और तीर अपने आप खिंच जाते हैं और मुड़ जाते हैं। यह कंक्रीट डालने के बजाय लेगो ब्रिक्स से खेलने जैसा है।

शोध ने क्या पाया

शोधकर्ताओं ने LiveFigure का परीक्षण सर्वश्रेष्ठ इमेज-जनरेटिंग AI मॉडल (जैसे गूगल का "नैनो बनाना" और ओपनएआई का "जीपीटी-इमेज") और पारंपरिक कोडिंग टूल्स के विरुद्ध किया।

  • "फिक्स-इट" टेस्ट: उन्होंने मनुष्यों को AI-जनरेटेड आरेखों को लेकर उन्हें वैज्ञानिक पेपर के लिए तैयार करने के लिए कहा।
    • अन्य AI: इंसान को गड़बड़ी को ठीक करने के लिए लगभग 30+ संपादन (edits) करने पड़े, और तब भी, केवल 24% आरेख ही उपयोग के लायक थे।
    • LiveFigure: इंसान को केवल लगभग 17 संपादन करने की आवश्यकता थी (ज्यादातर छोटे बदलाव), और 80% आरेख तुरंत प्रकाशित करने के लिए तैयार थे।
  • मानवीय प्राथमिकता: जब लोगों को दो आरेखों को आमने-सामने दिखाया गया (एक LiveFigure से, एक प्रतियोगिता से), तो उन्होंने LiveFigure को 60% समय चुना क्योंकि यह अधिक पेशेवर दिखता था और तार्किक रूप से अधिक समझ में आता था।

संक्षेप में

LiveFigure केवल एक चित्र "बनाता" नहीं है; यह एक स्मार्ट, चरण-दर-चरण प्रक्रिया का उपयोग करके एक आरेख का निर्माण करता है जो मानव विशेषज्ञों के सोचने के तरीके की नकल करता है। यह एक ऐसा आरेख बनाता है जिसे आप वास्तव में संपादित कर सकते हैं, ठीक कर सकते हैं और पूर्ण कर सकते हैं, जिससे वैज्ञानिक चित्रण के कठिन कार्य को डिजिटल लेगो के साथ खेलने जैसा अनुभव मिलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →