← नवीनतम पेपर
💻 computer science

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

यह शोध पत्र एक व्यापक ढांचे को पेश करते हुए संरचित दृश्यों (structured visuals) को संभालने में वर्तमान छवि निर्माण मॉडलों की सीमाओं को संबोधित करता है, जिसमें 1.3-मिलियन युग्मों का एक डेटासेट, तीन-चरणीय पाठ्यक्रम और बाहरी तर्क (external reasoning) के साथ प्रशिक्षित एक एकीकृत VLM-FLUX.1 मॉडल, और चार्ट एवं आरेख निर्माण तथा संपादन में तथ्यात्मक निष्ठा को मूल्यांकित करने और सुधारने के लिए StructScore मीट्रिक के साथ StructBench बेंचमार्क शामिल है।

मूल लेखक: Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बेहद प्रतिभाशाली कलाकार है जो सुंदर सूर्यास्त, चित्र और परिदृश्य (landscapes) बना सकता है जो इतने वास्तविक लगते हैं कि आप उन्हें लगभग छू सकते हैं। यह कलाकार आज के शीर्ष AI इमेज जनरेटर की तरह है। वे सुंदर चीजें बनाने में अद्भुत हैं।

लेकिन, यदि आप इस कलाकार को एक सटीक गणितीय ग्राफ, एक जटिल सर्किट आरेख (circuit diagram), या सटीक बिक्री संख्या दिखाने वाला चार्ट बनाने के लिए कहें, तो वे लड़खड़ाने लगते हैं। वे एक बार चार्ट बना सकते हैं जहाँ बार (bars) गलत ऊंचाई के होते हैं, या एक पाई चार्ट बना सकते हैं जहाँ हिस्से 100% तक नहीं जुड़ते। वे "वाइब" (vibe) को सही पकड़ लेते हैं, लेकिन तथ्य (facts) गलत होते हैं।

यह शोध पत्र, जिसका शीर्षक "Factuality Matters" है, AI के लिए एक रिपोर्ट कार्ड की तरह है, जो यह बताता है कि जबकि हमारे AI कलाकार सुंदर चित्र बनाने में माहिर हैं, वे उपयोगी, तथ्यात्मक आरेख बनाने में बहुत खराब हैं। लेखकों ने इसे ठीक करने का निर्णय लिया और इसके लिए एक नया स्कूल, एक नई पाठ्यपुस्तक और एक नया टेस्ट बनाया।

यहाँ उनके समाधान की कहानी है, जिसे तीन सरल भागों में विभाजित किया गया है:

1. समस्या: "सुंदर लेकिन गलत" कलाकार

वर्तमान AI मॉडल उन छात्रों की तरह हैं जो किसी चीज़ के दिखावट को याद करने में तो माहिर हैं लेकिन उसके पीछे के नियमों को समझने में कमजोर हैं।

  • प्राकृतिक चित्र (Natural Images): यदि आप "एक बिल्ली" मांगते हैं, तो AI जानता है कि बिल्ली कैसी दिखती है।
  • संरचित चित्र (Structured Images): यदि आप "2024 की बिक्री दिखाने वाला एक बार चार्ट" मांगते हैं, तो AI अनुमान लगाने की कोशिश करता है कि चार्ट कैसा दिखता है, और अक्सर संख्याओं, लेबल या लेआउट में गलती कर देता है। यह एक ऐसे शेफ की तरह है जो केक को सुंदर तो बना सकता है लेकिन उसमें चीनी डालना भूल जाता है।

2. समाधान: एक "कोड-आधारित" ट्रेनिंग कैंप बनाना

लेखकों ने महसूस किया कि संरचित चित्र (जैसे चार्ट और ग्राफ) वास्तव में कोड ही हैं जो छद्म रूप में मौजूद हैं। एक चार्ट केवल एक चित्र नहीं है; यह निर्देशों का एक सेट है (जैसे एक रेसिपी) जो कंप्यूटर को रेखाएं और रंग कैसे खींचने हैं, यह बताता है।

AI को सही ढंग से सिखाने के लिए, उन्होंने उसे केवल चित्र नहीं दिखाए; बल्कि उन्होंने 1.3 मिलियन "कोड-टू-इमेज" जोड़ों की एक विशाल लाइब्रेरी बनाई।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक बच्चे को मानचित्र (map) बनाना सिखा रहे हैं। केवल एक तैयार मानचित्र दिखाने के बजाय, आप उसे GPS निर्देशांक और सड़कें बनाने के नियम देते हैं।
  • प्रक्रिया: उन्होंने चार्ट बनाने वाले लाखों कंप्यूटर प्रोग्राम (कोड) लिए, उन्हें चित्र बनाने के लिए चलाया, और फिर एक सुपर-स्मार्ट AI (GPT-5) से "संपादन निर्देश" (editing instructions) बनाने के लिए कहा।
    • उदाहरण: "लाल बार को नीला करें" (इमेज निर्देश) पूरी तरह से "रंग कोड को #FF0000 से #0000FF में बदलें" (कोड निर्देश) से मेल खाता है।
  • सीक्रेट सॉस (Chain-of-Thought): उन्होंने AI को केवल उत्तर नहीं दिया। उन्होंने इसे अपनी सोचने की प्रक्रिया लिखने के लिए मजबूर किया (जैसे एक छात्र गणित के टेस्ट पर अपना काम दिखाता है)। यह AI को यह समझने में मदद करता है कि एक चार्ट क्यों इस तरह का दिखता है, न कि केवल यह कि वह क्या दिखता है।

3. नया टेस्ट: "फैक्ट-चेकर" परीक्षा

आप एक AI को चार्ट पर कैसे ग्रेड देंगे? आप केवल यह नहीं पूछ सकते कि, "क्या यह एक अच्छा चार्ट है?" (यह अविश्वसनीय है; AI केवल विनम्र होने के लिए "हाँ" कह सकता है)। आपको यह जांचना होगा कि डेटा सच है या नहीं।

  • पुराना तरीका: AI से पूछें, "क्या यह एक अच्छा चार्ट है?" (यह अविश्वसनीय है; AI केवल विनम्र होने के लिए "हाँ" कह सकता है)।
  • नया तरीका (StructBench & StructScore): लेखकों ने StructBench नामक एक कठोर परीक्षा बनाई।
    • एक साधारण "पास/फेल" के बजाय, सिस्टम चार्ट को सैकड़ों छोटे प्रश्नों में तोड़ देता है: "ऊपरी बार पर संख्या क्या है?" "क्या शीर्षक नीले रंग में है?" "क्या अक्ष (axis) शून्य से शुरू होता है?"
    • यह AI के साथ एक छात्र की तरह व्यवहार करता है जो बहुविकल्पीय परीक्षा दे रहा है, हर एक तथ्य की जाँच करता है। यदि AI संख्याएँ गलत करता है, तो वह फेल हो जाता है, भले ही चित्र सुंदर दिखे।

परिणाम: एक स्मार्टर, अधिक ईमानदार AI

लेखकों ने इस विशेष "कोड + थिंकिंग" पद्धति का उपयोग करके एक नया मॉडल प्रशिक्षित किया।

  • परिणाम: उनका मॉडल इन कठिन संरचित छवियों को संपादित करने और उत्पन्न करने में सर्वश्रेष्ठ बन गया, जिसने सबसे महंगे, क्लोज्ड-सोर्स सिस्टम (जैसे Google या OpenAI के सिस्टम) को भी पीछे छोड़ दिया।
  • "थिंकिंग" ट्रिक: उन्होंने पाया कि यदि आप AI को चित्र बनाने से पहले "ज़ोर से सोचने" (रीजनिंग स्टेप का उपयोग करने) की अनुमति देते हैं, तो यह निर्देशों का पालन करने में बहुत बेहतर हो जाता है। यह एक चित्रकार को बताने जैसा है, "पहले, कागज पर लेआउट की योजना बनाएं, फिर, पेंटिंग शुरू करें।"

यह क्यों महत्वपूर्ण है

यह शोध पत्र एक चेतावनी है। यह कहता है: "केवल सुंदर चित्र बनाना बंद करें। ऐसे चित्र बनाना शुरू करें जो वास्तव में सत्य हों।"

अपने डेटा, अपने मॉडल और अपने टेस्ट को जारी करके, वे पूरे AI समुदाय को चाबियाँ सौंप रहे हैं। वे कह रहे हैं, "यहाँ पाठ्यपुस्तक है, यहाँ परीक्षा है, और यहाँ सबसे स्मार्ट छात्र है। अब, आइए ऐसा AI बनाएं जो विज्ञान, गणित और व्यवसाय में हमारी मदद कर सके, न कि केवल कूल वॉलपेपर बनाने के लिए हो।"

संक्षेप में: उन्होंने AI को अनुमान लगाना बंद करने और गणना करना शुरू करने के लिए सिखाया, जिससे वह एक "सुंदर चित्रकार" से बदलकर एक "विश्वसनीय इंजीनियर" बन गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →