← नवीनतम पेपर
💻 computer science

Assessing Y-Axis Influence: Bias in Multimodal Language Models on Chart-to-Table Translation

यह शोध पत्र FairChart2Table फ्रेमवर्क को प्रस्तुत करता है जो यह प्रकट करता है कि मल्टीमॉडल लैंग्वेज मॉडल्स चार्ट-टू-टेबल अनुवाद में y-अक्ष की विशेषताओं (जैसे अंक की लंबाई, टिक संख्या और मान सीमा) और लेजेंड जटिलता से संबंधित महत्वपूर्ण प्रदर्शन पूर्वाग्रह प्रदर्शित करते हैं, जबकि यह भी दर्शाता है कि स्पष्ट y-अक्ष जानकारी प्रदान करने से इन असमानताओं को कम किया जा सकता है।

मूल लेखक: Seok Hwan Song, Azher Ahmed Efat, Wallapak Tavanapong

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seok Hwan Song, Azher Ahmed Efat, Wallapak Tavanapong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रोबोट शेफ (एक मल्टीमॉडल लैंग्वेज मॉडल, या MLM) है जिसका काम एक चार्ट की तस्वीर देखना और उसमें दी गई रेसिपी (डेटा टेबल) को बिल्कुल वैसा ही लिखना है जैसा वह दिखाई दे रही है। आप उम्मीद करेंगे कि यह रोबोट एकदम सटीक होगा, है ना?

यह पेपर कहता है: इतनी जल्दी नहीं। रोबोट वास्तव में चार्ट के वर्टिकल रूलर (y-अक्ष) पर लिखे गए नंबरों के प्रति बहुत चूजी (picky) है। यदि रूलर एक निश्चित तरीके से दिखता है, तो रोबोट एक बेहतरीन भोजन बनाता है। यदि यह थोड़ा अलग दिखता है, तो रोबोट खाना जला देता है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके उनके निष्कर्षों का विवरण दिया गया है:

1. समस्या: रोबोट की "अंधेरी जगह" (Blind Spots) होती है

शोधकर्ताओं ने देखा कि जिन चार्ट्स पर रोबोट्स को प्रशिक्षित किया गया था, वे असंतुलित थे। यह एक शेफ को केवल इस बात पर प्रशिक्षित करने जैसा था कि आटे के लिए कप का उपयोग कैसे किया जाए, लेकिन उसे कभी चम्मच (tablespoon) के बारे में नहीं सिखाया गया। जब शेफ ने आखिरकार चम्मच देखा, तो वह भ्रमित हो गया।

चार्ट की दुनिया में, "सामग्री" (ingredients) ऐसी चीजें हैं जैसे:

  • डिजिट की लंबाई (Digit Length): क्या नंबर "5" है या "5,000,000"?
  • टिक मार्क्स (Tick Marks): क्या रूलर पर 3 लाइनें हैं या 11?
  • फॉर्मेट (Formats): क्या नंबर "7,000", "7K", या "7.00e+3" के रूप में लिखे गए हैं?

पेपर में पाया गया कि जब ये विशिष्ट सामग्रियां बदलती हैं, तो रोबोट खराब प्रदर्शन करते हैं, भले ही वास्तविक डेटा वही हो।

2. समाधान: एक "फेयर टेस्ट किचन" (FairChart2Table)

इसे साबित करने के लिए, शोधकर्ताओं ने एक नया, सुपर-कंट्रोल्ड टेस्ट किचन बनाया जिसे FairChart2Table कहा गया।

  • सेटअप: वास्तविक दुनिया के अव्यवस्थित चार्ट्स के बजाय, उन्होंने हजारों परफेक्ट, सिंथेटिक चार्ट्स बनाए।
  • नियंत्रण (Control): उन्होंने एक बार में केवल एक चीज़ बदली। उदाहरण के लिए, उन्होंने बिल्कुल एक ही डेटा लिया और एक चार्ट बनाया जिसमें नंबर "1, 2, 3" थे और दूसरा जिसमें "1,000, 2,000, 3,000" थे।
  • लक्ष्य: यह देखना कि रूलर की कौन सी विशिष्ट विशेषता रोबोट को लड़खड़ाने पर मजबूर करती है।

3. मुख्य निष्कर्ष: रोबोट को क्या उलझाता है?

A. नंबरों का "आकार" (डिजिट की लंबाई)
डिजिट की लंबाई को रूलर पर फॉन्ट के आकार के रूप में सोचें।

  • निष्कर्ष: जब नंबर बहुत लंबे (जैसे 15 या 16 डिजिट) हो जाते हैं, तो रोबोट भ्रमित हो जाते हैं। यह एक ऐसे मेनू को पढ़ने जैसा है जहाँ कीमतें सूक्ष्म छोटे टेक्स्ट में लिखी गई हैं। कुछ रोबोट्स (जैसे GPT-4o) बहुत लंबे नंबरों के साथ बेहद गड़बड़ हो गए, जबकि अन्य (जैसे Gemini) ने इसे बेहतर ढंग से संभाला लेकिन फिर भी संघर्ष किया।

B. चार्ट में "भीड़" (एंटिटीज की संख्या)
एक चार्ट की कल्पना करें जिसमें एक रेखा (एक एंटिटी) है बनाम एक चार्ट जिसमें छह रेखाएं हैं जो स्पैगेटी के कटोरे की तरह एक-दूसरे को काट रही हैं।

  • निष्कर्ष: जैसे-जैसे रेखाएं अधिक भीड़भाड़ वाली होती हैं, रोबोट उन्हें आपस में मिलाने लगते हैं। वे कह सकते हैं, "यह बिंदु लाल रेखा का है," जबकि वास्तव में वह नीली रेखा का होता है। जितनी अधिक रेखाएं होंगी, रोबोट द्वारा उत्तर बदलने की संभावना उतनी ही अधिक होगी।

C. रूलर की "शैली" (फॉर्मेट और टिक्स)

  • निष्कर्ष: रोबोट संक्षिप्त शब्दों (abbreviations) से नफरत करते हैं। यदि आप "1 Million" को "1M" या "1,000,000" के रूप में लिखते हैं, तो कुछ रोबोट खो जाते हैं। वे भी संघर्ष करते हैं यदि रूलर में बहुत कम निशान (3 टिक्स) हैं, मुकाबले बहुत अधिक निशान (11 टिक्स) के। यह एक थर्मामीटर के साथ अंदाज़ा लगाने जैसा है जिस पर केवल "गर्म" और "ठंडा" लिखा है, बनाम एक जिसके साथ हर एक डिग्री अंकित है।

4. जादुई ट्रिक: रोबोट को एक "चीट शीट" देना

शोधकर्ताओं ने पूछा: "क्या होगा यदि हम बस रोबोट को बता दें कि रूलर क्या कहता है?"

  • प्रयोग: उन्होंने रोबोट को एक ऐसा प्रॉम्प्ट दिया जो स्पष्ट रूप से y-अक्ष पर नंबरों को सूचीबद्ध करता था (उदाहरण के लिए, "रूलर 0 से 100 तक 10 के स्टेप में जाता है")।
  • परिणाम: यह कुछ रोबतों के लिए जादू की तरह काम कर गया। उनका प्रदर्शन काफी बढ़ गया। यह शेफ को एक रूलर देने जैसा है ताकि उसे माप का अनुमान न लगाना पड़े। हालाँकि, यह हर रोबोट की समान रूप से मदद नहीं कर पाया; कुछ पहले से ही ठीक थे, और अन्य अभी भी विशिष्ट फॉर्मेट जैसे संक्षिप्त शब्दों के साथ संघर्ष कर रहे थे।

5. काम के लिए नए उपकरण

शोधकर्ताओं ने रोबोट को ग्रेड करने के नए तरीके भी आविष्कार किए।

  • पुराना ग्रेडिंग: केवल यह जाँचता था कि नंबर कितना करीब है।
  • नया ग्रेडिंग (TBE): उन्होंने महसूस किया कि "200 अंक" का अंतर चार्ट के आधार पर बहुत अलग दिखता है। यदि चार्ट 0 से 1,000 तक जाता है, तो 200 का अंतर एक बड़ी गलती है। यदि चार्ट 0 से 1,000,000 तक जाता है, तो 200 का अंतर बहुत छोटा है। उनका नया मेट्रिक त्रुटियों को चार्ट की "ग्रिड लाइनों" के आधार पर मापता है, जो यह परखने का एक अधिक निष्पक्ष तरीका है कि क्या रोबोट ने वास्तव में चार्ट को सही ढंग से देखा था।

सारांश

पेपर निष्कर्ष निकालता है कि मल्टीमॉडल लैंग्वेज मॉडल्स चार्ट पढ़ने में अभी तक परफेक्ट नहीं हैं क्योंकि वे वर्टिकल एक्सिस पर नंबरों की प्रस्तुति से प्रभावित (biased) होते हैं। वे कुछ शैलियों पर अच्छा प्रदर्शन करते हैं लेकिन दूसरों पर विफल हो जाते हैं। एक निष्पक्ष परीक्षण आधार बनाकर और मॉडल्स को थोड़ी मदद देकर (एक्सिस वैल्यूज के साथ प्रॉम्प्टिंग), हम देख सकते हैं कि वे कहाँ विफल होते हैं और उन्हें सुधारने में मदद कर सकते हैं।

नोट: पेपर यह दावा नहीं करता है कि ये रोबोट वर्तमान में चिकित्सा निदान या वित्तीय व्यापार के लिए उपयोग किए जा रहे हैं; यह पूरी तरह से चार्ट इमेज को डेटा टेबल में अनुवाद करने के तकनीकी प्रदर्शन पर केंद्रित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →