← नवीनतम पेपर
🤖 AI

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

यह शोध पत्र TomaMMU को प्रस्तुत करता है, जो 28,000 से अधिक छवियों और 213,000 एनोटेटेड प्रश्न-उत्तर युग्मों के साथ एक बड़े पैमाने का मल्टीमॉडल डेटासेट है, और इसके साथ ही TomaBench बेंचमार्क भी है, जो टमाटर के पत्तों की बीमारी के निदान पर विजन-लैंग्वेज मॉडल्स (Vision-Language Models) के मूल्यांकन और सुधार के लिए व्यवस्थित रूप से कार्य करता है, जो सूक्ष्म पहचान और तर्क में वर्तमान महत्वपूर्ण सीमाओं को प्रकट करता है जिन्हें लक्षित फाइन-ट्यूनिंग के माध्यम से काफी हद तक संबोधित किया जा सकता है।

मूल लेखक: Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da Quach

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da Quach

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आपका स्मार्टफोन एक मुरझाते हुए पौधे को देख सके और न केवल आपको यह बता सके कि वह बीमार है, बल्कि तुरंत यह भी बता सके कि वास्तव में क्या गलत है, ऐसा क्यों हो रहा है, और इसे कैसे ठीक किया जाए। यह "स्मार्ट कृषि" का सपना है, एक ऐसा क्षेत्र जहाँ कंप्यूटर प्रकृति की भाषा सीखने की कोशिश करते हैं। लंबे समय से, वैज्ञानिकों ने कंप्यूटरों को तस्वीरें पहचानना सिखाया है, जैसे उन्हें बिल्ली की फोटो दिखाकर कहना, "यह एक बिल्ली है।" इसे कंप्यूटर विजन (computer vision) कहा जाता है। हाल ही में, हमने कंप्यूटरों को भाषा समझना भी सिखाया है। जब आप इन दो कौशलों—देखने और बोलने—को मिला देते हैं, तो आपको विज़न-लैंग्वेज मॉडल्स (VLMs) मिलते हैं। ये सुपर-स्मार्ट सहायकों की तरह हैं जो एक छवि को देख सकते हैं और उसके बारे में बात कर सकते हैं। लेकिन यहाँ एक पेंच है: हालाँकि ये AI सहायक सामान्य चीजों में बहुत अच्छे हैं, लेकिन वे अक्सर तब भ्रमित हो जाते हैं जब दांव ऊँचे हों, जैसे कि एक खेत में जहाँ एक बीमार टमाटर के पौधे का मतलब भोजन और पैसे का नुकसान हो सकता है। वास्तविक दुनिया अव्यवस्थपूर्ण होती है, जिसमें अजीब रोशनी, गंदे बैकग्राउंड और मौसम के आधार पर अलग दिखने वाले पौधे होते हैं। अधिकांश AI को केवल प्रयोगशालाओं में ली गई एकदम साफ और शुद्ध तस्वीरों पर प्रशिक्षित किया गया है, इसलिए जब वे एक वास्तविक, गंदे खेत का सामना करते हैं, तो वे अक्सर विफल हो जाते हैं।

यहीं पर शोध पत्र "TomaMMU" काम आता है। शोधकर्ताओं ने महसूस किया कि बीमार टमाटरों को ठीक करने के लिए, हमें एक ऐसे AI की आवश्यकता है जो न केवल बीमारी का नाम अनुमान लगाए, बल्कि वास्तव में एक मानव विशेषज्ञ की तरह पौधे को समझता हो। उन्होंने एक विशाल नया प्रशिक्षण मैदान बनाया जिसे TomaMMU कहा जाता है, जो टमाटर के पत्तों की 28,808 तस्वीरों का एक विशाल पुस्तकालय है, जिसमें पूरी तरह स्वस्थ पत्तों से लेकर धब्बों, घुमावों और सड़न से ढके पत्तों तक सब कुछ शामिल है। लेकिन सिर्फ एक तस्वीर काफी नहीं है; उन्हें एक बातचीत की आवश्यकता थी। इसलिए, उन्होंने इन तस्वीरों के बारे में 213,000 से अधिक मानव-लिखित प्रश्न और उत्तर बनाए। इसे AI के लिए एक विशाल, कठोर स्कूली परीक्षा की तरह समझें। प्रश्न केवल "क्या यह बीमार है?" जैसे नहीं हैं। वे बहुत कठिन होते जा रहे हैं, जैसे पूछना कि "इस बीमारी का वैज्ञानिक नाम क्या है?" या "इस तस्वीर में कितने पत्ते हैं?" या "क्या यह एक फंगस है या वायरस?"

शोधकर्ताओं ने दुनिया के 14 सबसे बुद्धिमान AI मॉडलों को यह देखने के लिए इस परीक्षा से गुजारा कि वे कैसा प्रदर्शन करते हैं। परिणाम एक तरह का वेक-अप कॉल (चेतावनी) थे। यहाँ तक कि सबसे उन्नत AI भी, जो आमतौर पर कविता लिख सकता है या गणित की समस्याओं को हल कर सकता है, टमाटर टेस्ट के साथ बुरी तरह संघर्ष कर रहा था। बिना किसी विशेष प्रशिक्षण के बीमारी का निदान करने के लिए पूछे जाने पर, उनमें से अधिकांश ने गलत उत्तर दिए, अक्सर एक वायरस को फंगस समझने में गलती की या बीमारी को पूरी तरह से पहचानने में विफल रहे। यह एक प्रतिभाशाली भौतिकी के प्रोफेसर को बागवानी की परीक्षा देने और उन्हें असफल होते देखने जैसा था क्योंकि उन्होंने वास्तव में कभी टमाटर के पौधे को छुआ भी नहीं था। शोध पत्र सुझाव देता है कि वर्तमान AI मॉडल सरल पैटर्न पर बहुत अधिक निर्भर हैं और उनमें वास्तविक खेती के लिए आवश्यक गहरा, विशिष्ट ज्ञान की कमी है।

हालाँकि, कहानी विफलता के साथ समाप्त नहीं होती। शोधकर्ताओं ने इनमें से एक AI मॉडल को लिया और उसे अपने नए TomaMMU डेटासेट का उपयोग करके एक 'क्रैश कोर्स' दिया। उन्होंने इसे "फाइन-ट्यून" किया, जिसका अर्थ है, इसे उन 213,000 प्रश्नों और उत्तरों का अध्ययन करने दिया जब तक कि इसने सामग्री को सीख न लिया। परिणाम? AI का प्रदर्शन आसमान छू गया। इस प्रशिक्षण के बाद, इसने कठिन बहुविकल्पीय प्रश्नों के 96.09% सही उत्तर दिए, जिसने उन सभी मॉडलों को पीछे छोड़ दिया, जिनमें वे भी शामिल थे जिन्हें पहले सर्वश्रेष्ठ माना जाता था। यह सुझाव देता है कि जबकि वर्तमान AI अपने दम पर किसान की विशेषज्ञ दृष्टि को बदलने के लिए तैयार नहीं है, लेकिन यदि हम इसे वास्तविक दुनिया के डेटा का उपयोग करके सही तरीके से सिखाते हैं, तो यह अविश्वसनीय रूप से विश्वसनीय बन सकता है। शोध पत्र का निष्कर्ष है कि वास्तव में उपयोगी कृषि उपकरण बनाने के लिए, हमें AI को आदर्श, नकली लैब फोटो पर प्रशिक्षित करना बंद करना होगा और उन्हें वास्तविक खेतों की जटिल और अव्यवस्थित वास्तविकता खिलाना शुरू करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →