← नवीनतम पेपर
🤖 AI

GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models

यह शोध पत्र GeoNatureAgent बेंचमार्क प्रस्तुत करता है, जो एक वास्तविक API को संरचित टूल कॉल्स के माध्यम से पर्यावरणीय भू-स्थानिक विश्लेषण करने वाले LLM एजेंटों के लिए पहला मूल्यांकन ढांचा है, जो यह प्रकट करता है कि जबकि Claude Sonnet 4 जैसे शीर्ष मॉडल ~61% सटीकता प्राप्त करते हैं, ओपन-वेट मॉडल बेहतर लागत-दक्षता प्रदान करते हैं और वर्तमान एजेंट सार्वभौमिक रूप से क्लोज-वैल्यू तुलना कार्यों में विफल रहते हैं।

मूल लेखक: Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces, Javier Velázquez, Devika Jain

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces, Javier Velázquez, Devika Jain

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास बहुत बुद्धिमान, सुपर-फास्ट रोबोटों (जिन्हें AI Agents कहा जाता है) की एक टीम है जिन्हें आप एक बहुत ही विशिष्ट काम के लिए काम पर रखना चाहते हैं: स्पेन और पुर्तगाल के पर्यावरणीय डेटा का विश्लेषण करना। आप चाहते हैं कि वे मानचित्रों को देखें, प्रदूषण के स्तर की जांच करें, मिट्टी के कटाव को मापें, और आपको बताएं कि कौन से शहर अच्छा कर रहे हैं या खराब।

हालाँकि, एक पेच है। ये रोबोट केवल "अनुमान" नहीं लगा सकते: उन्हें एक विशिष्ट सेट के डिजिटल उपकरणों (जैसे कैलकुलेटर, मैप ज़ूमर, या डेटा सॉर्टर) का उपयोग करके जानकारी प्राप्त करने के लिए सख्त नियमों का पालन करना होगा, ठीक वैसे ही जैसे एक इंसान कंप्यूटर प्रोग्राम का उपयोग करता है।

यह शोध पत्र एक नया परीक्षण पेश करता है जिसे GeoNatureAgent Benchmark कहा जाता है। इसे इन AI रोबोटों के लिए एक "ड्राइवर लाइसेंस परीक्षा" के रूप में समझें, लेकिन यहाँ वे कार नहीं चला रहे हैं, बल्कि एक भू-स्थानिक (geospatial) विश्लेषण प्रणाली चला रहे हैं।

यहाँ बताया गया है कि शोधकर्ताओं ने क्या किया और उन्हें क्या मिला, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "डेटा रेंगलिंग" का जाल

पर्यावरण वैज्ञानिक आमतौर पर अपना 80% समय केवल बिखरे हुए डेटा को साफ करने और सॉफ्टवेयर का उपयोग करने का तरीका समझने में बिताते हैं, जिससे वास्तविक विश्लेषण के लिए केवल 20% समय बचता है। शोधकर्ता यह देखना चाहते थे कि क्या AI इस उबाऊ, बिखरे हुए हिस्से को संभाल सकता है। लेकिन किसी के पास यह परीक्षण करने का कोई निष्पक्ष तरीका नहीं था कि ये AI रोबोट वास्तव में काम में अच्छे हैं या केवल अनुमान लगा रहे हैं।

2. परीक्षण: एक "वास्तविक दुनिया" का बाधा दौड़ (Obstacle Course)

शोधकर्ताओं ने 93 अलग-अलग चुनौतियों (कार्यों) के साथ एक परीक्षण बनाया। ये सरल प्रश्न नहीं थे जैसे "स्पेन की राजधानी क्या है?" ये जटिल मिशन थे जैसे:

  • "मिट्टी के कटाव वाले शीर्ष 3 शहरों को खोजें।"
  • "दो विशिष्ट क्षेत्रों में वायु गुणवत्ता की तुलना करें।"
  • "मुझे बताएं कि क्या कोई शहर मौजूद है, और यदि नहीं, तो उत्तर बनाने के बजाय विनम्रता से 'मुझे नहीं पता' कहें।"

परीक्षण में चालाकी भरे जाल भी शामिल थे, जैसे कि रोबोट को उस डेटा का विश्लेषण करने के लिए कहना जो मौजूद ही नहीं है (यह देखने के लिए कि क्या वह झूठ बोलता है) या उसे दो ऐसे नंबरों की तुलना करने के लिए कहना जो लगभग एक समान हैं (यह देखने के लिए कि क्या वह सूक्ष्म अंतर को पहचान सकता है)।

3. प्रतियोगी: "सात रोबोट"

उन्होंने सात अलग-अलग AI मॉडल (इन रोबोटों के पीछे के "मस्तिष्क") का परीक्षण किया। कुछ प्रसिद्ध, महंगे, क्लोज्ड-सोर्स मॉडल थे (जैसे Claude Sonnet 4 और Gemini 2.5 Pro), और कुछ ओपन-सोर्स, सस्ते मॉडल थे (जैसे DeepSeek V3.2 और Llama 4 Scout)।

उन्होंने परिणामों की पुष्टि करने के लिए प्रत्येक रोबोट को तीन बार परीक्षण से गुजारा ताकि परिणाम केवल किस्मत पर आधारित न हों।

4. परिणाम: "स्कोरबोर्ड"

जब रोबोटों ने परीक्षण दिया तो क्या हुआ:

  • सर्वश्रेष्ठ प्रदर्शन करने वाला: सबसे महंगा रोबोट, Claude Sonnet 4, ने उच्चतम स्कोर प्राप्त किया: 60.8%
    • उपमा: कल्पना करें कि एक परीक्षण है जहाँ 60% प्राप्त करना पास होना है, लेकिन 90% प्राप्त करना "विशेषज्ञ" होना है। यहाँ तक कि सर्वश्रेष्ठ रोबोट को भी केवल "C" ग्रेड मिला। यह पिछले परीक्षणों की तुलना में बहुत कम है जहाँ रोबोटों को "A" (85-97%) मिलते थे, क्योंकि वे पिछले परीक्षण आसान थे (जैसे वास्तविक, जटिल कंप्यूटर सिस्टम के बजाय कागज पर कैलकुलेटर का उपयोग करना)।
  • वैल्यू चैंपियन (मूल्य का विजेता): रोबोट DeepSeek V3.2 ने 56.3% का स्कोर प्राप्त किया।
    • उपमा: यह रोबोट एक बहुत ही बुद्धिमान छात्र की तरह है जो शीर्ष छात्र के लगभग बराबर ग्रेड प्राप्त करता है लेकिन केवल 1/11वें ट्यूशन शुल्क का भुगतान करता है। शीर्ष रोबोट पर खर्च किए गए प्रत्येक डॉलर के लिए, आप वैल्यू चैंपियन के साथ 93% प्रदर्शन प्राप्त करते हैं।
  • संघर्ष करने वाले: अन्य रोबोटों ने 27% से 50% के बीच स्कोर किया। कुछ बहुत सस्ते थे लेकिन बहुत गलतियाँ करते थे; अन्य महंगे थे फिर भी संघर्ष कर रहे थे।

5. "एकिलीज़ हील" (कमजोरी): तुलना का जाल

शोधकर्ताओं ने पाया कि एक विशेष प्रकार का प्रश्न था जिसमें सभी विफल रहे: बहुत समान संख्याओं की तुलना करना।

  • जाल: यदि शहर A में 68.5% प्रदूषण है और शहर B में 68.4% है, तो रोबोट लगभग हमेशा कहते, "शहर A बदतर है!" भले ही अंतर बहुत मामूली हो।
  • सबक: रोबोट बड़े अंतर खोजने में महान हैं लेकिन सूक्ष्म बारीकियों को पहचानने में बहुत खराब हैं। वे यह स्वीकार करने के बजाय कि संख्याएं प्रभावी रूप से समान हैं, "हैलुसिनेट" (चीजें बनाना) करने लगते हैं।

6. बड़ा निष्कर्ष: "वास्तविक" "नकली" से कठिन है

पेपर का तर्क है कि पिछले परीक्षण नकली डेटा के साथ रोबोट को अभ्यास परीक्षा देने जैसे थे। यह नया परीक्षण उन्हें वास्तविक कार्यालय में वास्तविक, बिखरे हुए डेटा के साथ रखने जैसा है।

  • परिणाम: जब आप नकली अभ्यास परीक्षण से वास्तविक दुनिया के परीक्षण पर जाते हैं, तो स्कोर नाटकीय रूप रूप से गिर जाता है (~90% से ~60% तक)।
  • निष्कर्ष: इससे पहले कि AI पर्यावरणीय विश्लेषण में मानव विशेषज्ञों की पूरी तरह से जगह ले सके, हमें अभी भी एक लंबा रास्ता तय करना है। रोबोट सहायक के रूप में मददगार हैं, लेकिन वे अकेले काम करने के लिए तैयार नहीं हैं।

एक वाक्य में सारांश

इस पेपर ने पर्यावरणीय डेटा का विश्लेषण करने वाले AI रोबोटों के लिए एक कठिन, वास्तविक दुनिया का परीक्षण बनाया, जिसमें पाया गया कि हालांकि सर्वश्रेष्ठ रोबोट लगभग 60% उत्तर सही दे रहे हैं, वे अभी भी सूक्ष्म विवरणों के लिए संघर्ष करते हैं और बहुत अधिक पैसा खर्च करते हैं, जबकि एक "बजट-अनुकूल" रोबोट इस काम के लिए सबसे अच्छी वैल्यू प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →