← नवीनतम पेपर
💬 NLP

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

यह शोध पत्र ErrorMap को प्रस्तुत करता है, जो लार्ज लैंग्वेज मॉडल (Large Language Model) की विफलताओं के विशिष्ट मूल कारणों का निदान करने की एक नवीन विधि है, और ErrorAtlas को, जो 35 डेटासेट में 83 मॉडलों के विश्लेषण से प्राप्त एक व्यापक वर्गीकरण है, ताकि मूल्यांकन के केंद्र को केवल सफलता के मेट्रिक्स से हटाकर इस बात की गहरी समझ की ओर स्थानांतरित किया जा सके कि मॉडल क्यों विफल होते हैं।

मूल लेखक: Shir Ashury-Tahan, Yifan Mai, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen

प्रकाशित 2026-02-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shir Ashury-Tahan, Yifan Mai, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 100 गणित के टेस्ट की एक ढेरी को ग्रेड कर रहे एक शिक्षक हैं। आप देखते हैं कि 20 छात्रों ने अंतिम उत्तर गलत दिया है।

पुराने तरीके में (पारंपरिक बेंचमार्क), आप बस कागज पर एक बड़ा लाल "F" लिख देंगे और कहेंगे, "यह छात्र फेल हो गया।" आप जानते हैं कि वे फेल हो गए, लेकिन आप यह नहीं जानते कि क्यों। क्या वे गुणा करना भूल गए थे? क्या उन्होंने प्रश्न को गलत पढ़ लिया था? क्या उनके पास समय कम पड़ गया था? या उनका बस बुरा दिन था?

"क्यों" को जाने बिना, आप उन्हें सुधारने में मदद नहीं कर सकते। आप उन्हें गुणा सिखाने में घंटों बिता सकते हैं जबकि वास्तव में उन्हें केवल निर्देशों को बेहतर ढंग से पढ़ना सीखने की आवश्यकता थी।

यह पेपर एक नया तरीका पेश करता है जिसे ErrorMap कहा जाता है और उससे उत्पन्न एक "एटलस" (मानचित्र) जिसे ErrorAtlas कहा जाता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: विफलता का "ब्लैक बॉक्स" (The Black Box of Failure)

वर्तमान में, हम AI मॉडल (जैसे वे जो चैटबॉट्स को संचालित करते हैं) को मानक परीक्षणों के साथ टेस्ट करते हैं। यदि AI कोई प्रश्न गलत करता है, तो हम इसे केवल एक "विफलता" के रूप में गिनते हैं। लेकिन एक विफलता कार के पंचर टायर की तरह है। आप जानते हैं कि कार रुक गई है, लेकिन आप यह नहीं जानते कि वह कील की वजह से हुई, टायर फटने से हुई, या नट ढीला होने से।

लेखकों का तर्क है कि हमें केवल पंचर टायरों को गिनना बंद करना चाहिए और यह पता लगाना शुरू करना चाहिए कि उन्हें किसने पंचर किया।

2. समाधान: ErrorMap (जासूस)

ErrorMap एक सुपर-स्मार्ट जासूस की तरह है जिसे AI द्वारा दिए गए हर गलत उत्तर की जांच करने के लिए काम पर लगाया गया है। केवल "गलत" कहने के बजाय, यह पूछता है:

  • "क्या AI ने प्रश्न को गलत समझा?"
  • "क्या इसने गणित सही किया लेकिन अंतिम उत्तर लिखना भूल गया?"
  • "क्या इसने ऐसे तथ्य की कल्पना (hallucinate) की जो अस्तित्व में ही नहीं है?"
  • "क्या इसने उत्तर देने से मना कर दिया जब उसे उत्तर देना चाहिए था?"

यह AI की विचार प्रक्रिया को चरण-दर-चरण तोड़ता है, उस सटीक क्षण को ढूंढता है जहाँ ट्रेन पटरी से उतरी थी, और उस विशिष्ट गलती को लेबल करता है।

3. परिणाम: ErrorAtlas (गलतियों का मानचित्र)

83 अलग-अलग AI मॉडल से 35 विभिन्न परीक्षणों के हजारों गलतियों का विश्लेषण करने के बाद, जासूस (ErrorMap) एक विशाल मानचित्र खींचता है जिसे ErrorAtlas कहा जाता है।

सोचिए कि ErrorAtlas AI विफलताओं के लिए एक "मौसम मानचित्र" (Weather Map) है।

  • केवल यह कहने के बजाय कि "बारिश हो रही है," मानचित्र बताता है: "'गणित' क्षेत्र में भारी गरज के साथ बारिश हो रही है, लेकिन 'क्रिएटिव राइटिंग' क्षेत्र में केवल हल्की बूंदाबांदी है।"
  • यह प्रकट करता है कि AI मॉडल अक्सर इसलिए विफल नहीं होते क्योंकि वे "मूर्ख" हैं, बल्कि इसलिए क्योंकि वे विशिष्ट निर्देशों का पालन करने में खराब हैं (जैसे कि सामग्री की सूची बनाना भूल जाना) या प्रश्न के इरादे को समझने में गलत हैं।

4. उन्होंने क्या पाया? (आश्चर्यजनक तथ्य)

लेखकों ने कुछ दिलचस्प "मौसम पैटर्न" पाए जिन पर कोई ध्यान नहीं दे रहा था:

  • "लापता सामग्री" की समस्या (The "Missing Ingredient" Problem): बहुत से AI सही विचार तो रखते हैं लेकिन उपयोगकर्ता द्वारा मांगी गई किसी विशिष्ट विवरण को शामिल करना भूल जाते हैं (जैसे कि दवा में निष्क्रिय सामग्री को सूचीबद्ध करना भूल जाना)। यह आश्चर्यजनक रूप से आम है लेकिन इस पर बहुत कम अध्ययन किया गया है।
  • "गलत प्रश्न" की समस्या (The "Wrong Question" Problem): कभी-कभी AI प्रश्न का बिल्कुल सही उत्तर देता है, लेकिन वह गलत प्रश्न का उत्तर दे रहा होता है क्योंकि उसने गलत समझा कि मानव वास्तव में क्या चाहता था।
  • अलग-अलग मॉडल, अलग-अलग खामियां: ठीक वैसे ही जैसे अलग-अलग कार ब्रांडों के अलग-अलग कमजोर बिंदु होते हैं, अलग-अलग AI मॉडल के भी अलग-अलग "विफलता हस्ताक्षर" (failure signatures) होते हैं। एक मॉडल गणित में बहुत अच्छा हो सकता है लेकिन फॉर्मेटिंग में बहुत खराब, जबकि दूसरा तथ्यों में अच्छा लेकिन तर्क (logic) में बुरा हो सकता है।

5. यह क्यों मायने रखता है?

यह तीन समूहों के लिए गेम-चेंजर है:

  • AI बिल्डरों (डेवलपर्स) के लिए: अनुमान लगाने के बजाय कि क्या ठीक करना है, उन्हें एक विशिष्ट मरम्मत नियमावली मिलती है। "ओह, मॉडल के नए संस्करण ने गणित की त्रुटियों को ठीक कर दिया है लेकिन फॉर्मेटिंग को बदतर बना दिया है। चलिए अब फॉर्मेटिंग पर ध्यान केंद्रित करते हैं।"
  • परीक्षण रचनाकारों (बेंचमार्कर) के लिए: वे देख सकते हैं कि क्या उनके परीक्षण वास्तव में वही परीक्षण कर रहे हैं जो वे सोचते हैं। शायद एक परीक्षण का उद्देश्य "तर्क" को मापना है, लेकिन AI "खराब फॉर्मेटिंग" के कारण विफल हो रहा है। अब वे परीक्षण को ठीक करने के लिए जानते हैं।
  • व्यावसायिक उपयोगकर्ताओं के लिए: यदि आप मरीजों का निदान करने में मदद करने के लिए एक AI चुनने वाले डॉक्टर हैं, तो आप केवल "उच्चतम स्कोर" नहीं चाहते। आप जानना चाहते हैं: "क्या यह AI चिकित्सा तथ्यों में कम गलतियाँ करता है?" ErrorAtlas आपको सही काम के लिए सही उपकरण चुनने में मदद करता है।

बड़ी तस्वीर (The Big Picture)

लेखक अरस्तू को उद्धृत करते हैं: "यह संभव है कि कई तरीकों से विफल हुआ जाए... जबकि सफल होने के लिए केवल एक ही तरीका संभव है।"

अभी, हम केवल "एक तरीके" (सफलता) को देखते हैं। यह पेपर हमें उन "कई तरीकों" (विफलता) को देखने के लिए एक टॉर्च देता है। विफलता के सटीक तरीके और कारणों को मैप करके, हम केवल बड़े, धुंधले मॉडल बनाना बंद कर सकते हैं और स्मार्ट, अधिक विश्वसनीय मॉडल बनाना शुरू कर सकते हैं।

संक्षेप में: हमने केवल गलत उत्तरों को गिनना बंद कर दिया और गलती के पीछे की कहानी को समझना शुरू कर दिया। इसी तरह हम बेहतर बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →