← नवीनतम पेपर
📊 statistics

Benchmarking AI Performance on End-to-End Data Science Projects

यह शोध पत्र जनरेटिव एआई मॉडलों का मूल्यांकन करने के लिए 40 एंड-टू-एंड डेटा साइंस प्रोजेक्ट्स के एक बेंचमार्क और एक स्वचालित ग्रेडिंग पाइपलाइन को प्रस्तुत करता है, जिसमें यह पाया गया है कि हालांकि हालिया मॉडल संरचित कार्यों पर अच्छा प्रदर्शन करते हैं, वे महत्वपूर्ण परिवर्तनशीलता प्रदर्शित करते हैं और निर्णय-प्रधान घटकों के लिए मानव सत्यापन की आवश्यकता होती है।

मूल लेखक: Evelyn Hughes, Rohan Alexander

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Evelyn Hughes, Rohan Alexander

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कुकिंग स्कूल चला रहे हैं। वर्षों से, आपने अपने छात्रों का परीक्षण करने के लिए उनसे प्याज काटने, पानी उबालने या एक सिंगल कुकी बेक करने जैसे काम कराए हैं। ये विशिष्ट कौशल के लिए बेहतरीन परीक्षण हैं, लेकिन वे आपको यह नहीं बताते कि क्या एक छात्र वास्तव में एक पूरा रेस्टोरेंट चला सकता है, डिनर रश को संभाल सकता है, और एक भूखे ग्राहक को एक पूर्ण, स्वादिष्ट भोजन परोस सकता है।

यह पेपर AI शेफ का परीक्षण करने के बारे में है कि क्या वे केवल एक सब्जी काटने के बजाय, शून्य से एक पूर्ण, पांच-कोर्स मील (पाँच व्यंजनों वाला भोजन) पका सकते हैं।

यहाँ शोधकर्ताओं ने जो पाया है, उसकी कहानी सरल शब्दों में दी गई है:

1. चुनौती: "फुल मील" टेस्ट

शोधकर्ताओं (एवलिन ह्यूजेस और रोहन अलेक्जेंडर) जानना चाहते थे: क्या AI एक पूर्ण डेटा साइंस प्रोजेक्ट कर सकता है?

एक वास्तविक डेटा साइंस प्रोजेक्ट केवल कोड लिखना नहीं है। यह एक लंबी यात्रा है जो इस तरह दिखती है:

  • सही सवाल पूछना: "इस डेटा में कौन सी कहानी छिपी है?"
  • सामग्री जुटाना: इंटरनेट से अव्यवस्थित (messy) डेटा डाउनलोड करना।
  • किचन की सफाई करना: त्रुटियों को ठीक करना और डेटा को व्यवस्थित करना।
  • खाना पकाना: नंबरों का विश्लेषण करना और चार्ट बनाना।
  • व्यंजन परोसना: एक रिपोर्ट लिखना जो समझा सके कि क्या हुआ, यह क्यों महत्वपूर्ण है, और सामग्री कहाँ से आई इसका उल्लेख (cite) करे।

उन्होंने एक "टेस्ट किचन" बनाया जिसमें 40 वास्तविक प्रोजेक्ट्स थे जिन्हें यूनिवर्सिटी के छात्रों ने पहले ही किया था। उन्होंने इन प्रोजेक्ट्स को एक सख्त चेकलिस्ट (रुब्रिक) के साथ ग्रेड किया, जो कोड की गुणवत्ता से लेकर कहानी कितनी अच्छी तरह बताई गई है, तक सब कुछ देखता था।

2. प्रतियोगी: AI शेफ

उन्होंने सात अलग-अलग AI मॉडल्स (शेफ) से इन प्रोजेक्ट्स को फिर से बनाने के लिए कहा। कुछ नवीनतम और सबसे महंगे मॉडल्स थे (जैसे Claude Opus 4.6 और GPT-5.2), और कुछ पुराने मॉडल्स थे (जैसे GPT-4o)।

3. परिणाम: कौन पास हुआ?

ग्रेडिंग एक अन्य AI द्वारा की गई थी (जो एक हेड शेफ की भूमिका निभा रहा था), और परिणाम आश्चर्यजनक थे:

  • टॉप शेफ (द "A-स्टूडेंट्स"): नवीनतम मॉडल्स, जैसे Claude Opus 4.6, ने 85% स्कोर किया। वे एक बुद्धिमान, मेहनती यूनिवर्सिटी सीनियर के लगभग बराबर थे। वे निर्देशों का पूरी तरह से पालन कर सकते थे, साफ कोड लिख सकते थे और अपनी फाइलों को खूबसूरती से व्यवस्थित कर सकते थे।
  • मिडल शेफ: GPT-5.2 और Gemini 3 Flash जैसे मॉडल्स ने 70 के दशक में स्कोर किया। वे अच्छे थे, लेकिन उनमें कुछ कमियां थीं।
  • संघर्ष करते शेफ: GPT-4o जैसे पुराने मॉडल्स ने 32% स्कोर किया। वे बुनियादी तौर पर टेस्ट में फेल हो गए। वे भोजन पूरा नहीं कर सके; वे किचन साफ करना या मेनू लिखना भूल गए।

4. पकड़: "रेसिपी फॉलो करना" बनाम "खाने का स्वाद लेना" की समस्या

यह इस पेपर का सबसे महत्वपूर्ण हिस्सा है। AI मॉडल्स रेसिपी का पालन करने में अद्भुत थे, लेकिन खाने का स्वाद लेने में बहुत खराब थे।

  • अच्छी खबर (रेसिपी का पालन करना): यदि आप AI को कहते, "एक शीर्षक लिखें," "फाइलों की एक सूची बनाएं," या "एक ग्राफ बनाएं," तो वे इसे पूरी तरह से करते थे। वे स्ट्रक्चर (संरचना) में माहिर हैं। वे बहुत तेज़ी से एक घर का ढांचा तैयार कर सकते हैं।
  • बुरी खबर (स्वाद और निर्णय): जब कार्य के लिए सोचने की आवश्यकता थी, तो AI लड़खड़ा गया।
    • "एब्स्ट्रैक्ट" (अमूर्त) की समस्या: एक लंबी कहानी का संक्षिप्त सारांश लिखना कठिन है। AI अक्सर ऐसे सारांश लिखता था जो सुनने में फैंसी लगते थे लेकिन वास्तव में कुछ भी महत्वपूर्ण नहीं कहते थे।
    • "मेजरमेंट" (मापन) की समस्या: यह समझाना कि एक वास्तविक दुनिया की चीज़ (जैसे "बेघर होना") स्प्रेडशीट में एक नंबर कैसे बनती है, इसके लिए गहरी समझ की आवश्यकता होती है। AI अक्सर केवल अनुमान लगाता था या अस्पष्ट उत्तर देता था।
    • "साइटेशन" (उद्धरण) की समस्या: AI कभी-कभी नकली बुक टाइटल बना देता था या सॉफ्टवेयर पैकेज के नाम गलत बता देता था। यह एक शेफ की तरह है जो कहता है, "मैंने एक गुप्त मसाला इस्तेमाल किया," लेकिन उसे यह नहीं पता कि उस मसाले का नाम क्या है।

5. फैसला: AI एक बेहतरीन इंटर्न है, बॉस नहीं

पेपर निष्कर्ष निकालता है कि AI एक बहुत ही सहायक इंटर्न बनने के लिए तैयार है।

  • यह उबाऊ, दोहराव वाले काम (डेटा की सफाई, कोड टेम्पलेट लिखना, चार्ट बनाना) इंसानों से तेज़ कर सकता है।
  • हालांकि, आप इसे अकेले शो चलाने के लिए नहीं छोड़ सकते।

यदि आप AI को बिना किसी इंसान की निगरानी के डेटा प्रोजेक्ट चलाने देते हैं, तो वह आपको एक ऐसा भोजन परोस सकता है जो प्लेट पर दिखने में तो सुंदर है लेकिन उसका स्वाद कार्डबोर्ड जैसा है। वह नियमों का पूरी तरह से पालन कर सकता है लेकिन कहानी के सार को मिस कर सकता है।

निष्कर्ष:
AI अब रूटीन कार्यों पर एक अच्छे कॉलेज छात्र का काम कर सकता है, लेकिन इसे आपके लिए सोचने के लिए छोड़ने के लिए अभी भी इसे एक मानव "हेड शेफ" की आवश्यकता है, जो खाने का स्वाद ले सके, सामग्री की जांच कर सके, और यह सुनिश्चित कर सके कि दुनिया को परोसने से पहले कहानी का अर्थ स्पष्ट हो। हम काम को तेज करने के लिए AI का उपयोग कर सकते हैं, लेकिन हम अभी भी इस पर भरोसा नहीं कर सकते कि यह हमारे लिए सोच सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →