← नवीनतम पेपर
🤖 AI

Measuring AI Ability to Complete Long Software Tasks

यह शोध पत्र मानव प्रयास के साथ उनकी तुलना करके एआई (AI) क्षमताओं को मापने के लिए "50%-कार्य-पूर्णता समय क्षितिज" (50%-task-completion time horizon) मीट्रिक प्रस्तुत करता है, जिसमें यह पाया गया है कि फ्रंटियर मॉडल अब उन कार्यों को 50 मिनट में पूरा कर सकते हैं जिन्हें पूरा करने में मनुष्यों को आमतौर पर 50 मिनट लगते हैं, और यह दोगुना होने का रुझान सुझाव देता है कि एआई पांच वर्षों के भीतर महीने भर के सॉफ्टवेयर कार्यों को स्वचालित कर सकता है।

मूल लेखक: Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkov
प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Chris Painter, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक इंसान और एक रोबोट के बीच दौड़ देख रहे हैं, लेकिन वे ट्रैक पर नहीं दौड़ रहे, बल्कि दोनों सॉफ्टवेयर पहेलियों के एक विशाल, लगातार बढ़ते ढेर को हल करने की कोशिश कर रहे हैं। वर्षों से, हम इन एआई रोबोटों को जटिल परीक्षणों का उपयोग करके मापने की कोशिश कर रहे हैं, लेकिन वे परीक्षण अक्सर कृत्रिम वीडियो गेम स्तरों की तरह महसूस होते हैं जो हमें वास्तव में यह नहीं बताते कि रोबोट वास्तविक दुनिया में वास्तव में कितनी तेजी से काम कर सकता है।

इसे ठीक करने के लिए, METR के शोधकर्ताओं की एक टीम ने कुछ बहुत ही सहज चीज़ मापने का निर्णय लिया: एक एआई काम करने से पहले कितनी देर तक चल सकता है?

उन्होंने इसे "टाइम होराइजन" (समय क्षितिज) नाम दिया। इसे बुद्धिमत्ता की बैटरी लाइफ की तरह समझें। यदि कोई एआई एक ऐसी पहेली को हल कर सकता है जिसे पूरा करने में इंसान को 10 मिनट लगते हैं, तो उसका टाइम होराइजन 10 मिनट है। यदि वह एक ऐसे कार्य को संभाल सकता है जिसमें इंसान को 4 घंटे लगते हैं, तो उसका होराइजन 4 घंटे है। शोधकर्ता उस विशिष्ट बिंदु को खोजना चाहते थे जहाँ एआई के पास काम को सही ढंग से पूरा करने की 50% संभावना हो।

बड़ी खोज: घातांकीय विस्फोट (The Exponential Explosion)

टीम ने 170 अलग-अलग कार्यों का एक विशाल संग्रह इकट्ठा किया, जो 1-सेकंड की छोटी जाँचों (जैसे किसी विशिष्ट फ़ाइल नाम को पहचानना) से लेकर 8-घंटे के बड़े शोध प्रोजेक्ट्स तक फैले हुए थे। उन्होंने कुशल मानव विशेषज्ञों को यह समय देने के लिए काम पर रखा कि उन्हें ये कार्य पूरा करने में कितना समय लगा। फिर, उन्होंने 12 अलग-अलग एआई मॉडल को, पुराने GPT-2 (जो 2019 में रिलीज़ हुआ था) से लेकर बिल्कुल नए o3 (जो 2025 में रिलीज़ हुआ) तक, इन कार्यों को हल करने के लिए छोड़ा।

यहाँ चौंकाने वाली बात है: एआई की "बैटरी लाइफ" हर सात महीने में दोगुनी हो रही है।

2019 में, सबसे अच्छा एआई केवल उन कार्यों को विश्वसनीय रूप से संभाल सकता था जिन्हें पूरा करने में इंसान को लगभग 2 सेकंड लगते थे। 2025 तक, शीर्ष मॉडल (जैसे o3) उन कार्यों को संभाल सकते हैं जिनमें इंसान को लगभग 110 मिनट (लगभग दो घंटे) लगते हैं, और उनकी सफलता दर 50% है।

शोधकर्ताओं ने पाया कि यह विकास केवल थोड़ा तेज़ नहीं है; यह एक घातांकीय वक्र (exponential curve) है। यह एक पहाड़ी से लुढ़कते हुए स्नोबॉल की तरह है, जो हर बार एक निश्चित पेड़ के पास से गुजरते ही दोगुना बड़ा हो जाता है। उन्होंने 2019 से 2025 तक इस रुझान को मापा और पाया कि "दोगुना होने का समय" लगभग 207 दिन (लगभग सात महीने) है।

वे बेहतर क्यों हो रहे हैं?

पेपर सुझाव देता है कि एआई केवल एक अस्पष्ट तरीके से "स्मार्ट" नहीं हो रहा है; यह विशिष्ट, व्यावहारिक कौशल में बेहतर हो रहा है। जब शोधकर्ताओं ने देखा कि पुराने मॉडल क्यों विफल हुए और नए मॉडल क्यों सफल हुए, तो उन्होंने पाया कि नए मॉडल:

  • टूल्स (उपकरणों) का उपयोग करने में बेहतर हैं: वे बिना उन्हें तोड़े कैलकुलेटर या कोड एडिटर का उपयोग करना जानते हैं।
  • गलतियों को सुधारने में बेहतर हैं: यदि एक पुराना एआई गलती करता था, तो वह अक्सर उसी त्रुटि को बार-बार दोहराता था। नए मॉडल उस त्रुटि को पहचान सकते हैं, "ओप्स" कह सकते हैं, और एक अलग रास्ता अपना सकते हैं।
  • तार्किक तर्क (Logical Reasoning) में बेहतर हैं: वे बिना भटके विचार की श्रृंखला का पालन कर सकते हैं।

"मेसी" (अव्यवस्थित) चेतावनी: वास्तविक जीवन कठिन है

हालाँकि, पेपर बहुत सावधानी से कहता है कि रोबोटों ने अभी युद्ध नहीं जीता है। शोधकर्ता स्पष्ट रूप रूप से तर्क देते हैं कि ये परीक्षण बहुत अधिक "साफ-सुथरे" हो सकते हैं।

कल्पना कीजिए कि एआई एक वीडियो गेम खेल रहा है जहाँ नियम एक स्पष्ट मैनुअल में लिखे गए हैं, दुश्मन अनुमानित हैं, और अचानक बिजली कटौती जैसी कोई समस्या नहीं है। शोधकर्ता वास्तविक दुनिया के काम को "मेसी" (अव्यवस्थित/अव्यवस्थित) कहते हैं। वास्तविक दुनिया में, कार्यों में अक्सर अस्पष्ट निर्देश होते, लोगों से बात करने की आवश्यकता होती, या ऐसे संसाधन शामिल होते जो समाप्त हो सकते हैं।

जब टीम ने एआई का परीक्षण उन कार्यों पर किया जो अधिक "मेसी" (कम संरचित, अधिक अराजक) थे, तो एआई का प्रदर्शन काफी गिर गया। पेपर सुझाव देता है कि जबकि एआई "साफ" पहेलियों में बहुत अच्छा हो रहा है, यह एक वास्तविक सॉफ्टवेयर इंजीनियर के दिन की अराजक, अप्रत्याशित प्रकृति के साथ संघर्ष कर सकता है। उन्होंने कोई सबूत नहीं पाया कि "मेसी" कार्यों पर एआई का सुधार धीमा हो रहा है, लेकिन वे चेतावनी देते हैं कि "साफ टेस्ट" और "मेसी वास्तविकता" के बीच का अंतर एक बड़ा अज्ञात तथ्य है।

भविष्य के लिए इसका क्या अर्थ है?

शोधकर्ताओं ने यह देखने के लिए कुछ गणितीय गणना की कि यह वक्र कहाँ जाता है। यदि सात महीने में दोगुना होने का यह रुझान जारी रहता है, तो वे भविष्यवाणी करते हैं कि 5 वर्षों के भीतर (2028 के मध्य और 2031 के मध्य के बीच), एआई सिस्टम स्वायत्त रूप से उन सॉफ्टवेयर कार्यों को पूरा करने में सक्षम हो सकते हैं जिन्हें पूरा करने में वर्तमान में एक इंसान को एक महीना (लगभग 167 कार्य घंटे) लगता है।

वे इस बात पर जोर देते हैं कि यह एक प्रक्षेपण (projection) है, गारंटी नहीं। यह इस पर निर्भर करता है कि क्या एआई इसी सटीक गति से सुधार करना जारी रखता है और क्या वे "साफ" टेस्ट परिणाम "मेसी" वास्तविक दुनिया पर लागू होते हैं। यदि रुझान बना रहता है, तो हम ऐसे एआई एजेंट देख सकते हैं जो जटिल परियोजनाओं पर वास्तव में पूर्णकालिक कर्मचारियों के रूप में काम कर सकते हैं। लेकिन यदि रुझान धीमा हो जाता है या वास्तविक जीवन की "मेसी" प्रकृति बहुत कठिन साबित होती है, तो यह समय सीमा बदल सकती है।

निचोड़ (The Bottom Line)

पेपर यह दावा नहीं करता कि एआई ने सब कुछ हल कर लिया है। इसके बजाय, यह हमें प्रगति को मापने के लिए एक नया पैमाना देता है। यह दिखाता है कि पिछले छह वर्षों में, लंबे, जटिल कार्यों को संभालने की एआई की क्षमता बहुत तेज़ गति से बढ़ी है, जो लगभग हर सात महीने में अपने "कार्य दिवस" को दोगुना कर रही है। हालांकि वास्तविक दुनिया की अराजकता को संभालने में अभी भी बड़े अंतर हैं, लेकिन प्रक्षेपवक्र (trajectory) बताता है कि जिस दिन एक एआई अपने दम पर एक महीने की शिफ्ट कर सकता है, वह उम्मीद से अधिक करीब हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →