From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models
यह शोध पत्र BERT से लेकर 2026 तक विशेषीकृत फ्रंटियर एजेंटों तक भाषा मॉडलों के आठ वर्षों के विकास की समीक्षा करता है, जो कोडिंग क्षमताओं में छह गुना वार्षिक सुधार, बजट-अनुकूल GPT 5.6 Luna द्वारा उदाहरण स्वरूप दर्शाए गए इन्फरेंस लागत में नाटकीय गिरावट, और फ्रंटएंड कोडिंग, रिपॉजिटरी प्रबंधन और टर्मिनल संचालन जैसे विशिष्ट डोमेन में उत्कृष्ट कार्य करने वाले कार्य-लक्षित मॉडलों की ओर एक बदलाव को रेखांकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
महान एआई विकास: चश्मे से लेकर सुपर-कंप्यूटर तक
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर प्रतिभाशाली लेकिन शर्मीले पुस्तकालयाध्यक्षों (librarians) की तरह थे। लंबे समय तक, यदि आप चाहते थे कि वे एक वाक्य को समझें, तो आपको उन्हें उस सटीक वाक्य के लिए चश्मे की एक विशिष्ट जोड़ी देनी पड़ती थी। यदि आप चाहते थे कि वे एक कहानी लिखें, तो आपको उस जोड़ी को बदलकर दूसरी जोड़ी लगानी पड़ती थी। वे पढ़ने में अविश्वसनीय रूप से स्मार्ट थे, लेकिन वे वास्तव में अपने आप कुछ भी कर नहीं सकते थे। यह "लैंग्वेज मॉडल्स" का प्रारंभिक युग था, जो वे कंप्यूटर प्रोग्राम हैं जो मानव भाषा को समझने और उत्पन्न करने के लिए सीखते हैं।
पिछले कुछ वर्षों में, वैज्ञानिकों ने इन पुस्तकालयाध्यक्षों को बहुत बड़ा बनाने और उन्हें एक ऐसा "मस्तिष्क" देने का तरीका खोज निकाला जो केवल कुछ उदाहरणों से सीख सके, बिना हर एक कार्य के लिए नए चश्मे की आवश्यकता के। अचानक, ये कंप्यूटर चैट कर सकते थे, कोड लिख सकते थे और पहेलियाँ सुलझा सकते थे। लेकिन यहाँ वह बड़ा सवाल है जो हर कोई पूछ रहा है: क्या वे हर दिन स्मार्ट हो रहे हैं, या वे केवल परीक्षा के प्रश्नों को याद करने में बेहतर हो रहे हैं? और यदि वे स्मार्ट हो रहे हैं, तो क्या इसका मतलब है कि वे अधिक महंगे हो रहे हैं, या वे एक किफायती सौदा बनते जा रहे हैं? यह शोध पत्र उसी रहस्य में गहराई से उतरता है, जो 2018 से भविष्य की एक तिथि 2026 तक एआई प्रगति की रोमांचक यात्रा को देखता है कि वास्तव में इसके अंदर क्या हो रहा है।
चश्मे से लेकर सुपर-कंप्यूटर तक: आठ-वर्षीय रोलरकोस्टर
यह शोध पत्र एक समय-यात्रा करने वाले जासूसी कहानी की तरह है जो 2018 से 2026 तक कृत्रिम बुद्धिमत्ता (AI) के जीवन को ट्रैक करता है। यह तीन बड़े सवाल पूछता है: हम उन कंप्यूटरों से, जो मुश्किल से एक वाक्य लिख सकते थे, उन कंप्यूटरों तक कैसे पहुँचे जो सॉफ्टवेयर बग्स ठीक कर सकते हैं और गणित ओलंपियाड की समस्याओं को हल कर सकते हैं? इस "बौद्धिक शक्ति" की कीमत कितनी तेजी से गिरी? और, सबसे महत्वपूर्ण बात, क्या हमें सब कुछ करने के लिए एक विशाल, महंगे सुपर-कंप्यूटर की आवश्यकता है, या भविष्य वास्तव में विशेषज्ञ विशेषज्ञों की एक टीम है?
एआई विकास के चार युग
लेखक पिछले आठ वर्षों को चार अलग-अलग अध्यायों में विभाजित करता है, जैसे किसी वीडियो गेम में सीज़न होते हैं:
- "रीडिंग ग्लासेस" (पढ़ने वाला चश्मा) युग (2018–2019): इसकी शुरुआत BERT जैसे मॉडल्स के साथ हुई। इन्हें ऐसे छात्रों के रूप में सोचें जो एक किताब पढ़ने और उस पर प्रश्न उत्तर देने में माहिर थे, लेकिन यदि आप उनसे कहानी लिखने को कहते, तो वे ठिठक जाते। उन्हें हर कार्य के लिए एक विशिष्ट "फाइन-ट्यूनिंग" (जैसे एक विशेष प्रशिक्षण शिविर) की आवश्यकता होती थी।
- "बिग ब्रेन" (विशाल मस्तिष्क) युग (2020–2021): फिर GPT-3 जैसे मॉडल्स आए। ये विशाल पुस्तकालयों की तरह थे जिन्होंने इंटरनेट पर लगभग सब कुछ पढ़ लिया था। विशेष प्रशिक्षण की आवश्यकता के बजाय, आप बस उन्हें चैट विंडो में कुछ उदाहरण दे सकते थे, और वे पैटर्न को समझ लेते थे। वे अद्भुत थे, लेकिन वे अभी भी तथ्य गढ़ते थे और हमेशा निर्देशों का पूरी तरह से पालन नहीं कर पाते थे।
- "पोलाइट हेल्पर" (विनम्र सहायक) युग (2022–2023): वैज्ञानिकों ने इन विशाल मस्तिष्कों को "अलाइनमेंट" नामक तकनीक का उपयोग करके विनम्र बनना और आदेशों का पालन करना सिखाया। अचानक, वे ChatGPT और उसके साथियों में बदल गए—चैट करने, ईमेल लिखने और जटिल नियमों का पालन करने में माहिर।
- "एजेंट" युग (2024–2026): यहीं से चीजें रोमांचक होती हैं। मॉडल्स ने केवल बात करना बंद कर दिया और करना शुरू कर दिया। वे "एजेंट" बन गए जो टूल्स का उपयोग कर सकते थे, GitHub पर टूटे हुए कोड को ठीक कर सकते थे और चरणों के माध्यम से सोचकर गणित की समस्याओं को हल कर सकते थे। 2026 तक, सर्वश्रेष्ठ मॉडल्स इंटरनेशनल मैथ ओलंपियाड की समस्याओं को हल कर रहे थे और पूरे सॉफ्टवेयर प्रोजेक्ट्स की मरम्मत कर रहे थे।
प्रगति की गति: एक गणितीय रहस्य
यह शोध पत्र मापता है कि ये मॉडल्स वास्तविक दुनिया के सॉफ्टवेयर बग्स को ठीक करने में कितनी तेजी से बेहतर हो रहे हैं (SWE-bench नामक परीक्षण का उपयोग करके)। परिणाम चौंकाने वाला है: एक बग को सफलतापूर्वक ठीक करने की मॉडल की संभावना हर साल लगभग 5.8 गुना बढ़ रही है। यह ऐसा है जैसे यदि कोई धावक हर साल 5.8 गुना तेज होता; तो वह कुछ ही वर्षों में ध्वनि से भी तेज दौड़ने लगेगा। हालाँकि, शोध पत्र यह भी नोट करता है कि पुराने "ज्ञान परीक्षण" (जैसे MMLU) अपनी सीमा तक पहुँच रहे हैं। मॉडल्स अब उनमें इतने अच्छे हो गए हैं कि वे उन्हें एक-दूसरे से अलग बताने के लिए बेकार हो गए हैं। क्षेत्र अब कठिन, अधिक व्यावहारिक चुनौतियों की ओर बढ़ गया है।
कीमत में गिरावट: "बजट टियर" का आश्चर्य
कहानी का सबसे आश्चर्यजनक हिस्सा यहाँ है: इस बुद्धिमत्ता की लागत गिर गई है।
- 2020 में, दस लाख शब्दों के एआई विचार प्राप्त करने की लागत $60 थी।
- 2026 तक, इस विचार के "बजट" संस्करण की लागत केवल $1 है।
यह कीमतों में 60-गुना गिरावट है।
लेकिन यह और भी बेहतर है। शोध पत्र ने पाया कि 2026 के सस्ते "बजट" मॉडल्स वास्तव में कुछ महीने पहले के सुपर-महंगे "फ्लैगशिप" मॉडल्स जितने ही अच्छे हैं। यह ऐसा है जैसे आज की 500 की कार जितनी अच्छी तरह चल सके। बाजार का "मध्य" गायब हो गया है; या तो आपको सस्ता, स्मार्ट बजट टियर मिलता है या अत्यंत महंगा प्रीमियम टियर। बीच का रास्ता खत्म हो गया है।
"स्पेशलिस्ट" टीम बनाम "जैक-ऑफ-ऑल-ट्रेड्स"
लंबे समय तक, लोगों को लगा कि एक विशाल मॉडल अंततः हर चीज़ में सर्वश्रेष्ठ होगा। शोध पत्र तर्क देता है कि 2026 में, वह विचार मर चुका है। "फ्रंटियर" (सबसे अच्छा एआई) अब खंडित (fragmented) है।
- यदि आप वेबसाइट बनाना चाहते हैं, तो Claude Opus 5 चैंपियन है।
- यदि आपको एक विशाल कोड रिपॉजिटरी को ठीक करने की आवश्यकता है, तो Claude Fable 5 जीतता है।
- यदि आपको कंप्यूटर को टर्मिनल में इंसान की तरह काम करने की आवश्यकता है, तो GPT-5.6 Sol बॉस है।
- यदि आपको एक बिल्कुल नए प्रकार की तर्क पहेली को हल करने की आवश्यकता है, तो Opus 5 रिकॉर्ड-होल्डर है।
कोई भी एकल मॉडल हर चीज़ में नहीं जीतता। शोध पत्र सुझाव देता है कि अब एआई का उपयोग करने का सबसे स्मार्ट तरीका एक "रूटर" (router) होना है—एक ट्रैफिक पुलिसकर्मी जो विभिन्न कार्यों को उस विशिष्ट विशेषज्ञ मॉडल को भेजता है जो उस कार्य के लिए सबसे अच्छा है। एक सरल प्रणाली जो केवल दो मॉडल्स के बीच स्विच करती है, वास्तव में सही विशेषज्ञ को चुनकर सर्वश्रेष्ठ एकल मॉडल को भी हरा सकती है।
क्या हम एक निश्चित मॉडल को स्मार्ट बना सकते हैं?
शोधकर्ता ने यह देखने के लिए एक छोटा प्रयोग भी चलाया कि क्या वे मॉडल को बदले बिना, केवल प्रश्न पूछने के तरीके को बदलकर एक छोटे, निश्चित मॉडल को स्मार्ट बना सकते हैं।
- उन्होंने एक छोटे मॉडल (Qwen2.5-1.5B) से गणित की समस्याएँ हल करने को कहा।
- जब उन्होंने इसे एक बार पूछा ( "ग्रीडी" तरीका), तो इसने 58% सही हल किया।
- जब उन्होंने इसे चार बार पूछा और सबसे सामान्य उत्तर चुना (एक तकनीक जिसे "वोटिंग" कहा जाता है), तो इसने 62% सही हल किया।
- "सीलिंग" (यदि वे जादुई रूप से सभी चार प्रयासों में से सबसे अच्छा उत्तर चुन सकते) 79% थी।
यह सुझाव देता है कि मॉडल वास्तव में अधिकांश समय सही उत्तर जानता है, लेकिन उसे बस उसे बाहर निकालने के लिए एक बेहतर तरीके की आवश्यकता है। शोध पत्र ने एक "कॉन्फिडेंस डिटेक्टर" भी बनाया जो अनुमान लगा सकता था कि कौन से उत्तर सही होने की संभावना है। इसने पाया कि यदि आप केवल उन उत्तरों पर भरोसा करते हैं जिनके बारे में डिटेक्टर सबसे अधिक आश्वस्त था, तो आप उस छोटे समूह पर 94% सटीकता प्राप्त कर सकते हैं। यह सुझाव देता है कि भविष्य में, हमें बड़े मॉडल्स की आवश्यकता नहीं हो सकती है; हमें शायद उनके काम की जाँच करने और सर्वश्रेष्ठ को चुनने के बेहतर तरीकों की आवश्यकता होगी।
निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि "एक मॉडल जो सब पर राज करे" का युग समाप्त हो गया है। हम विशेषज्ञता और रूटिंग के युग में प्रवेश कर रहे हैं। मॉडल्स विशिष्ट कार्यों में अविश्वसनीय रूप से अच्छे हो रहे हैं, कीमत तेजी से गिर रही है, और उनका उपयोग करने का सबसे स्मार्ट तरीका उन्हें एक एकल सुपर-ब्रेन के बजाय विशेषज्ञों की एक टीम के रूप में मानना है। जबकि मॉडल्स अद्भुत हो रहे हैं, शोध पत्र चेतावनी देता है कि वे परीक्षणों को "गेम" करने में भी बहुत अच्छे हो रहे हैं, इसलिए हमें इस बात पर ध्यान देना चाहिए कि हम उन पर कितना भरोसा करते हैं। भविष्य केवल बड़े दिमागों के बारे में नहीं है; यह हमारे पास मौजूद दिमागों का बेहतर उपयोग करने के तरीकों के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।