← नवीनतम पेपर
🤖 AI

YC-Bench\texttt{YC-Bench}: Benchmarking AI Agents for Long-Term Planning and Consistent Execution

यह शोध पत्र YC-Bench\texttt{YC-Bench} का परिचय देता है, जो एक ओपन-सोर्स बेंचमार्क है जो एक सिम्युलेटेड एक-वर्षीय स्टार्टअप चुनौती के माध्यम से एआई एजेंटों की दीर्घकालिक योजना और निष्पादन क्षमताओं का मूल्यांकन करता है, जिससे यह पता चलता है कि जबकि केवल कुछ ही फ्रंटियर मॉडल लाभप्रदता प्राप्त करते हैं, सफलता काफी हद तक संदर्भ निरंतरता (context persistence) के लिए स्क्रैचपैड उपयोग और प्रतिकूल क्लाइंट्स (adversarial clients) का पता लगाने की क्षमता पर निर्भर करती है।

मूल लेखक: Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

प्रकाशित 2026-04-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक स्टार्टअप के लिए एक नया CEO रख रहे हैं। आप उन्हें $200,000 की सीड मनी देते हैं और कहते हैं, "एक साल तक इस कंपनी को चलाओ। जितना हो सके उतना मुनाफा कमाओ।"

लेकिन यहाँ एक पेंच है: आप केवल यह नहीं देख रहे हैं कि वे गणित कर सकते हैं या ईमेल लिख सकते हैं। आप यह परीक्षण कर रहे हैं कि क्या वे पिछले महीने जो हुआ उसे याद रख सकते हैं, अपनी गलतियों से सीख सकते हैं, और जब चीजें अराजक हो जाएं तो एक योजना पर टिके रह सकते हैं।

यह बिल्कुल वही है जिसके बारे में पेपर YC-Bench है। यह आर्टिफिशियल इंटेलिजेंस (AI) एजेंटों के लिए एक नया "तनाव परीक्षण" (stress test) है, यह देखने के लिए कि क्या वे बिना अपना मानसिक संतुलन खोए लंबी अवधि की योजना बना सकते हैं।

यहाँ इसका सरल विवरण दिया गया है:

1. खेल: AI के लिए "SimCity"

शोधकर्ताओं ने एक वीडियो गेम जैसा सिमुलेशन बनाया है जहाँ AI एक CEO की भूमिका निभाता है।

  • लक्ष्य: $200k से शुरुआत करें और साल के अंत में जितना संभव हो सके उतना पैसा लेकर समाप्त करें।
  • काम: AI को एक मार्केटप्लेस ब्राउज़ करना होगा, प्रोजेक्ट्स (कार्यों) को चुनना होगा, उन प्रोजेक्ट्स के लिए सही कर्मचारियों को काम पर रखना होगा, और कंपनी के कैश फ्लो को मैनेज करना होगा।
  • ट्विस्ट: यह गेम सैकड़ों "टर्न" (दिनों) तक चलता है। AI को दिन-दर-दिन निर्णय लेने होते हैं, और हर निर्णय भविष्य को प्रभावित करता है।

2. जाल: क्यों अधिकांश AI विफल हो जाते हैं

इस सिमुलेशन में, AI को दो प्रमुख चुनौतियों का सामना करना पड़ता है जो सबसे स्मार्ट मॉडल्स को भी उलझा देती हैं:

  • "बुरे ग्राहक" का जाल: गेम में लगभग एक-तिहाई क्लाइंट झूठे हैं। वे उच्च भुगतान वाले काम पेश करते हैं, लेकिन एक बार जब AI काम स्वीकार कर लेता है, तो काम अचानक पूरा करना असंभव हो जाता है।
    • उपमा: कल्पना कीजिए कि एक ग्राहक $1,000 में एक केक का ऑर्डर देता है। AI स्वीकार कर लेता है। अचानक, ग्राहक कहता है, "दरअसल, मुझे सोने से बना 50 फुट ऊंचा केक चाहिए।" AI को एहसास होता है कि उसके साथ धोखाधड़ी हुई है।
    • समस्या: अधिकांश AI भूल जाते हैं कि उनके साथ धोखाधड़ी हुई थी। दो सप्ताह बाद, वही झूठा ग्राहक वापस आता है, और AI, उस बुरे अनुभव को भूलकर, फिर से काम स्वीकार कर लेता है और पैसा गंवा देता है।
  • "मेमोरी ब्लैकआउट" (स्मृति लोप): AI का "दिमाग" (उसका बातचीत का इतिहास) सीमित है। वह केवल पिछले 20 दिनों को याद रख सकता है। उसके बाद, पुरानी यादें हटा दी जाती हैं।
    • उपमा: यह स्मृति लोप (short-term memory loss) वाले CEO की तरह है। यदि वे अपनी नोटबुक में "बॉब को काम पर न रखें" नहीं लिखते हैं, तो वे अगले सप्ताह फिर से बॉब को काम पर रख लेंगे।
    • समाधान: जीवित रहने का एकमात्र तरीका एक "स्क्रैचपैड" (डिजिटल नोटबुक) का उपयोग करना है। AI को अपने नियम लिखने होंगे, जैसे "क्लाइंट X से बचें" या "कर्मचारी Y कोडिंग में बहुत अच्छा है," और हर दिन उस नोटबुक को पढ़ना होगा।

3. परिणाम: दौड़ में कौन जीता?

शोधकर्ताओं ने 12 अलग-अलग AI मॉडल्स का परीक्षण किया (OpenAI, Google, Anthropic आदि के बड़े नामों सहित)।

  • हारने वाले: अधिकांश मॉडल्स दिवालिया हो गए। या तो वे बुरे ग्राहकों के कारण बार-बार ठगे गए, या उन्होंने गलत लोगों को काम पर रखा, या वे बस अपनी योजनाओं को भूल गए। उन्होंने ऐसे व्यवहार किया जैसे वे बिना किसी दीर्घकालिक रणनीति के केवल वर्तमान क्षण में जी रहे हों।
  • विजेता: केवल 3 मॉडल्स ही मुनाफा कमाने में सफल रहे।
    • Claude Opus 4.6 चैंपियन था, जिसने $1.27 मिलियन के साथ समापन किया। यह किसे टालना है और किस पर भरोसा करना है, यह याद रखने के लिए अपने "नोटबुक" का उपयोग करने में सबसे बेहतर था।
    • GLM-5 दूसरे स्थान पर रहा, जिसने $1.21 मिलियन कमाए, लेकिन इसने बहुत कम लागत (कम कंप्यूटिंग पावर) में ऐसा किया।
    • "लागत-प्रभावी" विजेता: दिलचस्प बात यह है कि Kimi-K2.5 नाम का मॉडल कच्चे डॉलर में सबसे अधिक लाभदायक नहीं था, लेकिन यह सबसे कुशल था। इसने AI चलाने के लिए खर्च किए गए प्रत्येक डॉलर के बदले सबसे अधिक पैसा बनाया।

4. सबसे बड़ा सबक: "सोचना" बनाम "करना"

सबसे आश्चर्यजनक खोज केवल यह नहीं थी कि किसने सबसे ज्यादा पैसा बनाया; बल्कि यह थी कि वे कैसे विफल हुए।

शोधकर्ताओं ने पाया कि कई AI "रीजनिंग-एग्जीक्यूशन गैप" (तर्क-कार्यान्वयन अंतराल) से ग्रस्त हैं।

  • उपमा: कल्पना कीजिए कि एक छात्र अपनी नोटबुक में एक आदर्श अध्ययन योजना लिखता है: "मैं 2 घंटे गणित पढ़ूंगा।" लेकिन फिर, वह तुरंत नोटबुक बंद करता है और वीडियो गेम खेलने चला जाता है।
  • निष्कर्ष: कई AI अपने स्क्रैचपैड में सही रणनीति लिख सकते हैं ("क्लाइंट X से बात न करें!"), लेकिन फिर वे अपनी ही सलाह को अनदेखा कर देते हैं और क्लाइंट X से बात करने लगते हैं। उनके पास ज्ञान तो है, लेकिन उस पर टिके रहने का अनुशासन नहीं है।

सारांश

YC-Bench AI के लिए एक वास्तविकता की जांच है। यह दिखाता है कि जबकि AI सवाल पूछने या कोड लिखने में बहुत अच्छा हो रहा है, यह अभी भी एक लंबी अवधि के लिए व्यवसाय चलाने के लिए संघर्ष कर रहा है।

सफल होने के लिए, एक AI को केवल स्मार्ट होने से कहीं अधिक होना चाहिए; उसे सुसंगत (consistent) होना चाहिए। उसे एक डायरी रखने, अपने अनुभवों से सीखने और अपने द्वारा लिखे गए नियमों का वास्तव में पालन करने की आवश्यकता है। जब तक AI विश्वसनीय रूप से ऐसा नहीं कर पाता, हम इसे अपने आप जटिल, दीर्घकालिक परियोजनाओं को चलाने के लिए भरोसेमंद नहीं मान सकते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →