Can LLMs Be CEOs? Benchmarking Strategic Resource Reallocation with Multi-Role Agent Simulation
यह शोध पत्र \textsc{CEO-Bench} प्रस्तुत करता है, जो एक मल्टी-एजेंट बेंचमार्क है जो विरोधाभासी हितधारक सलाह के तहत रणनीतिक संसाधन पुनर्वितरण पर LLMs का मूल्यांकन करता है, जिससे यह प्रकट होता है कि जहाँ फ्रंटियर मॉडल संरचनात्मक रूप से वैध योजनाएँ बना सकते हैं, वहीं वे सलाहकार कैप्चर (advisor capture) और विविध दृष्टिकोणों को एकीकृत करने तथा निर्णायक कार्रवाई करने के बीच के ट्रेड-ऑफ जैसी व्यवस्थित विफलताओं के कारण रणनीतिक अंशांकन (strategic calibration) में संघर्ष करते हैं।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, जटिल जहाज के कप्तान हैं। आप केवल दिशा ही नहीं मोड़ रहे हैं; आपको अपने सीमित ईंधन, भोजन और चालक दल को चार अलग-अलग विभागों के बीच विभाजित करने का निर्णय भी लेना है: इंजन रूम, नेविगेशन टीम, कार्गो हैंडलर्स और पैसेंजर सर्विस क्रू।
यह शोध पत्र एक सरल लेकिन कठिन प्रश्न पूछता है: क्या एक AI (विशेष रूप से एक लार्ज लैंग्वेज मॉडल) उस कप्तान की भूमिका निभा सकता है?
यह पता लगाने के लिए, शोधकर्ताओं ने एक परीक्षण बनाया जिसे CEO-BENCH कहा गया। उन्होंने इसे कैसे किया, इसका विवरण रोजमर्रा की भाषा में यहाँ दिया गया है:
सेटअप: रोबोटों का एक बोर्डरूम
AI से कोई साधारण गणितीय समस्या या सामान्य ज्ञान का प्रश्न पूछने के बजाय, उन्होंने उसे एक सिम्युलेटेड कॉर्पोरेट बोर्डरूम में रख दिया।
- AI ही CEO है: उसे कंपनी में पैसा इधर-उधर करने के अंतिम निर्णय लेने होते हैं।
- सलाहकार भी AI हैं: AI CEO को चार अन्य "रोबोट अधिकारियों" (एक CFO, CTO, COO, और CMO) को सुनना होता है।
- चुनौती यह है: इन सलाहकारों को असहमत होने के लिए प्रोग्राम किया गया है।
- CFO (मनी मैनेजर) जोखिम से डरता है और पैसा बचाना चाहता है।
- CTO (टेक बॉस) नए गैजेट्स पर भारी खर्च करना चाहता है।
- COO (ऑपरेशंस बॉस) इस बात से चिंतित है कि यदि चीजें बहुत तेजी से बदलीं तो चीजें बिगड़ सकती हैं।
- CMO (मार्केटिंग बॉस) बिक्री का एक बड़ा अवसर देखता है और अभी भारी खर्च करना चाहता है।
महत्वपूर्ण बात यह है कि प्रत्येक सलाहकार केवल सच का एक छोटा सा हिस्सा जानता है (सूचना की विषमता)। AI CEO को यह समझना होगा कि कौन सही है, कौन गलत है, और कंपनी को दुर्घटनाग्रस्त किए बिना उनके विरोधाभासी सुझावों के बीच संतुलन कैसे बनाया जाए।
परीक्षण: 13 विभिन्न परिदृश्य
शोधकर्ताओं ने AI द्वारा हल करने के लिए 13 अलग-अलग "संकट" स्थितियां बनाईं। कुछ आसान थे (जहाँ सभी सहमत थे), और कुछ बहुत उलझे हुए थे (जहाँ सभी लड़ रहे थे, और कंपनी मुसीबत में थी)।
- लक्ष्य: AI को एक योजना बनानी थी कि एक विभाग से दूसरे विभाग में पैसा कैसे स्थानांतरित किया जाए।
- नियम: योजना कानूनी होनी चाहिए (नियमों का पालन करती हो), इतनी साहसी होनी चाहिए कि उसका महत्व हो, और कंपनी ने पिछले दौरों में जो किया था उसके साथ सुसंगत होनी चाहिए (इतिहास को भूलना नहीं है)।
परिणाम: गणित में अच्छे, लेकिन 'अंतर्ज्ञान' में कमजोर
शोधकर्ताओं ने पांच अलग-अलग शीर्ष-स्तरीय AI मॉडलों का परीक्षण किया। उन्होंने क्या पाया, यहाँ देखें:
- वे नियमों का पालन करने में माहिर हैं: लगभग सभी AI ऐसे प्लान बनाने में सक्षम थे जो गणित या नियमों को नहीं तोड़ते थे। यदि आपने उनसे "10% पैसा स्थानांतरित करने" के लिए कहा, तो वे गणित बिल्कुल सही कर सकते थे।
- वे "अंतर्ज्ञान" (रणनीतिक साहस) के लिए संघर्ष करते हैं: यह सबसे कठिन हिस्सा था। जब स्थिति में कंपनी को बचाने के लिए एक जोखिम भरे, साहसी कदम की आवश्यकता थी, तो AI अक्सर बहुत डरे हुए रहे। उन्होंने अक्सर सुरक्षित, उबाऊ विकल्प को चुना, भले ही स्थिति जुआ खेलने की मांग कर रही थी।
- वे "भुलक्कड़" हो जाते हैं: एक मल्टी-राउंड गेम में, कुछ AI भूल गए कि पिछले राउंड में क्या हुआ था। वे आज ऐसा निर्णय ले सकते थे जो उनके कल के निर्णय के विपरीत हो, जैसे कि एक कप्तान जो भूल गया कि उसने पहले ही आधा ईंधन जला दिया है।
- वे एक आवाज़ के "वश में" हो जाते हैं: कभी-कभी, चारों सलाहकारों के बीच संतुलन बनाने के बजाय, AI बस सबसे तेज़ आवाज़ (आमतौर पर विकास के लिए चिल्लाने वाले या सुरक्षा के लिए चिल्लाने वाले) का अंधाधुंध अनुसरण करता था और बाकी सबको अनदेखा कर देता था।
एक बड़ा समझौता (Trade-Off)
शोध पत्र ने एक दिलचस्प विरोधाभास का पता लगाया:
- वे AI जो सभी की बात सुनने और बीच का रास्ता खोजने में वास्तव में अच्छे थे, वे अक्सर कमजोर, अनिर्णायक योजनाएं बनाते थे।
- वे AI जिन्होंने साहसिक, निर्णायक योजनाएं बनाईं, उन्होंने अक्सर अन्य सलाहकारों की महत्वपूर्ण चेतावनियों को अनदेखा कर दिया।
निष्कर्ष
क्या एक AI, CEO बन सकता है?
- एक कैलकुलेटर के रूप में? हाँ। यह नंबरों की जांच करने और यह सुनिश्चित करने में उत्कृष्ट है कि योजना कानूनी है।
- एक नेता के रूप में? अभी पूरी तरह से नहीं। यह विरोधाभासी मानवीय भावनाओं को तौलने, अनिश्चितता को संभालने और डेटा अस्त-व्यस्त होने पर "अंतर्ज्ञान वाला फैसला" लेने में संघर्ष करता है। यह या तो बहुत सतर्क रहता है या किसी एक तेज़ आवाज़ से आसानी से प्रभावित हो जाता है।
शोध पत्र निष्कर्ष निकालता है कि हालांकि AI तर्क करने में बेहतर हो रहा है, लेकिन "दबाव में विरोधाभासी सलाह को एकीकृत करने" का विशिष्ट कौशल अभी भी एक मानवीय विशेषज्ञता है जिसे AI ने अभी तक पूरी तरह से महारत हासिल नहीं की है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।