← नवीनतम पेपर
💻 computer science

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

यह शोध पत्र SOP-Maze को पेश करता है, जो वास्तविक व्यावसायिक डेटा से प्राप्त एक नया बेंचमार्क है जो कार्यों को पार्श्व (lateral) और गहन (deep) तर्क चुनौतियों में वर्गीकृत करके जटिल मानक संचालन प्रक्रियाओं (SOPs) पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जो अत्याधुनिक मॉडल्स में रूट ब्लाइंडनेस (route blindness), संवादात्मक भंगुरता (conversational fragility) और गणना संबंधी त्रुटियों की महत्वपूर्ण कठिनाइयों को उजागर करता है।

मूल लेखक: Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

प्रकाशित 2026-01-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित रोबोट को एक विशिष्ट कार्य करना सिखा रहे हैं, जैसे कि एक कस्टमर सर्विस एजेंट या सेल्सपर्सन के रूप में काम करना। आप उस रोबोट को एक मोटी नियम पुस्तिका देते हैं जिसे स्टैंडर्ड ऑपरेटिंग प्रोसीजर (SOP) कहा जाता है। यह केवल "यह करो, फिर वह करो" जैसी सरल सूची नहीं है। यह सैकड़ों "यदि-तो" (if-then) शाखाओं वाला एक जटिल भूलभुलैया है, जैसे कि एक 'चूज़-योर-ओन-एडवेंचर' किताब, जहाँ एक गलत मोड़ आपको गलत रास्ते पर ले जा सकता है।

शोध पत्र "SOP-Maze" यह परीक्षण करने का एक नया तरीका पेश करता है कि क्या ये AI रोबोट वास्तव में वास्तविक दुनिया की इन व्यावसायिक नियमावलियों के बीच बिना भटके नेविगेट कर सकते हैं।

यहाँ शोधकर्ताओं द्वारा किए गए कार्यों और उनकी खोजों का एक सरल विवरण दिया गया है:

1. नया परीक्षण: SOP-Maze

शोधकर्ताओं ने AI मॉडल्स के लिए एक "जिम" बनाया जिसे SOP-Maze कहा गया।

  • स्रोत (The Source): काल्पनिक नियम बनाने के बजाय, उन्होंने एक कंपनी के आंतरिक व्यावसायिक लॉग से 3,00,000 वास्तविक रिकॉर्ड लिए। उन्होंने इन्हें साफ किया ताकि 397 वास्तविक दुनिया के परिदृश्य (जैसे कि एक सेल्स कॉल या ग्राहक की शिकायत) बनाए जा सकें जिनमें 3,422 सूक्ष्म चरण शामिल थे।
  • लक्ष्य: यह देखना कि क्या एक AI एक लंबी, जटिल नियम पुस्तिका पढ़ सकता है, एक शोर-शराबे वाली मानवीय बातचीत को सुन सकता है, और सही उत्तर प्राप्त करने के लिए आवश्यक सटीक पथ का पालन कर सकता है।

2. दो प्रकार की भूलभुलैया (Mazes)

शोधकर्ताओं ने महसूस किया कि व्यावसायिक नियम दो प्रकार के होते हैं, इसलिए उन्होंने परीक्षण को दो श्रेणियों में विभाजित किया (एक पौधे के रूपक का उपयोग करते हुए):

  • लैटरल रूट सिस्टम (LRS) – "चौड़ी" भूलभुलैया:
    • रूपक: एक ऐसे पेड़ की कल्पना करें जिसका तना उथला है लेकिन सैकड़ों शाखाएं चौड़ाई में फैली हुई हैं।
    • चुनौती: AI को कई संभावनाओं में से केवल एक सही शाखा को चुनना होता है। यह एक चौराहे पर खड़े होने जैसा है जहाँ 10 अलग-अलग संकेत मौजूद हैं और आपको तुरंत सही वाला चुनना है। यदि आप गलत चुनते हैं, तो आप फंस जाते हैं।
  • हार्ट रूट सिस्टम (HRS) – "गहरी" भूलभुलैया:
    • रूपक: एक ऐसे पेड़ की कल्पना करें जिसकी जड़ें बहुत गहरी और घुमावदार हैं जो जमीन के नीचे तक जाती हैं।
    • चुनौती: AI को तर्क की एक लंबी, जटिल श्रृंखला का पालन करना होता है। चरण A होना चाहिए, फिर चरण B, जिसके बाद चरण C आता है। यदि AI बातचीत के 10 मिनट पहले के किसी चरण को भूल जाता है, तो पूरी श्रृंखला टूट जाती है।

3. परिणाम: रोबोट रास्ता भटक रहे हैं

शोधकर्ताओं ने 18 सबसे स्मार्ट उपलब्ध AI मॉडल्स का परीक्षण किया (जिनमें OpenAI, Anthropic और अन्य के शीर्ष मॉडल्स शामिल हैं)। परिणाम आश्चर्यजनक थे: लगभग सभी ने संघर्ष किया।

यहाँ तक कि "सबसे बुद्धिमान" मॉडल्स भी व्यावसायिक नियमों का विश्वसनीय रूप से पालन नहीं कर सके। शोधकर्ताओं ने पाया कि रोबots के विफल होने के तीन मुख्य कारण थे:

A. रूट ब्लाइंडनेस (नक्शे में खो जाना)

  • समस्या: AI नक्शा तो देखता है लेकिन पथ का अनुसरण नहीं कर पाता।
  • चौड़ी भूलभुलैया में: यह बहुत सारे विकल्पों से अभिभूत हो जाता है और शुरुआत में ही गलत शाखा चुन लेता है, फिर खुद को सुधारने से इनकार कर देता है।
  • गहरी भूलभुलैया में: यह अधीर हो जाता है और "आगे की ओर कूदने" (skip ahead) लगता है। यह मान लेता है कि इसने वह चरण पहले ही पूरा कर लिया है जिसे इसने वास्तव में अभी तक नहीं किया है, जिससे गलत निष्कर्ष निकलता है।

B. कन्वर्सेशनल फ्रैजिलिटी (मानवीय गपशप में विफल होना)

  • समस्या: AI बहुत शाब्दिक (literal) है और वास्तविक मानवीय बातचीत की अव्यवस्था को नहीं संभाल पाता।
  • बारीकी (Nuance): मनुष्य अपना मन बदलते हैं, व्यंग्य करते हैं, या खुद को बीच में ही रोक लेते हैं।
    • उदाहरण: एक उपयोगकर्ता क्रोधित होकर शुरू कर सकता है ("मैं शिकायत करने वाला हूँ!") लेकिन फिर शांत हो सकता है ("छोड़ो, मैं इसे जाने दूँगा")। AI उस बदलाव को अनदेखा कर देता है और क्रोधित व्यवहार जारी रखता है।
    • उदाहरण: एक उपयोगकर्ता व्यंग्य में कह सकता है, "हाहा, हाँ, बिल्कुल,"। AI इसे वास्तविक "हाँ" मान लेता है और गलत कार्रवाई के साथ आगे बढ़ जाता है।

C. कैलकुलेशन एरर्स (संदर्भ में गणित में गलती)

  • समस्या: AI गणित या समय की गणना करने में खराब है जब वे एक लंबी बातचीत के भीतर छिपे होते हैं।
  • बारीकी: यदि आप पूछते हैं, "दोपहर 1:00 बजे और 1:05 बजे के बीच कितने मिनट बीते?" तो AI इसे सही कर लेगा। लेकिन यदि यह प्रश्न डिलीवरी में देरी के बारे में 20-चरणों वाली लंबी बातचीत के बीच छिपा हुआ है, तो AI अक्सर टाइमस्टैम्प को देखना भूल जाता है या समय की गलत गणना करता है।

4. निष्कर्ष (The Takeaway)

शोध पत्र यह निष्कर्ष निकालता है कि हालांकि AI मॉडल कविता लिखने या सामान्य प्रश्न पूछने में बेहतरीन हैं, लेकिन वे वर्तमान में जटिल व्यावसायिक वातावरण में पेशेवर एजेंट के रूप में कार्य करने के लिए पर्याप्त विश्वसनीय नहीं हैं। उनमें मानवीय बातचीत की विचित्रताओं से विचलित हुए बिना सख्त, बहु-चरणीय प्रक्रियाओं का पालन करने के लिए "मसल्स मेमोरी" (muscle memory) की कमी है।

लेखकों ने अपने टेस्ट डेटा और कोड (SOP-Maze) को सार्वजनिक कर दिया है ताकि अन्य शोधकर्ता इसका उपयोग बेहतर, अधिक विश्वसनीय AI बनाने के लिए कर सकें जो वास्तव में वास्तविक दुनिया के नियमों का पालन कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →