← नवीनतम पेपर
💬 NLP

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

यह शोध पत्र SIMMER को प्रस्तुत करता है, जो एक मानव-क्यूरेटेड प्रतीकात्मक विश्व मॉडल (symbolic world model) का उपयोग करने वाला एक किचन-डोमेन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान LLM प्लानर अक्सर अनदेखे गुप्त विफलताओं (latent failures) के कारण अपूरणीय क्षति पहुँचाते हैं, और साथ ही यह प्रदर्शित करता है कि स्पष्ट प्रतितथ्यात्मक अवस्था तर्क (counterfactual state reasoning) इन जोखिमों को काफी हद तक कम कर सकता है।

मूल लेखक: Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

प्रकाशित 2026-06-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बेहद बुद्धिमान लेकिन थोड़े लापरवाह रोबोट शेफ को चिकन सलाद बनाने के लिए काम पर रखा है। आप उसे एक सरल निर्देश देते हैं: "चिकन सलाद बनाओ।" रोबोट सिर हिलाता है, चाकू निकालता है, कच्चे चिकन को काटता है, उसे तलता है, और फिर—उसी चॉपिंग बोर्ड को धोए बिना—उसी बोर्ड का उपयोग ताजी लेट्यूस (सलाद पत्ता) काटने के लिए करता है।

रोबोट के लिए, हर एक कदम बिल्कुल सही दिखता है। उसने चिकन लिया, उसे काटा, उसे पकाया, उसने लेट्यूस लिया, उसे काटा। कोई भी कदम "अवैध" नहीं था। रोबोट ने पत्थर काटने या भूत पकड़ने की कोशिश नहीं की। लेकिन परिणाम क्या रहा? एक सलाद जो अब कच्चे चिकन के बैक्टीरिया से दूषित हो चुका है। रोबोट विफल हुआ, लेकिन इसलिए नहीं कि उसने कोई बड़ी, स्पष्ट गलती की। वह इसलिए विफल हुआ क्योंकि उसे यह अहसास नहीं था कि चॉपिंग बोर्ड का इतिहास मायने रखता था।

यही वह मुख्य समस्या है जिसे SIMMER पेपर हल करने की कोशिश कर रहा है।

समस्या: "खामोश" गलती

AI प्लानर्स (रोबोट के पीछे का दिमाग) के लिए अधिकांश परीक्षण केवल तत्काल विफलताओं (Immediate Failures) की जांच करते हैं। ये स्पष्ट और शोर मचाने वाली गलतियाँ होती हैं, जैसे दूसरे हाथ में चाकू पकड़े हुए सब्जी काटने की कोशिश करना, या ऐसे फ्रिज को खोलने की कोशिश करना जो पहले से ही खुला है। यदि AI ये गलतियाँ करता है, तो परीक्षण तुरंत रुक जाता है और AI को "फेल" ग्रेड दिया जाता है।

लेकिन यह पेपर तर्क देता है कि असली खतरा सुप्त विफलताओं (Latent Failures) में छिपा है। ये खामोश हत्यारे हैं।

  • उपमा: जेन्गा (Jenga) के खेल के बारे में सोचें। तत्काल विफलता पहली चाल में ही टावर को गिरा देना है। एक सुप्त विफलता वह ब्लॉक निकालना है जो उस समय तो ठीक लग रहा है, लेकिन वह संरचना को कमजोर कर देता है जिससे तीन चालों बाद टावर ढह जाता है।
  • वास्तविकता: रसोई में, एक सुप्त विफलता एक साफ प्लेट पर गंदा स्पंज इस्तेमाल करना है। स्पंज ठीक से काम करता है (वह गीला और साबुन वाला है), और प्लेट को पोंछा जाता है। लेकिन बैक्टीरिया अब प्लेट पर आ गए हैं। AI ने खेल के नियमों को नहीं तोड़ा, लेकिन उसने परिणाम की सुरक्षा को तोड़ दिया। इससे भी बुरा यह है कि इनमें से कुछ विफलताएं अपरिवर्तनीय (Irreversible) होती हैं। एक बार लेट्यूस पर बैक्टीरिया आ गए, तो आप उसे "अनडू" नहीं कर सकते। सलाद बर्बाद हो गया है, और कोई भी री-प्लानिंग इसे ठीक नहीं कर सकती।

समाधान: SIMMER (सुपर-स्ट्रिक्ट किचन सिम्युलेटर)

लेखकों ने एक नया परीक्षण क्षेत्र बनाया जिसे SIMMER कहा जाता है। केवल AI को चरणों की सूची लिखने के लिए कहने के बजाय, उन्होंने एक सिंबोलिक वर्ल्ड मॉडल (Symbolic World Model) बनाया।

  • वर्ल्ड मॉडल: एक अत्यधिक विस्तृत रसोई के नियम पुस्तिका की कल्पना करें। यह जानता है कि इसमें 77 अलग-अलग क्रियाएं (काटना, तलना, धोना) और 262 अलग-अलग वस्तुएं (चिकन, चाकू, चॉपिंग बोर्ड) हैं। यह 46,800 संभावित इंटरैक्शन को ट्रैक करता है। यह जानता है कि कच्चा मांस किसी सतह को "गंदा" बना देता है और "गंदी" सतहें अन्य भोजन को भी "गंदा" बना देती हैं।
  • स्टेट मशीन एक्जीक्यूटर (State Machine Executor): यह एक रेफरी है। यह केवल AI के प्लान को पढ़ता नहीं है; यह सिमुलेशन में चरण-दर-चरण प्लान को चलाता है। यह देखता है कि चॉपिंग बोर्ड गंदा हो रहा है, यह देखता है कि बैक्टीरिया फैल रहे हैं, और यह प्लान को विफलता के रूप में चिह्नित करता, भले ही हर एक कदम बुनियादी नियमों का पालन करता हो।

उन्होंने क्या पाया: AI अच्छा है, लेकिन सुरक्षित नहीं है

शोधकर्ताओं ने छह सबसे स्मार्ट उपलब्ध AI मॉडल्स (शीर्ष-स्तरीय कमर्शियल और ओपन-सोर्स मॉडल्स सहित) का 100 अलग-अलग कुकिंग टास्क पर परीक्षण किया। परिणाम निराशाजनक थे:

  1. "परफेक्ट प्लान" दुर्लभ है: यहाँ तक कि सर्वश्रेष्ठ AI मॉडल्स भी 17% से भी कम समय में पूरी तरह से त्रुटि-रहित प्लान बना पाए।
  2. सुप्त विफलताएं हर जगह हैं: लगभग 56% प्लान्स में ये खामोश, सुप्त विफलताएं मौजूद थीं।
  3. अपरिवर्तनीय जाल (Irreversible Trap): उन सुप्त विफलताओं का एक बड़ा हिस्सा अपरिवर्तनीय आपदाओं (जैसे दूषित सलाद) की ओर ले गया। AI को यह नहीं पता था कि वह स्वास्थ्य संबंधी खतरा पैदा कर रहा है क्योंकि वह केवल रेसिपी के "चरणों" को ट्रैक कर रहा था, दुनिया की "अवस्था" (state) को नहीं।

वे क्यों विफल होते हैं?
पेपर ने पाया कि AI मॉडल "क्या" (चिकन काटना) में तो अच्छे हैं लेकिन "संदर्भ" (चिकन कच्चा है, इसलिए बोर्ड अब गंदा है) में बहुत खराब हैं। वे कार्यों को भौतिक घटनाओं की एक श्रृंखला के बजाय अलग-अलग गणितीय समस्याओं की तरह मानते हैं। वे भूल जाते हैं कि यदि आपने एक कटोरा पकड़ा हुआ है, तो आपके हाथ भरे हुए हैं, और आप अंडा तब तक नहीं उठा सकते जब तक आप कटोरा नीचे न रख दें।

समाधान: "टाइम ट्रैवल" सोच

पेपर ने इसे ठीक करने के लिए एक चतुर तकनीक का परीक्षण किया। उन्होंने AI से काउंटरफैक्चुअल फोरसाइट सिमुलेशन (Counterfactual Foresight Simulation) का उपयोग करने के लिए कहा।

  • उपमा: केवल यह कहने के बजाय कि "मैं X करूँगा," AI को यह कहने के लिए मजबूर किया जाता है कि, "यदि मैं X करता हूँ, तो दुनिया Z जैसी दिखेगी। क्या Z सुरक्षित है? यदि हाँ, तो मैं X करूँगा।"
  • परिणाम: यह "टाइम ट्रैवल" सोच (कार्य करने से पहले भविष्य की अवस्था का अनुमान लगाना) गेम-चेंजर साबित हुई।
    • इसने सुप्त, लैटेंट विफलताओं को 72% तक कम कर दिया।
    • इसने अपरिवर्तनीय आपदाओं को 75% तक कम कर दिया।

निचोड़

पेपर निष्कर्ष निकालता है कि जबकि AI प्लानर्स निर्देशों का पालन करने में स्मार्ट हो रहे हैं, वे अभी भी एक अस्त-व्यस्त, वास्तविक दुनिया के वातावरण में उन निर्देशों के परिणामों को समझने में बहुत खराब हैं। उन्हें केवल "प्लानिंग" करना बंद करना होगा और शुरूआती नुकसान होने से पहले खामोश गलतियों को पकड़ने के लिए भविष्य का "सिमुलेशन" करना शुरू करना होगा।

SIMMER वह नया टूल है जो AI को यह साबित करने के लिए मजबूर करता है कि वह दुनिया के केवल दृश्य नियमों को ही नहीं, बल्कि उनके छिपे हुए नियमों को भी समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →