Can Large Language Models Model Programs Formally?
यह शोधपत्र Model-Bench को प्रस्तुत करता है, जो एक बेंचमार्क और पाइपलाइन है जिसमें 400 पायथन प्रोग्राम शामिल हैं जिन्हें बड़े भाषा मॉडलों (Large Language Models) की सत्यापन-योग्य मॉडल चेकिंग विनिर्देशों (verification-ready model checking specifications) को स्वचालित रूप से उत्पन्न करने की क्षमता का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया है, जो इस क्षमता में वर्तमान महत्वपूर्ण सीमाओं को प्रकट करता है।