Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges
यह शोध पत्र DeepRed प्रस्तुत करता है, जो एक ओपन-सोर्स बेंचमार्क है जो आंशिक-क्रेडिट स्कोरिंग और स्वचालित लॉग विश्लेषण का उपयोग करके यथार्थवादी कैप्चर द फ्लैग चुनौतियों पर LLM एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल सीमित सफलता (औसतन 35% चेकपॉइंट पूर्णता) प्राप्त करते हैं और गैर-मानक खोज एवं लंबी-अवधि अनुकूलन कार्यों के साथ संघर्ष करते हैं।