AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
यह शोध पत्र AgentCompass को प्रस्तुत करता है, जो एक ओपन-सोर्स, हल्का और विस्तार योग्य मूल्यांकन बुनियादी ढांचा है जो स्वतंत्र घटकों के मॉड्यूलर डिज़ाइन, एक फॉल्ट-टॉलरेंट रनटाइम और विविध बेंचमार्क में पुनरुत्पादनीय अनुसंधान (reproducible research) का समर्थन करने के लिए व्यापक विश्लेषण उपकरणों के माध्यम से खंडित LLM एजेंट मूल्यांकन को एकीकृत करता है।