SentinelBench: A Benchmark for Long-Running Monitoring Agents
यह शोध पत्र SentinelBench प्रस्तुत करता है, जो 10 सिंथेटिक वेब वातावरणों में 100 कार्यों से युक्त एक ओपन-सोर्स बेंचमार्क है जिसे समय के साथ विकसित होने वाली स्थितियों की कुशलतापूर्वक निगरानी करने और बाहरी घटनाओं पर प्रतिक्रिया देने की एआई एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिससे निरंतर कार्रवाई के बजाय निरंतर ध्यान (sustained attention) को प्राथमिकता देने वाले लंबे समय तक चलने वाले निगरानी कार्यों के लिए प्रदर्शन बेसलाइन स्थापित की जा सके।