RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts
यह शोध पत्र RECON को प्रस्तुत करता है, जो आपराधिक, चिकित्सा और वित्तीय डोमेन में 24 लॉन्ग-कॉन्टेक्स्ट केस फाइलों से बना एक नवीन बेंचमार्क है, जिसे जटिल कंपोजिशनल रीजनिंग कार्यों जैसे कि मल्टी-हॉप एविडेंस रिकंस्ट्रक्शन, कॉन्फ्लिक्ट रेजोल्यूशन और काउंटरफैक्चुअल एनालिसिस में वर्तमान LLM-आधारित एजेंटों की सीमाओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जहाँ सबसे मजबूत सिस्टम भी केवल 22.4% सटीकता प्राप्त करते हैं।