RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation
यह शोध पत्र RealICU का परिचय देता है, जो एक पश्चदृष्टि-एनोटेटेड (hindsight-annotated) बेंचमार्क है जो चिकित्सक-समीक्षित ग्राउंड ट्रुथ का उपयोग करके लंबे-संदर्भ वाले ICU डेटा पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे यह पता चलता है कि बेहतर मेमोरी आर्किटेक्चर के बावजूद वर्तमान मॉडल रिकॉल-सुरक्षा ट्रेडऑफ और एंकरिंग बायस (anchoring biases) के साथ संघर्ष करते हैं।