CRAB-Bench: Evaluating LLM Agents under Complex Task Dependencies and Human-aligned User Simulation
यह शोध पत्र जटिल कार्य निर्भरताओं और मानव-संरेखित उपयोगकर्ता सिमुलेशन वाले वास्तविक सेवा परिदृश्यों में LLM एजेंटों का मूल्यांकन करने के लिए CRAB-Bench और RUSE को प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल इन चुनौतियों के साथ, विशेष रूप से सूचना प्रकटीकरण जैसे अपूर्ण उपयोगकर्ता व्यवहारों का सामना करते समय, काफी संघर्ष करते हैं।