Benchmarking LLM Tool-Use in the Wild
यह शोध पत्र WildToolBench प्रस्तुत करता है, जो वास्तविक दुनिया के उपयोगकर्ता व्यवहारों पर आधारित एक नया बेंचमार्क है ताकि जटिल, अव्यवस्थित और लचीले मल्टी-टर्न टूल-उपयोग परिदृश्यों को संभालने में वर्तमान लार्ज लैंग्वेज मॉडल्स की महत्वपूर्ण सीमाओं को उजागर किया जा सके, जिससे यह पता चलता है कि ऑर्केस्ट्रेशन, प्रासंगिक अनुमान और गतिशील निर्देश संक्रमणों की चुनौतियों के कारण कोई भी मूल्यांकित मॉडल 15% सटीकता से अधिक नहीं है।