Toward Evaluation Frameworks for Multi-Agent Scientific AI Systems
यह शोध पत्र मल्टी-एजेंट वैज्ञानिक AI प्रणालियों के बेंचमार्किंग की अनूठी चुनौतियों—जैसे कि तर्क (reasoning) को सूचना प्राप्ति (retrieval) से अलग करना और डेटा अखंडता सुनिश्चित करना—का विश्लेषण करता है और क्वांटम विज्ञान में नवीन अनुसंधान डेटासेट और विशेषज्ञ साक्षात्कार के माध्यम से प्रमाणित, संदूषण-प्रतिरोधी कार्यों (contamination-resistant tasks) और मल्टी-टर्न इंटरैक्शन सहित मूल्यांकन रणनीतियों का प्रस्ताव करता है।