Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation
यह पायलट अध्ययन यह प्रदर्शित करता है कि जहाँ कई LLM एजेंटों को ऑर्केस्ट्रेट करना उच्च-गुणवत्ता वाले सतही स्तर के SAT गणित बहुविकल्पीय प्रश्नों को कुशलतापूर्वक उत्पन्न कर सकता है, वहीं परिणामी आर्टिफैक्ट्स में अभी भी विशेषज्ञ-सत्यापित बेंचमार्क जैसी गहराई और संज्ञानात्मक कठोरता का अभाव है, जिससे मानव शोधकर्ता की भूमिका प्रत्यक्ष लेखन से बदलकर विनिर्देशन (स्पेसिफिकेशन), ऑर्केस्ट्रेशन और गवर्नेंस की हो जाती है।