Evaluating Agentic Optimization on Large Codebases
यह शोधपत्र FormulaCode को प्रस्तुत करता है, जो एक बेंचमार्क है जिसमें विशेषज्ञ पैच और सामुदायिक वर्कलोड के साथ 957 वास्तविक दुनिया के प्रदर्शन संबंधी बाधाएं (bottlenecks) शामिल हैं, ताकि बड़े कोडबेस पर एलएलएम (LLM) एजेंटों की समग्र, बहु-उद्देश्यीय अनुकूलन क्षमताओं का मूल्यांकन किया जा सके, जो यह प्रकट करता है कि यह फ्रंटियर मॉडल्स के लिए अभी भी एक महत्वपूर्ण चुनौती बना हुआ है।