TaoBench: Do Automated Theorem Prover LLMs Generalize Beyond MathLib?
यह शोधपत्र TaoBench प्रस्तुत करता है, जो टेरेन्स ताओ की *Analysis I* से व्युत्पन्न एक नवीन बेंचमार्क है जो विशेष गणितीय संरचनाओं पर स्वचालित प्रमेय प्रुवरों (automated theorem provers) का मूल्यांकन करता है, जो मानक MathLib समस्याओं की तुलना में प्रदर्शन में 26% की महत्वपूर्ण गिरावट को प्रकट करता है और यह रेखांकित करता है कि वर्तमान प्रणालियों की प्राथमिक सीमा कार्यों की अंतर्निहित कठिनाई के बजाय विभिन्न परिभाषात्मक ढांचों (definitional frameworks) में सामान्यीकरण करने की उनकी अक्षमता है।