🤖 machine learning
TaoBench: Do Automated Theorem Prover LLMs Generalize Beyond MathLib?
تقدم الورقة البحثية TaoBench، وهو معيار مرجعي جديد مستمد من كتاب تيرانس تاو "التحليل 1" (Analysis I)، والذي يقيم أدوات إثبات النظريات الآلية بناءً على إنشاءات رياضية مخصصة، كاشفاً عن انخفاض ملحوظ في الأداء بنسبة 26% مقارنة بمسائل MathLib القياسية، ومسلطاً الضوء على أن القصور الأساسي للأنظمة الحالية يكمن في عدم قدرتها على التعميم عبر أطر تعريفية مختلفة بدلاً من الصعوبة المتأصلة في المهام نفسها.
Alexander K Taylor, Junyi Zhang, Ethan Ji, Vigyan Sahai, Haikang Deng, Yuanzhou Chen, Yifan Yuan, Di Wu, Jia-Chen Gu, Ka (…)2026-03-16