NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment
यह शोध पत्र NovBench को प्रस्तुत करता है, जो अकादमिक शोध पत्रों की नवीनता का मूल्यांकन करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का आकलन करने के लिए डिज़ाइन किया गया पहला बड़े पैमाने का बेंचमार्क और चार-आयामी मूल्यांकन ढांचा है, जो यह प्रकट करता है कि वर्तमान मॉडल वैज्ञानिक नवीनता की समझ और निर्देश पालन करने में संघर्ष करते हैं।