Bigger Isn't Always Better: A Comparative Evaluation of LLMs for Automated Code Review
यह शोध पत्र प्रदर्शित करता है कि छोटा और अधिक लागत प्रभावी क्लॉड हाइकू 4.5 (Claude Haiku 4.5), स्वचालित कोड समीक्षा में बड़े क्लॉड सोनेट 4.6 (Claude Sonnet 4.6) से बेहतर प्रदर्शन करता है, साथ ही यह भी प्रकट करता है कि सिंथेटिक बेंचमार्क मॉडल की क्षमताओं का अत्यधिक आकलन करते हैं और बड़े डिफ (diff) आकारों तथा प्रदर्शन संबंधी बग्स के साथ प्रदर्शन में भारी गिरावट आती है।