The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling
कॉम्प्लेक्सिटी सीलिंग बेंचमार्क (CCB) यह मूल्यांकन करता है कि तीन डोमेन में बढ़ते कार्य की गहराई के साथ भाषा मॉडल की तर्क क्षमता कैसे घटती है, जिससे यह पता चलता है कि जहाँ कुछ मॉडल 50 चरणों तक स्थानिक और प्रतीकात्मक कार्यों में उच्च सटीकता बनाए रखते हैं, वहीं वे रिलेशनल इन्फरेंस (संबंधात्मक अनुमान) में तेजी से विफल हो जाते हैं, जिसमें एक विशिष्ट मीट्रिक (k*) पैरामीटर संख्या की तुलना में लॉन्ग-होराइजन प्रदर्शन का बेहतर पूर्वानुमान लगाता है।