Sharp feature-learning transitions and Bayes-optimal neural scaling laws in extensive-width networks
यह शोध पत्र यह स्थापित करता है कि उच्च-आयामी, विस्तृत-चौड़ाई वाले न्यूरल नेटवर्क में पदानुक्रमित विशेषताओं (hierarchical features) को सीखते समय, विशेषता अधिग्रहण (feature acquisition) तीक्ष्ण क्रमिक चरण संक्रमणों (sharp sequential phase transitions) के माध्यम से होता है जो एक "प्रभावी चौड़ाई" (effective width) को परिभाषित करते हैं और विशिष्ट सामान्यीकरण त्रुटि स्केलिंग नियमों (generalization error scaling laws) को एक एकल इष्टतम संबंध में एकीकृत करते हैं, जिसे एडम-प्रशिक्षित छात्रों (Adam-trained students) द्वारा अनुभवजन्य रूप से प्राप्त किया जा सकता है।