Inverse Depth Scaling From Most Layers Being Similar
यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स में लॉस (loss) गहराई के साथ व्युत्क्रमानुपाती (inversely) रूप से घटता है क्योंकि कार्यात्मक रूप से समान परतें एक अक्षम लेकिन सुदृढ़ एन्सेम्बल (ensemble) के रूप में कार्य करती हैं, जो यह सुझाव देता है कि अधिक प्रभावी संरचनात्मक गहराई उपयोग को सक्षम करने के लिए भविष्य के आर्किटेक्चरल नवाचारों की आवश्यकता है।