CNN Regularization and Model Capacity: An Empirical Investigation of L1, L2, and Dropout in Hand Sign Image Classification
Diese empirische Studie zeigt, dass bei der Klassifizierung von Handzeichenbildern eine Erhöhung der CNN-Kapazität keine bessere Leistung garantiert und dass Dropout-Regularisierung, insbesondere bei architekturabhängigen Raten, L1- und L2-Strafen signifikant übertrifft, wobei ein mittelgroßes Modell die höchste Genauigkeit von 96,66 % erreichte.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der Welt des Computer Vision lernen Maschinen zu sehen. Sie tun dies, indem sie digitale Gehirne namens faltungsneuronaler Netzwerke nutzen, die darauf ausgelegt sind, Muster in Bildern zu erkennen, genau wie das menschliche Auge und das menschliche Gehirn. Diese Systeme sind unglaublich leistungsfähig und in der Lage, alles von Straßenschildern bis hin zu medizinischen Scans zu identifizieren. Es gibt jedoch einen Haken. Wenn diese digitalen Gehirne zu groß und komplex werden, können sie beginnen, die spezifischen Beispiele, die ihnen gezeigt werden, auswendig zu lernen, anstatt die allgemeinen Regeln zu erlernen, wie man ein Objekt erkennt. Dies wird als Overfitting (Überanpassung) bezeichnet. Stellen Sie sich einen Studenten vor, der die Antworten auf eine bestimmte Übungsprüfung auswendig lernt, aber bei der echten Prüfung versagt, weil er das Gelernte nicht auf neue Fragen anwenden kann. Um dies zu verhindern, nutzen Wissenschaftler Techniken namens Regularisierung. Dies sind Methoden, die den Lernprozess sanft einschränken und das System dazu zwingen, einfachere, robustere Muster zu finden, die auch bei Daten funktionieren, die es zuvor noch nie gesehen hat. Die Frage, die Forscher gestellt haben, ist, ob das Größerwerden des digitalen Gehirns immer hilft oder ob es einen optimalen Punkt gibt, an dem die Größe des Gehirns und die Stärke der Einschränkungen am besten zusammenwirken.
Ein Forscher am Indian Institute of Technology Kharagpur machte sich daran, diese Frage zu beantworten, indem er eine Reihe digitaler Gehirne zur Erkennung von Handzeichen aufbaute. Die Aufgabe bestand darin, dem Computer beizubringen, zwischen sechs verschiedenen Handgesten zu unterscheiden, die jeweils eine Zahl von eins bis sechs repräsentieren. Der Forscher erstellte drei Versionen desselben Computer-Vision-Systems, jede mit einem unterschiedlichen Kapazitätsniveau. Das erste war ein kleines System, das zweite war mittelgroß und das dritte war groß. Der einzige Unterschied zwischen ihnen war die Anzahl der internen Verbindungen, die sie besaßen; das große System hatte viel mehr Pfade, durch die Informationen fließen konnten, als das kleine. Das Ziel war zu sehen, ob das bloße Hinzufügen von mehr Verbindungen das System intelligenter machen würde oder ob es es nur anfälliger dafür machen würde, die Trainingsdaten auswendig zu lernen.
Die Experimente begannen mit einer überraschenden Entdeckung. Als die Systeme ohne Einschränkungen lernen durften, schnitt das mittelgroße System am besten ab. Es identifizierte die Handzeichen in den Testbildern etwa 91,67 Prozent der Zeit korrekt. Das große System, obwohl es über die größte Kapazität zum Lernen verfügte, schnitt schlechter ab und erreichte nur etwa 83,33 Prozent Genauigkeit. Dies geschah, weil das große System so leistungsstark war, dass es die spezifischen Details der Trainingsbilder, einschließlich des zufälligen Rauschens, auswendig lernte, anstatt die wahre Form der Handzeichen zu erlernen. Es war wie ein Student, der die Übungsprüfung so intensiv studierte, dass er sich an die exakte Reihenfolge der Fragen erinnerte, aber das zugrunde liegende Konzept nicht verstand. Das mittlere System, mit weniger Verbindungen, war gezwungen, ein Gleichgewicht zu finden, indem es die wesentlichen Merkmale lernte, ohne von dem Rauschen abgelenkt zu werden.
Um diese Ergebnisse zu verbessern, wandte der Forscher verschiedene Techniken an, um die Systeme am Overfitting zu hindern. Eine Methode bestand darin, eine Strafe für große interne Gewichte hinzuzufügen, was ähnlich wie die Ermutigung des Systems ist, seine internen Einstellungen einfach zu halten. Eine andere Methode bestand darin, Teile des Systems während des Trainings zufällig auszuschalten, was es dazu zwingt, sich auf andere Pfade zu verlassen, um das Problem zu lösen. Diese Technik, bekannt als Dropout, erwies sich als das effektivste Werkzeug. Als sie auf das mittelgroße System angewendet wurde, steigerte sie die Genauigkeit auf 96,66 Prozent, den höchsten in der gesamten Studie erreichten Wert.
Die Studie zeigte auch, dass die beste Art und Weise, diese Werkzeuge zu verwenden, von der Größe des Systems abhängt. Für das kleine System funktionierte eine sanfte Menge an zufälligem Ausschalten gut. Für das mittlere System war eine moderate Menge am besten. Aber für das große System, das über die meiste Kapazität zum Auswendiglernen verfügte, fanden die Forscher heraus, dass eine stärkere Dosis an zufälligem Ausschalten notwendig war, um gute Ergebnisse zu erzielen. Dies deutet darauf darauf hin, dass größere Systeme stärkere Einschränkungen benötigen, um zu verhindern, dass sie die Trainingsdaten auswendig lernen. Der Forscher testete auch die Kombination verschiedener Methoden, stellte jedoch fest, dass das bloße Übereinanderstapeln sie nicht automatisch besser machte. Tatsächlich kamen die besten Ergebnisse durch die Verwendung einer einzigen, gut abgestimmten Methode zustande, anstatt durch eine komplexe Mischung.
Die Zuverlässigkeit der Ergebnisse wurde überprüft, indem die Experimente mehrmals mit unterschiedlichen Anfangsbedingungen durchgeführt wurden, wobei die Hauptergebnisse Bestand hatten. Die Studie kommt zu dem Schluss, dass der Bau eines größeren Computer-Vision-Systems keine bessere Leistung garantiert. Stattdessen muss die Größe des Systems mit der richtigen Menge an Einschränkung abgestimmt werden. Ein mittelgroßes System mit dem richtigen Gleichgewicht an Einschränkungen kann ein viel größeres System übertreffen. Diese Arbeit liefert einen klaren, praktischen Leitfaden dafür, wie man diese digitalen Gehirne abstimmt, und zeigt, dass in der Suche nach künstlicher Intelligenz manchmal weniger mehr ist und die Stärke der Regeln genauso viel zählt wie die Größe des Gehirns.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.