← Nieuwste papers
🤖 machine learning

Explaining f-Divergence-Based Regularization via Local Curvature and Sharpness-Aware Minimization

Dit artikel legt een theoretische verbinding tussen f-divergentie-gebaseerde regularisatie en Sharpness-Aware Minimization (SAM) door aan te tonen dat beide methoden krommingsgevoelige strafpunten induceren via lokale tweede-orde expansies, en valideert empirisch dat het maximaliseren van deze krommingsbestraffing via de symmetrische Jensen-Shannon divergentie leidt tot vlakkere minima en verbeterde generalisatie.

Oorspronkelijke auteurs: Nour Jamoussi, Marios Kountouris

Gepubliceerd 2026-09-10
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Nour Jamoussi, Marios Kountouris

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Verklaring van f-Divergentie-gebaseerde Regularisatie via Lokale Kromming en Sharpness-Aware Minimization

Probleemstelling
In de context van lifelong learning-agenten en algemene deep learning vereist het bereiken van robuuste generalisatie het beheersen van overfitting en lokale sensitiviteit. Twee prominente benaderingen hiervoor zijn divergentie-gebaseerde regularisatie (die discrepanties tussen predictieve distributies op originele en geperturbeerde inputs bestraft) en Sharpness-Aware Minimization (SAM), dat streeft naar parameters met vlakke verlieslandschappen. Hoewel beide methoden gemotiveerd worden door robuustheid tegen perturbaties, blijft hun theoretische relatie grotendeels onverkend. Specifiek is het onduidelijk of de lokale geometrie geïnduceerd door een divergentie-regularisator formeel gerelateerd kan worden aan de Hessiaanse structuur die SAM impliciet controleert. De vraag is of de lokale geometrie geïnduceerd door een divergentie-regularisator formeel gerelateerd kan worden aan de Hessiaanse structuur die SAM impliciet controleert.

Methodologie
Het artikel vestigt een verenigd theoretisch kader door de lokale tweede-orde geometrie van ff-divergentie-regularisatie te analyseren. De auteurs volgen de volgende stappen:

  1. Lokale Kwadratische Expansie: Ze leiden een tweede-orde Taylor-expansie af voor ff-divergenties wanneer de predictieve distributie PP van het model en een geperturbeerde distributie QQ dicht bij elkaar liggen. Ze tonen aan dat elke ff-divergentie in dit lokale regime reduceert tot een kwadratische straf geschaald door ϕ(1)/2\phi''(1)/2.
  2. Geometrische Interpretatie:
    • Parameterruimte: Wanneer perturbaties optreden in de parameterruimte (θθ+δ\theta \to \theta + \delta), induceert de regularisator een straf proportioneel aan δFx(θ)δ\delta^\top F_x(\theta) \delta, waarbij Fx(θ)F_x(\theta) de Fisher-informatie-matrix is.
    • Inputruimte: Wanneer perturbaties optreden in de inputruimte (xT(x)x \to T(x)), induceert de regularisator een "pullback" kwadratische vorm die de gradiënt van de dichtheid met betrekking tot de input omvat.
  3. Connectie met SAM: De auteurs vergelijken deze divergentie-geïnduceerde straf met SAM. Er wordt aangetoond dat SAM lokaal een spectrale krommingsstraf benadert die proportioneel is aan de dominante Hessiaanse eigenwaarde (λmax(H)\lambda_{\max}(H)). Het artikel demonstreert dat voor negatieve log-likelihood objectieven met output-distributies uit de exponentiële familie (bijv. cross-entropy met softmax), de Fisher-matrix samenvalt met de Generalized Gauss-Newton (GGN) matrix, die de positief-semidefiniete component van de Hessiaan vangt. Hierdoor worden divergentie-gebaseerde regularisatie en SAM lokaal vergelijkbaar via een gedeelde krommingsgeometrie.
  4. Gecontroleerd Empirisch Testbed: Om deze theoretische claims te valideren, maken de auteurs gebruik van de asymmetrische α\alpha-skew Jensen-Shannon Divergentie (JSD) familie. De lokale krommingscoëfficiënt voor deze familie schaalt als α(1α)\alpha(1-\alpha), en bereikt een maximum bij het symmetrische punt α=1/2\alpha = 1/2. Dit maakt een gecontroleerd experiment mogelijk waarbij de sterkte van de krommingsbestraffing kan worden gevarieerd zonder de fundamentele structuur van de regularisator te wijzigen.

Belangrijkste Bijdragen

  • Verenigde Lokale Expansie: Het artikel leidt een lokale tweede-orde expansie af voor ff-divergentie-regularisatie, waarmee wordt aangetoond dat het een krommingsgevoelige straf induceert die bepaald wordt door Fisher-geometrie in de parameterruimte en een pullback-metriek in de inputruimte.
  • Formele Link naar SAM: Het stelt vast dat onder standaard probabilistische verlies-aannames (specifiek NLL met exponentiële families), de door divergentie geïnduceerde geometrie lokaal vergelijkbaar is met de tweede-orde interpretaties van SAM via de Fisher/GGN/Hessiaan-relatie.
  • Algemeen Perturbatiekader: De analyse breidt zich uit naar input-ruimte perturbaties, waarbij wordt getoond dat divergentie-gebaseerde regularisatie een algemener perturbatiekader biedt dan standaard SAM (dat doorgaans gedefinieerd is via parameter-perturbaties), terwijl dezelfde lokale sensitiviteitsinterpretatie behouden blijft.
  • Afleiding van de Krommingscoëfficiënt: Voor de asymmetrische α\alpha-skew JSD-familie leiden de auteurs expliciet af dat de lokale krommingscoëfficiënt proportioneel is aan α(1α)\alpha(1-\alpha), waarbij het symmetrische geval (α=1/2\alpha=1/2) wordt geïdentificeerd als het regime van maximale krommingsbestraffing.

Resultaten
De empirische validatie werd uitgevoerd op vier benchmark-datasets (CIFAR-10, Fashion-MNIST, EMNIST en Oxford-IIIT Pet) met behulp van een EfficientNet-B2 model met input-ruimte perturbaties (random masking).

  • Prestatietrends: Over alle datasets heen was de prestatie van het model (gemeten via accuratesse en Negative Log-Likelihood) consistent het best nabij het symmetrische regime α=1/2\alpha = 1/2. Dit komt overeen met de theoretische voorspelling dat de sterkste lokale krommingsbestraffing (gemaximaliseerd bij α=1/2\alpha=1/2) superieure generalisatie oplevert.
  • Visualisatie van het Verlieslandschap: Visualisaties van het verlieslandschap op CIFAR-10 met behulp van ResNet-18 toonden aan dat modellen getraind met divergentie-regularisatie convergeren naar vlakkere lokale minima vergeleken met de baseline. Bovendien vertoonde het model getraind met de symmetrische instelling (α=0.5\alpha=0.5) het vlakkste bekken, wat overeenkomt met de hoogste krommingsbestraffing, terwijl de asymmetrische instelling (α=0.9\alpha=0.9) een intermediaire vlakheid vertoonde.
  • Statistische Metrieken: Kwantitatieve analyse van de statistieken van het verlieslandschap (gemiddeld verlies, trace van de Hessiaan gekwadrateerd, en maximale eigenwaarde) bevestigde dat de symmetrische α=0.5\alpha=0.5 instelling resulteerde in het laagste gemiddelde verlies en gereduceerde krommingsmetrieken vergeleken met zowel de baseline als de sterk asymmetrische instellingen.

Betekenis en Claims
Het artikel claimt de relatie tussen divergentie-gebaseerde regularisatie en sharpness-aware minimisatie te verhelderen vanuit een lokaal geometrisch perspectief. Het stelt dat hoewel de twee methoden niet identieke objectieven zijn, ze lokaal op één lijn komen te liggen via een gemeenschappelijke krommingsgeometrie wanneer specifieke probabilistische aannames gelden.

De auteurs kaderen hun bijdrage bescheiden als primair analytisch. Ze verduidelijken wanneer divergentie-gebaseerde regularisatie, Fisher-geometrie en sharpness-aware objectieven lokaal vergelijkbaar worden. De empirische studie richt zich op het valideren van het bredere lokale-krommingsperspectief binnen de specifieke context van de α\alpha-skew JSD-familie en input-perturbaties, in plaats van te claimen dat er een directe experimentele equivalentie aan SAM is in alle settings. Het werk suggereert dat de sterkte van de geïnduceerde lokale kromming een betekenisvolle factor is in de effectiviteit van divergentie-gebaseerde regularisatie, waarbij het symmetrische regime optimale prestaties biedt in de geteste scenario's.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →