An ablation measured twice: small component effects can change sign across repeated training runs in breast-cancer histopathology segmentation
Deze studie toont aan dat in de histopathologische segmentatie van borstkanker de gemeten bijdragen van kleine architecturale componenten in ablatiestudies aanzienlijk kunnen variëren in grootte en zelfs van richting kunnen veranderen tussen herhaalde trainingsruns, wat het kritieke belang benadrukt van replicatie voordat definitieve conclusies over de effectiviteit van componenten worden getrokken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het vakgebied van medische beeldvorming krijgen computers steeds vaker de taak om microscoopglijders te lezen om kanker te vinden. Deze digitale hulpmiddelen, bekend als deep learning-modellen, worden getraind om patronen in weefselmonsters te herkennen die het menselijk oog misschien mist. Om deze hulpmiddelen te bouwen, combineren onderzoekers verschillende technieken, zoals het aanpassen van de kleuren van de afbeeldingen om verschillen tussen laboratoria op te vangen, of de computer leren om naar de afbeelding op verschillende detailniveaus tegelijk te kijken. Wanneer een nieuw model wordt gebouwd, maken wetenschappers een samenvattende tabel aan om te laten zien welke van deze technieken daadwerkelijk hielpen. Deze tabel, vaak een ablatiestudie genoemd, vermeldt de specifieke bijdrage van elk onderdeel en vertelt de lezer: "dit stukje voegde waarde toe, dat stukje deed niets." Het doel is om de nuttige instrumenten te scheiden van de ruis, zodat toekomstige artsen en onderzoekers precies weten wat ze kunnen vertrouwen.
Echter, een verborgen probleem loert onder deze samenvattingen. Zelfs wanneer een computerprogramma twee keer wordt uitgevoerd met exact dezelfde instellingen, zijn de resultaten zelden identiek. Kleine, onzichtbare schommelingen in de berekeningen van de computer kunnen ervoor zorgen dat de uiteindelijke score een beetje omhoog of omlaag wiebelt. Als deze natuurlijke wiebel groot genoeg is, kan het een nuttig hulpmiddel nutteloos laten lijken, of een nutteloos hulpmiddel nuttig lijken, simpelweg door toeval. Deze onzekerheid maakt het moeilijk om te weten of een gerapporteerde verbetering een echte ontdekking is of slechts een gelukkige worp met de dobbelstenen.
Een onderzoeker aan de San Francisco Bay University besloot te testen hoeveel deze natuurlijke wiebel ertoe doet bij de specifieke taak van het identificeren van borstkanker in weefselmonsters. De studie richtte zich op een populaire benchmark-dataset die duizenden beeldfragmenten bevat van patiëntenslides. De onderzoeker bouwde een computermodel ontworpen om tumoren op te sporen en testte vervolgens zeven verschillende versies hiervan. Elke versie schakelde drie specifieke functies aan of uit: een methode om de kleuren van de afbeeldingen te standaardiseren, een manier om naar de afbeelding in meerdere formaten tegelijk te kijken, en een mechanisme waarmee de computer fijne details kan vergelijken met brede overzichten. Het doel was om te zien welke functies de capaciteit van het model om kanker te vinden werkelijk verbeterden.
Om een echt gevoel te krijgen bij de natuurlijke instabiliteit van de computer, voerde de onderzoeker eerst één enkele versie van het model twaalf keer achter elkaar uit, waarbij niets veranderde behalve het willekeurige startpunt van de berekening. Het verschil tussen deze opeenvolgende runs werd gemeten, wat onthulde dat de score van het model er elke keer dat het werd herstart een kleine maar consistente hoeveelheid van veranderde. Dit stelde een nulmeting vast voor hoeveel de cijfers konden bewegen zonder dat er een werkelijke verandering aan het model zelf werd gebracht.
Met deze nulmeting in de hand, voerde de onderzoeker de volledige experiment van zeven verschillende modelversies uit. Echter, de daaropvolgende herhaling van het volledige experiment was oorspronkelijk geen bewuste ontwerpkeuze; het was noodzakelijk omdat de voorspellingsbestanden per fragment van de eerste meting verloren waren gegaan door een fout in de versiebeheer-procedure. Om de gegevens te herstellen, herhaalde de onderzoeker de matrix, waarbij achttien verse trainingsruns werden uitgevoerd op dezelfde zeven configuraties met dezelfde gegevens en startpunten. Dit creëerde een tweede, onafhankelijke set resultaten om met de eerste te vergelijken.
De vergelijking onthulde een opvallend patroon. De grote verbeteringen die in de eerste ronde werden gezien, hielden het grootste deel van de tijd stand in de tweede ronde. Zo zorgde de combinatie van kleurstandaardisatie en het bekijken van meerdere formaten er consequent voor dat de prestaties van het model verbeterden, hoewel de exacte mate van verbetering de tweede keer iets kleiner was. Echter, de kleinere, meer subtiele effecten waren volkomen onbetrouwbaar. Een specifieke functie, die werkt als een brug tussen fijne details en brede overzichten, vertoonde in de eerste ronde een negatief effect, wat suggereerde dat het de prestaties van het model verslechterde. In de tweede ronde vertoonde diezelfde functie een positief effect, wat suggereerde dat het hielp. Een ander klein effect sloeg om van positief naar negatief.
De studie vond dat de omvang van de verschuiving tussen de twee rondes ongeveer gelijk was voor elke functie, ongeacht hoe groot het effect van de functie was. Dit betekent dat wanneer een functie een klein effect heeft, de natuurlijke wiebel van de computer groot genoeg is om dit volledig te overstemmen of zelfs de richting ervan om te keren. De onderzoeker concludeerde dat voor kleine effecten één enkele experiment niet voldoende is om een conclusie te trekken. Als de impact van een functie vergelijkbaar is met de natuurlijke ruis van het systeem, is het resultaat niet stabiel genoeg om te vertrouwen.
De enige bevinding die deze strenge test overleefde, was een specifiek gedrag van de kleurstandaardisatietool. Hoewel het de algemene gemiddelde score van het model niet veel veranderde, hielp het de zwakste ziekenhuizen in de dataset consequent het meest, waardoor hun prestaties toenamen om die van de sterkere ziekenhuizen te evenaren. Dit patroon was duidelijk in zowel de eerste als de tweede ronde, wat bewees dat de tool werkelijk nuttig was om het systeem eerlijker te maken over verschillende locaties, zelfs als de algemene cijfers er niet spectaculair uitzagen.
Uiteindelijk dient dit werk als een waarschuwing voor hoe we de resultaten van computerwetenschappen interpreteren. Het laat zien dat wanneer de verbetering van een computermodel klein is, het onmogelijk is om te zeggen of het een echte doorbraak is of slechts een willekeurige fluctuatie zonder het experiment meerdere keren uit te voeren. De studie betoogt dat voordat men een specifiek onderdeel van een model goed of slecht verklaart, onderzoekers eerst moeten meten hoeveel de cijfers op zichzelf wiebelen. Als het effect kleiner is dan die wiebel, is het resultaat nog geen feit, maar slechts een suggestie die verdere bewijzen behoeft.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.