Rock the KASBA: Blazingly Fast and Accurate Time Series Clustering
Het artikel introduceert KASBA, een nieuw en schaalbaar algoritme voor tijdreeksclustering dat gebruikmaakt van de Move-Split-Merge-afstand en stochastische subgradientendaling om een superieur evenwicht te bereiken tussen hoge clusteringnauwkeurigheid en een aanzienlijk verkorte looptijd in vergelijking met bestaande state-of-the-art-methoden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een gigantische doos voor met duizenden verschillende nummers. Sommige zijn snelle rocktracks, sommige zijn langzame jazz, en sommige zijn elektronische beats. Je doel is om ze in stapels te sorteren zodat nummers in dezelfde stapel op elkaar lijken en nummers in verschillende stapels heel anders klinken. Dit is wat Time Series Clustering doet: het groepeert gegevens die veranderen in de tijd (zoals hartslagen, aandelenkoersen of muziek) in vergelijkbare families.
Het probleem is dat het sorteren van deze "nummers" lastig is. Als je alleen naar het volume op elk seconde kijkt (zoals het vergelijken van twee nummers punt voor punt), zal een nummer dat iets sneller of langzamer is dan een ander, er volledig anders uitzien, zelfs als ze hetzelfde melodie hebben. Om dit op te lossen, gebruiken computers "elastische" linialen die de tijd kunnen rekken en samendrukken om de nummers perfect op elkaar af te stemmen voordat ze ze vergelijken.
Er is echter een addertje onder het gras:
- Sommige sorteermethoden zijn snel maar doen een slechte job bij het correct groeperen van de nummers.
- Andere methoden zijn zeer nauwkeurig maar duren zo lang dat je misschien veroudert terwijl je wacht op de resultaten.
De auteurs van dit artikel, Christopher Holder en Anthony Bagnall, hebben een nieuwe sorteermachine uitgevonden die KASBA heet. Zij beweren dat het het beste van twee werelden is: het sorteert de nummers met hoge nauwkeurigheid maar doet dit ongelooflijk snel.
Wat is KASBA?
KASBA staat voor K (k-means) A (accelerated) S (stochastic subgradient) B (barycentre) A (average). Dat is een mondvol, dus laten we het opsplitsen met een analogie voor een feestje.
Stel je voor dat je een enorm feestje organiseert en gasten in kringen moet groeperen op basis van wie ze het meest op elkaar lijken.
De Elastische Liniaal (MSM):
De meeste oude sorteermethoden gebruiken een liniaal die kan rekken (genaamd DTW) om patronen te matchen. KASBA gebruikt een iets andere, slimmere liniaal genaamd MSM (Move-Split-Merge). Denk aan MSM als een liniaal die niet alleen rekken kan, maar ook begrijpt dat als iemand zijn hand iets beweegt, het een kleine "beweging" is, maar als ze plotseling springen, het een grotere "split" is. Deze liniaal is speciaal omdat ze strikte wiskundige regels volgt (het is een "metriek"), wat KASBA toestaat om een beetje te valsspelen om tijd te besparen.De Slimme Start (Elastic k-means++):
Voordat het sorteren begint, moet je een paar "leiders" kiezen om de groepen te starten. Oude methoden kiezen leiders misschien willekeurig, wat net is alsof je raadt wie de populaire kinderen zijn. KASBA gebruikt een slimme strategie (k-means++) om leiders te kiezen die ver uit elkaar liggen, zodat de groepen goed gescheiden beginnen. Dit doet het met de elastische liniaal vanaf het begin, niet alleen met een standaardliniaal.De "Raad en Controleer"-Leider (Stochastic Subgradient):
Zodra de groepen gevormd zijn, moet de computer de "perfecte gemiddelde" gast voor elke groep vinden (het centroid).- Oude manier: Het kijkt naar elke enkele gast in de groep, berekent het perfecte gemiddelde en updatet de leider. Dit is traag.
- KASBA-methode: Het kiest een willekeurige kleine steekproef van gasten, berekent een nieuwe leider en update direct. Dan kiest het een andere kleine steekproef. Het is alsof een leraar niet wacht tot de hele klas een toets heeft gemaakt voordat hij feedback geeft; hij geeft feedback terwijl hij gaat. Deze "Stochastic Subgradient"-methode is veel sneller.
De "Maak je geen zorgen om te controleren"-Truc (Driehoeksongelijkheid):
Dit is de geheime saus die KASBA razendsnel maakt. Omdat de MSM-liniaal strikte regels volgt, kan KASBA een logische truc gebruiken genaamd de Driehoeksongelijkheid.- De Analogie: Stel je voor dat je weet dat Gast A 10 stappen verwijderd is van de "Rock"-leider en 100 stappen van de "Jazz"-leider. Als de "Rock"-leider en de "Jazz"-leider 200 stappen uit elkaar staan, hoef je niet eens de afstand tussen Gast A en de Jazz-leider te meten om te weten dat Gast A bij Rock hoort. De wiskunde bewijst dat het onmogelijk is dat ze dichter bij elkaar liggen.
- KASBA gebruikt dit om miljoenen onnodige berekeningen over te slaan, wat enorme hoeveelheden tijd bespaart.
Wat Vonden Ze?
De auteurs testten KASBA op 112 verschillende datasets (zoals een bibliotheek van 112 verschillende soorten tijdreeksgegevens) van de Universiteit van Californië, Riverside. Ze vergeleken het met de beste bestaande methoden.
- Snelheid: KASBA is ordes van grootte sneller dan de meest nauwkeurige concurrenten.
- Terwijl een topconcurrent genaamd Shape-DBA 8 dagen nodig had om de gegevens te sorteren, deed KASBA dit in minuten.
- Een andere concurrent, Soft-DBA, zou bijna twee maanden hebben nodig gehad om dezelfde klus te klaren.
- Nauwkeurigheid: Ondanks dat het zo snel is, heeft KASBA geen kwaliteit opgeofferd. Het presteerde net zo goed als, of beter dan, de trage, nauwkeurige methoden. Het was de best gerangschikte algoritme voor nauwkeurigheid in hun tests.
- Robuustheid: Zelfs op moeilijke datasets waar andere methoden faalden of vastliepen, bleef KASBA werken en was het snel klaar.
De Conclusie
Het artikel beweert dat KASBA een "rockster"-oplossing is voor time series clustering. Het combineert de beste delen van eerdere methoden (slimme start, slim middelen en slim overslaan van berekeningen) in één pakket.
De auteurs concluderen dat KASBA klaar is voor gebruik in de echte wereld. Het stelt wetenschappers en ingenieurs in staat om hoogwaardige groeperingen van hun tijd-gebaseerde gegevens te krijgen zonder dagen of weken te hoeven wachten tot de computer de klus klaar heeft. Het is gratis beschikbaar in een softwaretoolkit genaamd aeon, zodat iedereen het vandaag nog kan gebruiken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.