Sapiens2
Sapiens2 is een nieuwe familie van hoogresolutie-transformatormodellen voor mensgerichte visie die, dankzij een verbeterde vooropleiding met gecombineerde objectieven, een gecurateerde dataset van 1 miljard afbeeldingen en geavanceerde architecturale aanpassingen, de staat van de kunst aanzienlijk verbetert voor diverse taken zoals houdingschatting, segmentatie en schatting van oppervlakkenormals.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een kunstenaar bent die een portret moet schilderen van een mens. De vorige generatie kunstenaars (het oude model, genaamd Sapiens) was al heel goed in het vastleggen van de grote lijnen: "Dat is een neus, dat is een arm." Maar als je heel dichtbij keek, misten ze soms de details: de kleine rimpel in de huid, de glans op een oorbel, of de exacte vorm van een tand.
Sapiens2 is de nieuwe, super-getalenteerde kunstenaar die Meta Reality Labs heeft gebouwd. Dit is geen gewone kunstenaar; het is een hele familie van kunstenaars, van een kleine schetsmaker tot een gigantische meester met 5 miljard "hersencellen" (parameters).
Hier is hoe Sapiens2 werkt, vertaald in alledaagse taal:
1. De Leermeester: Twee manieren om te leren
Vroeger leerden kunstenaars op twee manieren, maar ze waren niet perfect samen:
- Manier A (Het raadsel): Je bedekt een deel van het schilderij en vraagt de kunstenaar om het te raden. Dit is goed voor details (zoals de textuur van een trui), maar de kunstenaar vergeet soms wat het geheel voorstelt.
- Manier B (De vergelijking): Je laat de kunstenaar twee foto's van dezelfde persoon zien en zegt: "Zie je? Dit is dezelfde persoon, ook al staat hij in een andere hoek." Dit helpt om het begrip van een mens te krijgen, maar mist soms de fijne details.
Sapiens2 doet beide tegelijk. Het is alsof je een kunstenaar hebt die zowel het raadsel oplost als de vergelijking maakt. Het resultaat? Een kunstenaar die niet alleen weet dat het een mens is, maar ook precies ziet hoe die huid eruitziet, hoe het haar valt en hoe de kleding in het licht valt.
2. De Bibliotheek: Een miljoen foto's van echte mensen
Om een kunstenaar te trainen, heb je veel voorbeelden nodig. Sapiens2 heeft geleerd van 1 miljard foto's van mensen uit de hele wereld.
- Ze hebben niet gekeken naar labels als "man", "vrouw" of "sporter". Ze hebben gewoon gekeken naar mensen.
- Ze hebben de beste foto's geselecteerd: mensen met verschillende huidtinten, kleding, achtergronden en in verschillende situaties.
- Het is alsof je een bibliotheek bouwt met foto's van elke soort mens die je kunt bedenken, zodat de kunstenaar nooit verrast wordt door een nieuwe situatie.
3. De Lijst met taken: Van pose tot huidskleur
Deze kunstenaars zijn niet beperkt tot één taak. Ze kunnen alles:
- Positieschetsen: Ze kunnen precies aangeven waar elk botje zit (zelfs de vingers en het gezicht), zelfs als de persoon een rare houding aanneemt.
- Segmentatie: Ze kunnen een mens uit zijn achtergrond knippen, tot op het haar. Ze kunnen zelfs een oorbel van een oor scheiden of tanden van tandvlees.
- 3D-ruimte: Ze kunnen een platte foto omzetten in een 3D-kaart (diepte), zodat je weet hoe ver de neus van de camera af staat.
- Huid en Licht: Ze kunnen de "echte" kleur van de huid voorspellen, alsof ze het licht eruit filteren. Dit is cruciaal voor het maken van realistische digitale avatars.
4. De Grootte en Schaal: Van schets tot meesterwerk
Sapiens2 komt in verschillende maten, afhankelijk van hoeveel rekenkracht je hebt:
- De kleine modellen (0,4 miljard parameters) zijn snel en goed voor mobiele telefoons.
- De gigantische modellen (5 miljard parameters) zijn als een supercomputer. Ze kunnen foto's in 4K-resolutie (ontzettend scherp) verwerken.
- Het is alsof je een loep hebt: hoe groter het model, hoe kleiner de details die je kunt zien. Ze kunnen zelfs de textuur van een kettinkje of de poriën op een huid zien.
Waarom is dit belangrijk?
Vroeger waren modellen die goed waren in het begrijpen van mensen vaak niet scherp genoeg, of ze waren zo scherp dat ze niet begrepen wat ze zagen. Sapiens2 combineert het beste van twee werelden.
Het is de eerste keer dat een model zo goed is in het zien van mensen dat het niet alleen "een mens" ziet, maar de essentie van die persoon begrijpt, van de grote lijnen tot de kleinste rimpel. Dit opent de deur voor:
- Beter virtueel spelen: Je avatar ziet er echt uit, met de juiste huidskleur en bewegingen.
- Medische toepassingen: Precieze analyse van lichaamshouding.
- Films en games: Het creëren van digitale mensen die er niet "plastic" uitzien.
Kortom: Sapiens2 is de nieuwe standaard voor hoe computers mensen zien. Ze kijken niet meer alleen naar de vorm, maar voelen de textuur, begrijpen de context en zien de details die voor ons menselijk oog soms zelfs te klein zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.