← Nieuwste papers
💻 computer science

QPT V2: Masked Image Modeling Advances Visual Scoring

Dit paper introduceert QPT V2, een nieuw voortrainingsframework op basis van gemaskerde beeldmodellering dat een geünificeerde oplossing biedt voor de beoordeling van beeldkwaliteit en esthetiek en hiermee de prestaties op meerdere benchmarks significant verbetert.

Oorspronkelijke auteurs: Qizhi Xie, Kun Yuan, Yunpeng Qu, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu

Gepubliceerd 2026-03-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qizhi Xie, Kun Yuan, Yunpeng Qu, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een jurylid bent voor een groot film- en fotowedstrijd. Je taak is om te bepalen welke foto's of video's er "mooi" uitzien en welke er "slecht" zijn. Maar hier is het probleem: je hebt maar heel weinig tijd en je hebt nog nooit eerder zo'n wedstrijd gedaan. Je moet dus snel leren wat mensen mooi vinden, zonder dat iemand je elke keer vertelt of een foto goed of slecht is.

Dit is precies het probleem waar kunstmatige intelligentie (AI) mee worstelt bij het beoordelen van beeldkwaliteit en esthetiek. De nieuwe paper "QPT V2" van onderzoekers van de Tsinghua Universiteit en Kuaishou Technology biedt een slimme oplossing.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Zeldzame Cursus"

Normaal gesproken leren AI-modellen door duizenden voorbeelden te zien met een score erbij (bijv. "Deze foto is 8/10"). Maar in de echte wereld zijn er maar heel weinig foto's met zo'n score. Het is alsof je een kok wilt leren koken, maar je hebt maar 10 recepten met een beoordeling, terwijl je duizenden ingrediënten moet leren kennen.

Oude methoden probeerden dit op te lossen door de bestaande recepten in stukjes te hakken (vermenigvuldigen van data), maar dat werkt niet goed. Andere methoden leerden eerst op algemene foto's (zoals katten en auto's) en probeerden die kennis toe te passen, maar dat was alsof je een chef-kok probeert te maken door iemand te laten kijken naar een natuurdocumentaire. Het mist de specifieke "smaak" van kwaliteit.

2. De Oplossing: QPT V2 (De "Puzzelmeester")

De auteurs gebruiken een techniek die Masked Image Modeling (MIM) heet.

  • De Analogie: Stel je voor dat je een foto ziet, maar 75% ervan is bedekt met een zwart doekje (een masker). De AI moet de ontbrekende stukjes raden op basis van wat ze wel kunnen zien.
  • Waarom werkt dit? Om de ontbrekende stukjes goed te raden, moet de AI niet alleen weten wat er op de foto staat (bijv. "dat is een boom"), maar ook hoe het eruitziet (is de boom scherp? Is de kleur levendig? Is er ruis?). De AI wordt gedwongen om een diep begrip te ontwikkelen van zowel de inhoud als de kwaliteit.

3. De Drie Verbeteringen van QPT V2

De onderzoekers zeiden: "Oké, het puzzelen werkt, maar we kunnen het nog slimmer maken." Ze verbeterden drie dingen:

A. De Leerboeken (Data): Kiezen voor Hoogte en Detail

Standaard AI-modellen leren vaak op foto's die klein zijn of waar de achtergrond te veel ruimte inneemt.

  • De Verbetering: Ze hebben een speciale verzameling foto's geselecteerd die hoog resolutie hebben (veel details) en veel voorwerpen bevatten (niet alleen een leeg veldje).
  • De Analogie: Het is het verschil tussen een kind leren tekenen met een potlood op een krantje (vaak wazig en leeg) versus een kind laten tekenen met een verfkwast op een groot canvas vol details. QPT V2 leert op het grote canvas.

B. De Oefeningen (Degradatie): De "Smaakmaker"

Om echt te leren wat kwaliteit is, moet je ook weten wat slechte kwaliteit is.

  • De Verbetering: Ze laten de AI foto's zien die bewust zijn "bedorven" op slimme manieren: wazig gemaakt, ruis toegevoegd, of de kleuren veranderd.
  • De Analogie: Een wijnproever moet niet alleen goede wijn proeven, maar ook weten hoe het smaakt als er te veel kurk in zit of als hij te warm is. QPT V2 laat de AI proeven van "slechte wijn" (vervormingen) zodat ze de "perfecte wijn" (goede kwaliteit) beter kunnen onderscheiden. Ze ontdekten dat het veranderen van kleerruimtes (zoals van RGB naar zwart-wit en terug) de AI het meest leerde.

C. De Breinstructuur (Model): Kijken met een Telelens en een Groothoek

Mensen kijken naar een foto met verschillende "zooms": we zien de grote lijnen (is het een landschap?) en de kleine details (is de huid glad?).

  • De Verbetering: Ze bouwden het AI-model zo dat het tegelijkertijd naar verschillende niveaus van detail kan kijken en deze informatie samenvoegt.
  • De Analogie: Het is alsof je een team van inspecteurs hebt: één kijkt naar het hele gebouw (grootbeeld), één kijkt naar de ramen (middelgroot), en één kijkt naar de deurgreep (detail). QPT V2 laat deze drie inspecteurs samenwerken om een perfecte beoordeling te geven.

4. Het Resultaat: De Superjury

Toen ze dit nieuwe model (QPT V2) testten op 11 verschillende tests (voor foto's, video's en esthetiek), bleek het beter te zijn dan alle bestaande methoden.

  • Het was beter in het voorspellen van wat mensen mooi vinden.
  • Het had minder "lerende tijd" nodig dan andere methoden.
  • Het kon zelfs video's beoordelen, niet alleen foto's.

Conclusie

Kortom: QPT V2 is als een super-slimme leerling die niet alleen leert door voorbeelden te zien, maar door zelf puzzels op te lossen met moeilijke, gedetailleerde foto's en door te oefenen met "verkeerde" foto's. Hierdoor wordt het een meester in het beoordelen van beeldkwaliteit, zonder dat er duizenden mensen nodig zijn om elke foto te beoordelen.

Dit is een grote stap voorwaarts voor apps die video's automatisch verbeteren, filters kiezen of content selecteren op basis van kwaliteit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →