Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated
Dit artikel betoogt dat benchmarks voor vision-language-modellen in stedelijke perceptie moeten evolueren om menselijke onenigheid en onthouding als geldige meetresultaten te behandelen, de betrouwbaarheid tussen annotatoren naast de modelalignement te rapporteren, en labelruimtes te kaderen als onderhandelbare artefacten om stedelijke governance-toepassingen beter te ondersteunen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren om een straat te beschrijven, niet alleen door auto's of bomen te tellen, maar door je te vertellen hoe de straat voelt. Is het veilig? Is het uitnodigend? Is het comfortabel?
Dit artikel betoogt dat wanneer we deze "Vision-Language Models" testen (robots die zien en praten), we een grote fout maken als we hun antwoorden behandelen als een simpele wiskundetoets met één juist antwoord. In plaats daarvan moeten we deze tests meer behandelen als een gemeenteraadsvergadering waar mensen verschillende meningen hebben.
Hier is de onderverdeling van de hoofdideeën van het artikel met behulp van eenvoudige analogieën:
1. Het Probleem: De "Eén Juist Antwoord"-valstrik
Stel je voor dat je een foto van een park laat zien aan 12 verschillende mensen en vraagt: "Is dit park veilig?"
- Persoon A zegt: "Ja, het is erg veilig."
- Persoon B zegt: "Nee, het voelt gevaarlijk aan 's nachts."
- Persoon C zegt: "Dat kan ik niet zien aan deze foto."
In traditionele robottesten zouden we al deze antwoorden dwingen in één "Ground Truth" (bijv. "Veilig"). Als de robot "Onveilig" zegt, markeren we dat als fout. Als de robot "Veilig" zegt, markeren we dat als goed.
Het argument van het artikel: Dit is onrechtvaardig. De "waarheid" hier is geen enkel feit; het is een rommelige mix van meningen. Als we de onenigheid negeren, denken we misschien dat de robot faalt terwijl hij eigenlijk slechts een geldige menselijke mening reflecteert.
2. De Oplossing: Het "Betrouwbaarheidsbewuste" Rapportcijfer
De auteurs stellen voor dat we een nieuw soort rapport nodig hebben voor deze robots. In plaats van alleen een score te geven (zoals 85%), zou het rapport ook moeten laten zien:
- Hoeveel mensen het oneens waren: Als mensen het niet eens kunnen worden over de vraag of een straat "veilig" is, mag de robot niet gestraft worden voor het gokken.
- Wie zei "Ik weet het niet": Soms is het beste antwoord "Ik kan dat niet beoordelen." Als een robot gokt wanneer hij stil had moeten blijven, dan is dat een probleem.
De analogie: Denk aan een weersverwachting. Als 12 meteorologen naar een storm kijken en 6 zeggen "Regen" en 6 zeggen "Sneeuw", dan zou een goede weersverwachting niet alleen één van de twee moeten kiezen en zeggen "Het is Regen". Het zou moeten zeggen: "Er is een 50/50 verdeling, en dit is de onzekerheid."
3. Het Experiment: De Montreal Straatentest
Om dit te bewijzen, hebben de onderzoekers een specifieke test ontwikkeld:
- De Scène: Ze namen 100 foto's van straten in Montreal (sommige echte foto's, sommige computergegenereerde beelden).
- De Jury: Ze vroegen 12 echte mensen uit lokale gemeenschapsgroepen om deze straten te beschrijven op 30 verschillende onderwerpen (zoals "Is het schoon?" of "Voelt het inclusief?").
- De Robots: Ze vroegen 7 verschillende AI-modellen om dezelfde straten te beschrijven met exact dezelfde instructies.
Wat ze vonden:
- De "Makkelijke" Zaken: Wanneer de vraag ging over iets voor de hand liggend (zoals "Zijn er bomen?"), waren mensen het veel met elkaar eens, en deden de robots het goed.
- De "Moeilijke" Zaken: Wanneer de vraag ging over gevoelens (zoals "Is het comfortabel?"), waren mensen het veel met elkaar oneens. De robots hadden ook moeite, maar interessant genoeg stemden ze soms af met het patroon van de menselijke onenigheid.
- Het "Stilzwijgende" Probleem: Mensen zeiden vaak: "Ik kan dit niet beoordelen." De robots probeerden echter vaak toch te gokken. Dit is een mismatch in gedrag.
4. De "Onderhandelde" Aanpak
Het artikel betoogt dat deze tests niet in steen gebeiteld moeten zijn. Ze moeten onderhandeld worden.
De analogie: Stel je een recept voor een stad voor. Als de mensen die in de stad wonen zeggen: "Deze ingrediënt (de definitie van 'veiligheid') maakt voor ons geen zin," dan moet het recept niet gewoon genegeerd worden. De mensen en de wetenschappers moeten samen gaan zitten en het recept samen herschrijven.
De auteurs zeggen dat wanneer we deze robots gebruiken om beslissingen te nemen over steden (zoals waar een park gebouwd moet worden of hoe een straat te beveiligen), we moeten:
- De onenigheid tonen: Verberg niet het feit dat mensen discussiëren over wat "veilig" betekent.
- De regels flexibel houden: Als de gemeenschap zegt dat de regels fout zijn, moeten we in staat zijn de test aan te passen en opnieuw uit te voeren.
- Eerlijk zijn over onzekerheid: Als de robot het niet zeker weet, of als mensen het niet zeker weten, moet die onzekerheid zichtbaar zijn in het eindverslag.
Samenvatting
Dit artikel vertelt ons dat wanneer we AI gebruiken om te begrijpen hoe mensen zich voelen over hun steden, we niet simpelweg kunnen zoeken naar een "correct" antwoord. We moeten accepteren dat mensen het oneens zijn. Een goede test voor deze robots moet ons laten zien hoeveel mensen het oneens waren en hoe vaak de robot weigerde te gokken, in plaats van alleen een enkel getal te geven dat doet alsoberen dat de wereld simpel en duidelijk is.
Als we dit niet doen, bouwen we misschien robots die denken dat ze "slim" zijn omdat ze overeenstemmen met een verzonnen gemiddelde, terwijl ze in werkelijkheid de echte, complexe en belangrijke gesprekken in onze gemeenschappen missen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.