← Nieuwste papers
🤖 AI

OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization

Het artikel introduceert OmniSapiens-7B 2.0, een fundatiemodel voor het verwerken van sociaal gedrag dat gebruikmaakt van een nieuwe Heterogeneity-Aware Relative Policy Optimization-methode om effectief te leren van diverse en ongebalanceerde gedragsgegevens, waarmee het een staat van dienst als de beste prestaties (state-of-the-art) en consistente redenering bereikt over meerdere taken en benchmarks.

Oorspronkelijke auteurs: Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

Gepubliceerd 2026-06-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een AI leren menselijk gedrag te begrijpen

Stel je voor dat je een robot probeert te leren om menselijk gedrag te begrijpen. Je wilt dat de robot in veel verschillende dingen goed is: het herkennen van sarcasme, het detecteren van depressie, het begrijpen van humor, het lezen van lichaamstaal en het achterhalen van wat iemand voelt.

Het probleem is dat menselijk gedrag rommelig en gevarieerd is. Sommige taken zijn als schreeuwen (zeer luide signalen), terwijl andere als fluisteren zijn (zeer zachte signalen). Als je al deze taken simpelweg in een standaard AI gooit, overstemmen de "schreeuwende" taken de "fluisterende" taken. De AI wordt heel goed in de luide zaken, maar negeert de stille zaken volledig.

De auteurs van dit artikel hebben een nieuw AI-model gebouwd genaamd OmniSapiens-7B 2.0 om dit op te lossen. Het is ontworpen als een "sociaal intelligente" hersenpan die al deze verschillende taken tegelijkertijd kan afhandelen zonder in de war te raken of bevooroordeeld te raken door de luidste signalen.

Het Probleem: Het "Schreeuwende Baby"-effect

Het artikel legt uit dat bestaande AI-modellen moeite hebben omdat de data waar ze van leren heterogeen is (gemengd en ongelijkmatig).

  • De Analogie: Stel je een klaslokaal voor waar een leraar probeert 10 verschillende vakken tegelijkertijd te onderwijzen. In een hoek schreeuwt een leerling het antwoord op een wiskundevraag (een heel gemakkelijk, luid signaal). In een andere hoek fluistert een leerling een complex gedicht over rouw (een moeilijk, zacht signaal).
  • Het Resultaat: Een standaard leraar (of AI) zal zich volledig concentreren op de schreeuwende leerling omdat die feedback het makkelijkst te horen is. De fluisterende leerling zal worden genegeerd. In AI-termen: het model wordt geweldig in gemakkelijke taken, maar faalt bij de subtiele, complexe taken.

De Oplossing: De "Eerlijkheidscoach" (HARPO)

Om dit op te lossen, hebben de onderzoekers een nieuwe trainingsmethode uitgevonden genaamd HARPO (Heterogeneity-Aware Relative Policy Optimization).

  • De Analogie: Denk aan HARPO als een zeer slimme "Eerlijkheidscoach" die in het klaslokaal staat.
    1. Luisteren: De Coach luistert naar het antwoord van elke leerling.
    2. Inspanning Meten: De Coach berekent hoeveel "lawaai" (of leersignaal) elke leerling bijdraagt.
    3. Het Volume Balanceren: Als de wiskundeleerling te hard schreeuwt, draait de Coach hun microfoon iets zachter. Als de poëzieleerling te zacht fluistert, draait de Coach hun microfoon juist iets harder.
    4. Het Doel: De Coach zorgt ervoor dat elke leerling een eerlijke kans krijgt om de les te beïnvloeden, ongeacht hoe luid of zacht ze zijn.

In technische termen kijkt HARPO naar hoeveel elke specifieke taak of datapunt bijdraagt aan het leren van de AI. Vervolgens "draait het volume omhoog" van de zachte signalen en "draait het volume omlaag" van de luide signalen, zodat de AI van alles evenveel leert.

De Resultaten: De All-Star Speler

De onderzoekers hebben dit nieuwe AI-model (OmniSapiens-7B 2.0) getest tegen andere modellen op 10 verschillende gedragstaken, variërend van het detecteren van angst tot het begrijpen van non-verbale gebaren.

  • Het Scorebord: OmniSapiens won niet alleen; het domineerde. Het behaalde de beste resultaten op alle 10 de taken tegelijkertijd.
  • De Vergelijking: Vergeleken met andere top AI-modellen was OmniSapiens tot wel 12% beter in totaal. Nog indrukwekkender: toen de AI werd getest op 5 gloednieuwe taken die hij nog nooit eerder had gezien (zoals het detecteren van autisme of ernstige depressie), presteerde hij nog steeds tot 9% beter dan al het anderen.
  • De "Waarom": Het artikel suggereert dat omdat de "Eerlijkheidscoach" (HARPO) ervoor zorgde dat de AI leerde van de zachte, moeilijke signalen, de AI een dieper en flexibeler begrip van menselijk gedrag ontwikkelde. Het heeft niet alleen de luide antwoorden uit het hoofd geleerd, maar de onderliggende patronen begrepen.

Bonus: Helderder Denken

Het artikel keek ook naar hoe de AI denkt. Wanneer de AI een probleem moet oplossen, schrijft hij zijn redeneerstappen op (zoals een leerling die zijn berekeningen laat zien).

  • Oude Modellen: Gaven vaak lange, warrige of verwarde verklaringen, of gokten soms zonder na te denken.
  • OmniSapiens: Produceerde kortere, duidelijkere en consistentere redeneringen. Het was als een leerling die niet alleen het juiste antwoord gaf, maar het ook logisch en beknopt uitlegde. Dit maakt de AI betrouwbaarder voor gebruik in de echte wereld.

Samenvatting

Het artikel stelt dat door een nieuwe manier uit te vinden om het "volume" van verschillende leersignalen te balanceren (HARPO), zij een AI (OmniSapiens-7B 2.0) hebben gecreëerd die:

  1. Beter is in alles: Het wint op 10 diverse sociale taken.
  2. Beter is in nieuwe dingen: Het generaliseert goed naar taken die het nog niet heeft gezien.
  3. Helderder is: Het legt zijn redenering beter uit dan eerdere modellen.

De belangrijkste les is dat om een echt sociaal intelligente AI te bouwen, je niet kunt toestaan dat de "luide" data de overhand krijgt; je hebt een mechanisme nodig om ervoor te zorgen dat de "fluisteringen" net zo duidelijk worden gehoord.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →