Intern-S2-Preview: Scientific Agentic Foundation Model
Het artikel introduceert Intern-S2-Preview, een serie wetenschappelijke agentische fundamentmodellen getraind via een gespecialiseerde multimodale pre-training en een verenigde post-training pipeline met geavanceerde reinforcement learning en geheugenversterkte architecturen om state-of-the-art prestaties te behalen in wetenschappelijk redeneren, tool-interactie en taken met een lange horizon.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren een wetenschapper te zijn. In het verleden gaven we robots enorme bibliotheken met tekst en vroegen we hen vragen te beantwoorden als een deelnemer aan een quizshow. Maar echte wetenschap is geen quiz; het is een rommelig, lang avontuur. Het houdt in dat je naar vreemde afbeeldingen van cellen kijkt, grafieken leest die wapperen als hartslagen, computertools gebruikt om experimenten uit te voeren en urenlang over een probleem nadenkt zonder de draad kwijt te raken. Dit artikel gaat over het bouwen van een nieuw soort "superbrein" voor robots dat niet alleen feiten memoriseert, maar ook daadwerkelijk wetenschap doet. Het is ontworpen om complexe afbeeldingen te begrijpen, toekomstige getallen te voorspellen en te handelen als een detective die gereedschap kan gebruiken om mysteries op te lossen over een langere periode. Het grote idee is dat een AI, om een echte wetenschappelijke assistent te kunnen zijn, in staat moet zijn om verschillende soorten informatie (zoals tekst, afbeeldingen en getallen) te jongleren en gestaag aan een moeilijk probleem te blijven werken zonder op te geven of in de war te raken.
Het team achter dit project, van het Shanghai AI Laboratory, introduceert een nieuwe familie AI-modellen genaamd Intern-S2-Preview. Zie dit model als een enorme, 397 miljard parameters tellende "generalist" wetenschapper die bijna elke wetenschappelijke paper ooit geschreven heeft gelezen. Maar in plaats van daar alleen maar te zitten en dingen te weten, is dit model gebouwd om te handelen. Het kan naar een wetenschappelijk diagram kijken, het verhaal erachter begrijpen en vervolgens computertools gebruiken om simulaties uit te voeren of code te schrijven om een hypothese te testen.
Zo hebben ze deze superwetenschapper gebouwd:
Eerst hebben ze het model onderwezen door het miljoenen wetenschappelijke documenten te laten zien, maar niet alleen de tekst. Ze lieten het de werkelijke pagina's zien, met alle plaatjes, grafieken en vergelijkingen in hun originele lay-out. Het is alsof je een student onderwijst door het hele tekstboek aan te reiken, inclusclusief de diagrammen, in plaats van alleen de tekst hardop voor te lezen. Dit helpt het model te begrijpen hoe wetenschappers hun ideeën daadwerkelijk presenteren.
Daarna gaven ze het model een speciale "tijdreis"-vaardigheid. De meeste AI-modellen zijn slecht in het voorspellen van wat er volgt in een reeks getallen (zoals weerpatronen of aandelenkoersen). Intern-S2-Preview kreeg een speciale upgrade om deze "tijdreeks"-data aan te kunnen. Het kan nu naar een lange reeks getallen kijken en nauwkeurig voorspellen wat er hierna zal gebeuren, wat cruciaal is voor zaken als het voorspellen van klimaatverandering of het analyseren van hersensignalen.
Een van de coolste trucs die ze gebruikten, heet de Memory Decoder. Stel je voor dat het hoofdbrein van 397 miljard parameters een briljante generalist is die een beetje van alles weet. Maar wat als je een expert nodig hebt in slechts één klein gebied, zoals biologie? In plaats van het hele gigantische brein opnieuw te trainen (wat traag zou zijn en ervoor zou kunnen zorgen dat het andere dingen vergeet), hebben ze een kleine, gespecialiseerde "notitieblok" genaamd de Memory Decoder aan hen bevestigd. Dit notitieblok bevat specifieke biologische kennis. Wanneer de AI een biologische vraag moet beantwoorden, raadpleegt hij dit notitieblok. Het resultaat? De biologische scores van het model sprongen van 56,92 naar 60,32, terwijl de algemene kennis precies hetzelfde bleef. Het is alsof je een geniale vriend hebt die onmiddellijk een gespecialiseerde handleiding kan raadplegen wanneer je een specifieke vraag stelt, zonder dat hij hiervoor een nieuwe studie hoeft te volgen.
Het team heeft het model ook geleerd hoe het een long-horizon agent moet zijn. Dit betekent dat de AI een missie met meerdere stappen kan plannen. In plaats van alleen te antwoorden op "Wat is de hoofdstad van Frankrijk?", kan de opdracht zijn: "Ontwerp een nieuw medicijn." De AI kan dan: 1) zoeken naar bestaand onderzoek, 2) code schrijven om het gedrag van het medicijn te simuleren, 3) de simulatie uitvoeren, 4) beseffen dat het mislukt is, 5) de code aanpassen, en 6) het opnieuw proberen. Het artikel laat zien dat het model door het gebruik van een speciale trainingsmethode genaamd "reinforcement learning" heeft geleerd om deze lange, complexe workflows aan te pakken zonder vast te lopen of stomme fouten te maken.
Toen ze Intern-S2-Preview-397B testten, deed het het ongelooflijk goed. Op tests die meten hoe goed het biologie, chemie en natuurkunde begrijpt, versloeg het veel andere topmodellen. Het was bijzonder goed in het lezen van wetenschappelijke schema's en het voorspellen van tijdreeksgegevens, waarbij het vaak modellen presteerde die veel groter zijn of alleen gespecialiseerd zijn in die specifieke taken. Bijvoorbeeld, op een test genaamd Biology-Instructions scoorde het 56,92, en met de Memory Decoder toegevoegd, verbeterde dit naar 60,32. Op algemene redelijkheidstests zoals MMLU-Pro scoorde het 89,75, wat het beste is onder open-source modellen.
De auteurs zijn echter voorzichtig om dit een "Preview" te noemen. Het is een krachtig nieuw hulpmiddel, maar het is nog niet perfect. Ze merken op dat hoewel het model uitstekend is in het verbinden van redeneren aan actie, er nog werk te verzetten is om het nog betrouwbaarder te maken voor zeer lange, complexe wetenschappelijke workflows. Ze benadrukken ook dat dit model een fundament is — een startpunt dat kan worden aangepast met verschillende "geheugen-notitieblokken" voor verschillende wetenschappelijke velden, zonder dat het hele brein opnieuw gebouwd hoeft te worden.
Kortom, dit artikel presenteert een nieuw soort AI die klaar is om verder te gaan dan alleen vragen beantwoorden en daadwerkelijk aan het werk te gaan bij wetenschappelijke ontdekkingen, van het lezen van complexe grafieken tot het uitvoeren van lange experimenten, terwijl het de algemene kennis intact houdt en de gespecialiseerde vaardigheden scherp houdt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.