Deze collectie duikt in de fascinerende wereld van de chemie tussen atomen, waar de interacties tussen cesium en chloor leiden tot unieke verbindingen met opmerkelijke eigenschappen. Van de vorming van zouten tot complexe toepassingen in materialenwetenschap, onderzoeken deze studies hoe fundamentele chemische krachten nieuwe technologieën mogelijk maken.

Op Gist.Science bewaken we de stroom van nieuw onderzoek dat via arXiv wordt gepubliceerd. Voor elk nieuw preprint in dit domein genereren wij zowel een begrijpelijke samenvatting voor een breed publiek als een gedetailleerde technische analyse, zodat de inzichten voor iedereen toegankelijk zijn. Hieronder vindt u de meest recente publicaties in dit dynamische onderzoeksgebied.

💬 NLP

Attribution in Scientific Literature: New Benchmark and Methods

Dit artikel introduceert REASONS, een grootschalige benchmark en een duaal-metrisch raamwerk dat is ontworpen om de betrouwbaarheid van wetenschappelijke citatie-attributie in grote taalmodellen te evalueren en te verbeteren door hallucinatiepercentages af te wegen tegen gepaste onthouding onder variërende bewijsvoorwaarden.

Deepa Tilwani, Yash Saxena, Seyedali Mohammadi, Ankur Padia, Edward Raff, Amit Sheth, Srinivasan Parthasarathy, Manas Ga (…)2026-09-09
💬 NLP

SAEs Can Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs

Dit artikel introduceert Dynamic SAE Guardrails (DSG), een nieuwe unlearning-methode die gebruikmaakt van dynamische Sparse Autoencoders om de computationele, stabiliteits- en interpreteerbaarheidsbeperkingen van traditionele gradiëntgebaseerde benaderingen te overwinnen, waarbij superieure precisie en robuustheid wordt bereikt bij het verwijderen van ongewenste kennis uit LLM's.

Aashiq Muhamed, Jacopo Bonato, Mona Diab, Virginia Smith2026-09-09
💬 NLP

Introducing HALC: A general pipeline for the systematic and reliable construction of prompts for automated coding with LLMs in the computational social sciences

Dit artikel introduceert HALC, een algemene pijplijn die is ontworpen om systematisch en betrouwbaar prompts te construeren voor geautomatiseerde inhoudsanalyse met behulp van Large Language Models, waarbij de effectiviteit ervan over diverse datasets, talen en coderings-taken wordt aangetoond door middel van uitgebreide empirische evaluatie.

Andreas Reich, Claudia Thoms, Tobias Schrimpf2026-09-09
💬 NLP

The Flaw of Averages: Measuring Benchmark-Level Distributional Robustness

Dit artikel introduceert "Harmony", een op entropie gebaseerde metriek voor het meten van de distributionele robuustheid van benchmarks voor taalmodellen, waarbij wordt aangetoond dat benchmarks met een lage Harmony vaak de brede competentie van modellen verkeerd weergeven door ongelijke prestaties in subdomeinen, en wordt aanbevolen dat Harmony samen met de geaggregeerde nauwkeurigheid wordt gerapporteerd om meer representatieve evaluaties te waarborgen.

Arda Uzunoglu, Tianjian Li, Daniel Khashabi2026-09-09
💬 NLP

The human-authorship halo: attribution bias in literary style evaluation by humans and AI

Deze studie onthult dat zowel menselijke als AI-evaluatoren een systematische pro-menselijke attributiebias vertonen bij de beoordeling van literaire stijl, waarbij AI-modellen deze neiging versterken door inhoud die als "AI-gegenereerd" wordt bestempeld aanzienlijk te devalueren, ongeacht de werkelijke bron, waardoor zij menselijke culturele vooroordelen tegen kunstmatige creativiteit repliceren en intensiveren.

Wouter Haverals, Meredith Martin2026-09-09
💬 NLP

Strong but Brittle: Simple Attacks Subvert Reasoning-based Safety Guardrails

Dit artikel toont aan dat redeneergebaseerde veiligheidsmaatregelen in Large Reasoning Models, ondanks het bereiken van bijna perfecte weigeringspercentages, kritiek kwetsbaar zijn voor eenvoudige aanvallen die de logica van faseovergangen manipuleren, waardoor verdedigingen worden omzeild en schadelijke inhoud met een succespercentage van tot 90% wordt opgeroepen.

Shuo Chen, Zhen Han, Haokun Chen, Bailan He, Shengyun Si, Jingpei Wu, Philip Torr, Volker Tresp, Jindong Gu2026-09-09
💬 NLP

Deep Research Agents Brings Deeper Harm

Dit artikel onthult dat Deep Research-agenten aanzienlijk kwetsbaarder zijn voor veiligheidsbreuken dan standalone LLM's omdat hun meerstaps-uitvoering en roltoewijzingsmechanismen de weigeringsbewustheid onderdrukken en schadelijkheid over stappen verdelen, waardoor aanvallers technieken zoals Intent Hijack en Plan Injection kunnen gebruiken om gedetailleerde, gevaarlijke rapporten op te roepen.

Shuo Chen, Zonggen Li, Xingyu Jin, Zhen Han, Bailan He, Tong Liu, Haokun Chen, Georg Groh, Philip Torr, Volker Tresp, Ji (…)2026-09-09
💬 NLP

ConsistencyAI: A Benchmark to Assess LLMs' Factual Consistency When Responding to Different Demographic Groups

Het artikel introduceert ConsistencyAI, een onafhankelijke benchmark die 19 grote taalmodellen evalueert op feitelijke consistentie over diverse demografische persona's heen, wat onthult dat consistentiescores significant variëren naar zowel modelprovider als onderwerp, met een gemiddelde benchmarkdrempel van 0,8656.

Peter Banyas, Shristi Sharma, Alistair Simmons, Atharva Vispute2026-09-09
💬 NLP

PAN: A World Model for General, Actionable, and Long-Horizon World Simulation

Dit artikel introduceert PAN, een wereldmodel gebouwd op de Generative Latent Prediction (GLP)-architectuur dat de bestaande beperkingen in algemene, open-domein, actiegestuurde voorspelling en langetermijnconsistentie overwint door staatshoudende latente representaties, gesloten informatieflow en een gemengde LLM/diffusie-backbone te combineren om geavanceerde simulatieve redenering en planning mogelijk te maken.

PAN Team, Zihan Liu, Yi Gu, Mingkai Deng, Guangyi Liu, Zeyu Feng, Qiyue Gao, Yiyan Hu, Benhao Huang, Yichi Yang, Kun Zho (…)2026-09-09
💬 NLP

FigEx2: Visual-Conditioned Panel Detection and Captioning for Scientific Compound Figures

Ex2 is een visueel geconditioneerd framework dat gelabelde panelen gezamenlijk detecteert en bijschriften genereert voor wetenschappelijke composietfiguren door gebruik te maken van een Entity-Attention KL-regularisator en Group Relative Policy Optimization, waardoor eerder weggegooide figuren worden hersteld en het bestaande modellen aanzienlijk overtreft in wetenschappelijke getrouwheid en lokalisatienauwkeurigheid.

Jifeng Song, Arun Das, Pan Wang, Hui Ji, Kun Zhao, Yufei Huang2026-09-09