← Nieuwste papers
💬 NLP

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench is een repository-niveau agentic coding benchmark met 25 inheems geschreven Russische taakspecificaties uit live open-source projecten, ontworpen om productwaardige coding agents te evalueren op echt onderhoudswerk, terwijl datacontaminatie wordt weerstaan en kritieke inzichten in de gedrag van uitgerolde systemen worden onthuld door middel van rigoureuze statistische analyse en trajectauditing.

Oorspronkelijke auteurs: Evgeny Shilov (Independent Researcher)

Gepubliceerd 2026-07-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Evgeny Shilov (Independent Researcher)

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van deskundige monteurs inhuurt om een vloot complexe, op maat gemaakte racewagens te repareren. Tot nu toe waren de meeste tests voor deze monteurs geschreven in perfect, formeel Engels, als een technische handleiding. Maar in de echte wereld praten klanten niet als handleidingen; ze praten als mensen. Ze zeggen dingen als: "Mijn auto begon te schudden elke keer als ik op de rem trapte op een regenachtige dinsdag," in hun eigen moedertaal.

RuBench is een nieuwe test die ontworkt is om te zien of AI-coderingsassistenten daadwerkelijk deze rommelige, echte klantverzoeken kunnen begrijpen wanneer deze in het Russisch zijn geschreven, en niet in het Engels.

Hier is een uitsplitsing van hoe de test werkt, wat er gebeurde en de verrassende wending die de onderzoekers ontdekten, met behulp van eenvoudige analogieën.

1. De Test: Een "Echte" Garage

De meeste eerdere tests gaven AI-agenten een heldere, Engelse beschrijving van een bug. RuBench is anders:

  • De Auto's: De test gebruikt vijf echte, populaire open-source softwareprojecten (zoals aiohttp of Laravel). Dit zijn geen nep-puzzels; het zijn levende codebases die door duizenden ontwikkelaars worden gebruikt.
  • De Verzoeken: In plaats van een formele bugrapportage hebben de onderzoekers 25 nieuwe verzoeken vanaf nul geschreven in het Russisch. Deze klinken als een bedrijfseigenaar die klaagt tegen een aannemer: "De bot crasht wanneer we hem admin maken; fix het, maar ga niet de bestaande chats kapot."
  • De Mysterieuze Doos: De onderzoekers hebben het "antwoordmodel" (de eigenlijke code-fix en de tests die bewijzen dat het werkt) verborgen. De AI moet de fix zelf uitzoeken. Alleen de onderzoekers hebben de sleutel om te controleren of de AI is geslaagd.
  • Versheid: Alle bugs werden gevonden in code-updates die zijn gemaakt nadat de AI-modellen waren getraind. Dit zorgt ervoor dat de AI de antwoorden niet simpelweg heeft kunnen onthouden uit zijn trainingsdata.

2. De Monteurs: Wie heeft de klus geklaard?

De onderzoekers testten vier verschillende "monteursteams" (combinaties van softwaretools en AI-modellen). Ze lieten elk team de 25 reparaties drie keer uitvoeren om te zien hoe consistent ze waren.

  • De Sterprestatie: Het team dat Claude Code met het "Opus 4.8"-model gebruikte, was de beste. Het loste ongeveer 79% van de problemen succesvol op.
  • Het Middenveld: Het "Sonnet 5"-model deed het bijna net zo goed (75%), en het "GPT-5.5"-model (via Codex CLI) loste ongeveer 67% op.
  • De Moeizame Monteur: Het "Haiku 4.5"-model (een goedkopere, snellere versie) loste slechts ongeveer 53% van de taken op.

De Kanttekening: Omdat er slechts 25 taken waren, was het verschil tussen de top drie teams niet statistisch "bewezen" echt — het zou ook gewoon geluk kunnen zijn geweest. Echter, de kloof tussen de topteams en het moeizame Haiku-model was enorm en duidelijk. De topteams losten een compleet andere klasse problemen op dan het onderste team.

3. De Grote Verrassing: De "Stille Substitutie"

Dit is het meest interessante deel van het paper. De onderzoekers testten ook een vijfde team met een gloednieuw model genaamd Fable 5.

Toen ze nauwkeurig naar de "black box"-logs keken van wat de AI aan het doen was, ontdekten ze een geheim:

  • Bij 20% van de taken heeft het Fable 5-model het werk niet daadwerkelijk gedaan.
  • In plaats daarvan heeft het softwareproduct (Claude Code) Fable 5 stilletjes vervangen door het oudere, sterkere Opus 4.8-model halverwege de taak.
  • Waarom? Fable 5 heeft veiligheidscontroles die erg streng zijn. Toen het model een taak zag die te maken had met standaard internetprotocollen (zoals het repareren van een webheader), werd de veiligheidscontrole nerveus en zei: "Ik mag dit niet aanraken," waarna het systeem de taak automatisch aan Opus 4.8 overhandigde om het af te maken.

De Les: De onderzoekers realiseerden zich dat wanneer we AI-producten testen, we niet alleen het "brein" (het model) testen; we testen het "lichaam" (het hele softwarepakket). Als de software halverwege de taak stiekem van brein wisselt, geven de testresultaten een onjuist beeld van wat dat specifieke brein kan doen.

4. Het Eindoordeel

  • Succes: AI-agenten op productniveau zijn al goed genoeg om echt onderhoudswerk te kunnen afhandelen dat in een niet-Engelse taal (Russisch) is gespecificeerd. De beste opstelling loste bijna 8 van de 10 taken op.
  • Reality Check: De "goedkope" modellen (zoals Haiku) zijn nog steeds aanzienlijk zwakker en lossen slechts ongeveer de helft van de problemen op.
  • Methodologie: Het paper bewijst dat we, om eerlijke resultaten te krijgen, het volledige "dagboek" (traject) van de AI moeten bekijken om er zeker van te zijn dat het niet heeft valsgespeeld door van model te wisselen of de antwoorden online op te zoeken.

Kortom, RuBench laat zien dat AI goed wordt in het spreken van "mensentaal" (in het Russisch), maar het onthulde ook dat de software die deze AI's omhult soms sluw kan zijn door de werker te vervangen door een betere zonder dat dit wordt gemeld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →