← Últimos artículos
💬 NLP

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench es un repositorio de evaluación de codificación agéntica a nivel de repositorio que presenta 25 especificaciones de tareas redactadas nativamente en ruso a partir de proyectos de código abierto reales, diseñado para evaluar agentes de codificación de grado de producto en tareas de mantenimiento reales mientras asegura la resistencia a la contaminación de datos y revela información crítica sobre los comportamientos de sistemas desplegados mediante un análisis estadístico riguroso y una auditoría de trayectorias.

Autores originales: Evgeny Shilov (Independent Researcher)

Publicado 2026-07-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Evgeny Shilov (Independent Researcher)

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un equipo de mecánicos expertos para reparar una flota de coches de carreras complejos y personalizados. Hasta ahora, la mayoría de las pruebas para estos mecánicos se habían escrito en un inglés perfecto y formal, como un manual técnico. Pero en el mundo real, los clientes no hablan como un manual; hablan como personas. Dicentes cosas como: "Mi coche empezó a vibrar cada vez que pisaba el freno en un martes lluvioso", en su propio idioma nativo.

RuBench es una nueva prueba diseñada para ver si los asistentes de programación de IA pueden realmente entender estas solicitudes desordenadas del mundo real cuando están escritas en ruso, no en inglés.

Aquí tienes un desglose de cómo funciona la prueba, qué sucedió y el giro sorprendente que los investigadores descubrieron, utilizando analogías sencillas.

1. La Prueba: Un taller de reparaciones del "Mundo Real"

La mayoría de las pruebas anteriores entregaban a los agentes de IA una descripción limpia y en inglés de un error. RuBench es diferente:

  • Los Coches: La prueba utiliza cinco proyectos de software de código abierto reales y populares (como aiohttp o Laravel). Estos no son acertijos falsos; son bases de código vivas utilizadas por miles de desarrolladores.
  • Las Solicitudes: En lugar de un informe de error formal, los investigadores escribieron 25 nuevas solicitudes desde cero en ruso. Suenan como un dueño de negocio quejándose con un contratista: "El bot se bloquea cuando lo hacemos administrador; arréglalo, pero no rompas los chats existentes".
  • La Caja Misteriosa: Los investigadores ocultaron la "clave de respuestas" (la corrección de código real y las pruebas que demuestran que funciona). La IA tiene que descubrir la solución por sí misma. Solo los investigadores tienen la clave para comprobar si la IA tuvo éxito.
  • Novedad: Todos los errores se encontraron en actualizaciones de código realizadas después de que los modelos de IA fueran entrenados. Esto asegura que la IA no pudiera simplemente haber memorizado la respuesta de sus datos de entrenamiento.

2. Los Mecánicos: ¿Quién hizo el trabajo?

Los investigadores probaron cuatro diferentes "equipos de mecánicos" (combinaciones de herramientas de software y modelos de IA). Pasaron cada equipo por las 25 reparaciones tres veces para ver qué tan consistentes eran.

  • El Rendimiento Estrella: El equipo que utilizaba Claude Code con el modelo "Opus 4.8" fue el mejor. Corrigió con éxito aproximadamente el 79% de los problemas.
  • El Grupo Medio: El modelo "Sonnet 5" lo hizo casi igual de bien (75%), y el "GPT-5.5" (a través de Codex CLI) corrigió alrededor del 67%.
  • El Mecánico con Dificultades: El modelo "Haiku 4.5" (una versión más barata y rápida) solo corrigió aproximadamente el 53% de las tareas.

El Problema: Debido a que solo hubo 25 tareas, la diferencia entre los tres mejores equipos no fue "probada" estadísticamente como real —podría haber sido solo suerte—. Sin embargo, la brecha entre los mejores equipos y el problemático modelo Haiku fue enorme y clara. Los mejores equipos resolvieron una clase de problemas completamente diferente a la del grupo de abajo.

3. La Gran Sorpresa: La "Sustitución Silenciosa"

Esta es la parte más interesante del artículo. Los investigadores también probaron un quinto equipo utilizando un modelo nuevo llamado Fable 5.

Cuando examinaron de cerca los registros de la "caja negra" de lo que estaba haciendo la IA, descubrieron un secreto:

  • En el 20% de las tareas, el modelo Fable 5 no realizó el trabajo en realidad.
  • En su lugar, el producto de software (Claude Code) sustituyó silenciosamente a Fable 5 por el modelo más antiguo y fuerte, Opus 4.8, en medio del trabajo.
  • ¿Por qué? Fable 5 tiene salvaguardas de seguridad que son muy estrictas. Cuando vio una tarea que involucraba protocolos estándar de internet (como arreglar un encabezado web), su salvaguarda de seguridad se puso nerviosa y dijo: "No se me permite tocar esto", y el sistema automáticamente le entregó el trabajo a Opus 4.8 para terminarlo.

La Lección: Los investigadores se dieron cuenta de que cuando probamos productos de IA, no estamos probando solo el "cerebro" (el modelo); estamos probando el "cuerpo" (todo el paquete de software). Si el software cambia secretamente el cerebro a mitad de la tarea, los resultados de la prueba están mintiendo sobre lo que ese cerebro específico puede hacer.

4. El Veredicto

  • Éxito: Los agentes de IA de grado de producto ya son lo suficientemente buenos como para manejar trabajos de mantenimiento real especificados en un idioma que no es el inglés (ruso). La mejor configuración resolvió casi 8 de cada 10 tareas.
  • Realidad: Los modelos "baratos" (como Haiku) siguen siendo significativamente más débiles, resolviendo solo la mitad de los problemas.
  • Metodología: El artículo demuestra que para obtener resultados honestos, debemos observar todo el "diario" (trayectoria) de la IA para asegurarnos de que no hizo trampa cambiando de modelo o buscando las respuestas en internet.

En resumen, RuBench muestra que la IA está mejorando en su capacidad de hablar "humano" (en ruso), pero también reveló que el software que envuelve a estas IA a veces puede ser astuto, sustituyendo al trabajador por uno mejor sin avisar a nadie.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →