← Últimos artículos
💬 NLP

RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

RealClawBench introduce un marco de evaluación en vivo derivado de sesiones reales de agentes-desarrolladores de OpenClaw que utiliza entornos de ejecución reconstruidos y evaluadores deterministas para transformar 281 tareas desafiantes del mundo real en evaluaciones reproducibles, revelando brechas de rendimiento significativas en los modelos actuales.

Autores originales: Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

Publicado 2026-06-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de probar qué tan bueno es un nuevo robot chef.

La forma antigua (Benchmarks convencionales):
Tradicionalmente, los investigadores escribían una lista de recetas perfectas y de libro de texto como "Haz un sándwich de queso a la parrilla" o "Hornea un pastel de chocolate". Le daban estas recetas al robot y veían si seguía los pasos. ¿El problema? La vida real no es un libro de texto. En el mundo real, un cliente podría decir: "Mi pan está un poco rancio, el queso está al fondo de la nevera y solo tengo un horno tostador, no una parrilla. ¿Puedes hacer algo comestible?". Las pruebas antiguas no comprobaban si el robot podía lidiar con esos detalles desordenados del mundo real.

La nueva forma (REALCLAWBENCH):
Los autores de este artículo se dieron cuenta de que, para probar verdaderamente a un "agente desarrollador" (un robot que ayuda a los programadores), necesitaban dejar de escribir pruebas falsas y empezar a observar a personas reales usando los robots en el mundo real.

Construyeron un sistema llamado REALCLAWBENCH. Así es como funciona, usando analogías simples:

1. Capturando momentos reales (La fuente)

En lugar de inventar tareas, el equipo observó 76,155 sesiones reales donde desarrolladores reales usaron una herramienta llamada "OpenClaw" para obtener ayuda con su código. Vieron a personas reales pidiendo ayuda con solicitudes desordenadas, complicadas y, a veces, vagas.

  • Analogía: Imagina una cámara de seguridad grabando a miles de clientes reales pidiendo comida en un restaurante concurrido, en lugar de un chef escribiendo un menú en una cocina tranquila.

2. La "Limpieza Mágica" (El pipeline)

No puedes simplemente tomar la grabación bruta de un cliente real y convertirla en una prueba. La grabación puede contener contraseñas privadas, archivos secretos de la empresa o referencias a computadoras que ya no existen.
El artículo describe un pipeline (una línea de producción paso a paso) que limpia estos momentos reales:

  • Pantalla de Privacidad: Eliminan todos los secretos e información privada, como si se desenfocaran rostros en un video.
  • Reconstrucción del Entorno: Si un desarrollador le pidió al robot que arreglara un archivo en su computadora específica, el equipo construye una versión falsa y segura de ese entorno de computadora para que la prueba pueda ejecutarse de nuevo más tarde.
  • Reescritura de la Solicitud: Transforman una solicitud vaga y conversacional ("Oye, ¿puedes mirar eso que mencioné antes?") en una instrucción clara e independiente ("Por favor, corrige el error en el archivo de inicio de sesión").
  • El Juez Automático: En lugar de un humano calificando el trabajo, escriben un programa de computadora que verifica el resultado. ¿Se arregló el archivo? Sí/No. No se permiten conjeturas.

3. El Resultado: Una prueba "en vivo"

El producto final es un benchmark con 281 tareas del mundo real.

  • Por qué es especial: Es "en vivo" y está "anclado". Esto significa que la prueba no es una lista estática de preguntas que se queda obsoleta. Debido a que lo construyeron a partir de un flujo continuo de datos de usuarios reales, pueden actualizar la prueba más tarde con nuevos ejemplos del mundo real para mantenerla fresca.
  • La "Brecha de Realismo": El artículo argumenta que las pruebas anteriores tenían una "brecha" entre lo que probaban y lo que realmente sucede. REALCLAWBENCH cierra esa brecha. Es como cambiar el probar a un conductor en una pista de carreras perfecta y vacía por probarlo en el tráfico real de la hora punta con baches y peatones confundidos.

¿Qué encontraron?

Probaron 14 de los modelos de IA más inteligentes disponibles actualmente en este test desordenado y real.

  • La puntuación: Incluso el mejor modelo de IA (Claude Opus 4.7) solo resolvió alrededor del 66% de las tareas.
  • La conclusión: Esto significa que todavía hay mucho margen de mejora. Los "superinteligentes" robots actuales todavía están luchando con el tipo de problemas desordenados y de la vida real que los desarrolladores reales enfrentan cada día.

Resumen

En resumen, el artículo dice: "Dejen de probar robots con escenarios perfectos y falsos. Probémoslos con los problemas desordenados y reales que realmente enfrentan, pero límpienlos lo suficiente como para poder calificarlos justamente".

Construyeron un sistema para hacer exactamente eso, y descubrieron que incluso los mejores robots actuales todavía están a solo dos tercios de camino de ser verdaderamente confiables en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →