← Últimos artículos
💻 computer science

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

Este artículo presenta ClawMark, una nueva referencia diseñada para evaluar agentes compañeros de trabajo multimodales, multivuelta y multiday en un entorno dinámico y con estado, revelando que, aunque los modelos de vanguardia muestran un progreso parcial, luchan significativamente por adaptarse a cambios exógenos y lograr un éxito completo de las tareas de extremo a extremo.

Autores originales: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xi
Publicado 2026-04-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un nuevo asistente para ayudarte a gestionar tu oficina. La mayoría de las pruebas para asistentes de IA hoy en día son como un examen sorpresa: le plantean a la IA una sola pregunta, ella responde y la prueba termina. El mundo queda congelado en el tiempo durante ese examen.

Pero en la vida real, un asistente no solo responde una pregunta y se va. Se queda contigo durante días. Mientras trabajan, el mundo sigue cambiando a su alrededor. Llegan nuevos correos electrónicos, tu calendario cambia, los archivos se actualizan y aparece nueva evidencia (como fotos o notas de voz). Si tu asistente no nota estos cambios, podría tomar decisiones basadas en información antigua, lo que lleva a errores.

ClawMark es una nueva "prueba de manejo" diseñada específicamente para ver si los asistentes de IA pueden manejar esta realidad desordenada y cambiante.

La prueba de la "Oficina Viva"

En lugar de un examen congelado, ClawMark es como una oficina simulada que respira.

  • La configuración: Se le asigna a la IA un trabajo (como gestionar un reclamo de seguro o administrar un proyecto) que abarca varios "días laborables".
  • El giro: Entre cada día, el entorno cambia por sí mismo. Quizás llegue un nuevo correo electrónico, se actualice una hoja de cálculo o se deje caer un archivo silencioso en la carpeta sin que nadie le diga nada a la IA.
  • La evidencia: La IA no solo lee texto. Tiene que mirar fotos sin procesar, escuchar grabaciones de audio, leer PDFs escaneados y analizar video, tal como lo haría un humano.

Cómo califican a la IA

En muchas pruebas de IA, un humano u otra IA lee la respuesta y dice: "Eso suena bien". ClawMark hace algo más estricto: utiliza un árbitro robot.

  • No hay "opiniones" aquí. La prueba utiliza 1.537 pequeños scripts de Python automáticos (verificadores) que examinan el estado real de la computadora una vez que la IA termina.
  • ¿La IA guardó realmente el archivo? ¿Actualizó el calendario? ¿Detectó la foto oculta?
  • Si la IA dice "lo hice" pero el archivo no está allí, el árbitro robot pone un cero. Es como un examen de matemáticas donde solo obtienes puntos si la respuesta está escrita en el recuadro correcto, no solo si dijiste el número correcto en voz alta.

Los resultados: Buenos al empezar, malos al adaptarse

Los investigadores probaron siete modelos de IA de primer nivel (como los cerebros detrás de los principales chatbots) en esta "oficina viva". Esto es lo que descubrieron:

  1. La "puntuación perfecta" es rara: Incluso la mejor IA solo obtuvo un éxito integral "perfecto" en el 20% de las tareas. Esto significa que, aunque a menudo lograron algún progreso, rara vez terminaron todo el trabajo sin un solo error.
  2. La "caída del día 2": Este es el hallazgo más interesante. El primer día, las IAs lo hicieron bastante bien. Pero el segundo día, cuando el entorno cambió (nuevos correos electrónicos, nuevos archivos), seis de los siete modelos empeoraron significativamente.
    • Analogía: Imagina que estás jugando un videojuego. Superas el Nivel 1 fácilmente. Pero cuando el juego cambia repentinamente las reglas y añade nuevos enemigos en el Nivel 2, la IA olvida cómo jugar y empieza a tropezar. Le cuesta "despertar" y darse cuenta de que el mundo ha cambiado.
  3. Los cambios silenciosos son la kryptonita: La IA falló con más frecuencia cuando se perdió una "mutación silenciosa": un cambio que ocurrió sin un anuncio estridente (como un archivo que se actualiza silenciosamente en segundo plano). También tuvieron dificultades para realmente guardar su trabajo en el lugar correcto (escritura en el backend).

El veredicto

ClawMark muestra que, aunque los asistentes de IA se están volviendo más inteligentes resolviendo problemas individuales, aún están aprendiendo a ser compañeros de trabajo persistentes. Son buenos en el "primer día", pero a menudo pierden el equilibrio cuando el entorno de la oficina cambia a su alrededor.

El documento concluye que para construir un compañero de trabajo de IA verdaderamente confiable, debemos enfocarnos menos en qué tan bien responde a una sola pregunta y más en qué tan bien se adapta a un mundo cambiante y recuerda actualizar sus herramientas cuando el mundo cambia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →