← Últimos artículos
🤖 AI

Copy-on-Write Scoring: Application-Specific Agent Evaluations

Este artículo presenta la Calificación de Copia al Escribir (CoW Scoring), un marco que aprovecha el aislamiento a nivel de PostgreSQL para evaluar agentes basados en LLM directamente dentro de entornos de aplicación, permitiendo la identificación granular y rentable de fallos de escritura en la base de datos y mejoras iterativas en las superficies de herramientas de los agentes.

Autores originales: Joanna Roy, Sven Hoelzel

Publicado 2026-07-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Joanna Roy, Sven Hoelzel

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que acabas de construir un asistente robótico superinteligente que puede hablar con tus aplicaciones favoritas, como una herramienta de gestión de proyectos o un calendario. Quieres que te ayude a organizar tu vida, pero te aterroriza que pueda borrar accidentalmente toda tu lista de tareas pendientes o cambiar el estado de tu jefe a "de vacaciones" cuando en realidad está en una reunión. Este es el mundo de los agentes de IA: programas informáticos que no solo charlan, sino que realmente hacen cosas en los sistemas de software. El gran problema actual es cómo probar estos robots de forma segura. Normalmente, los científicos los prueban en mundos ficticios creados artificialmente (como la simulación de un videojuego), pero esas simulaciones suelen alejarse de la realidad, o son tan costosas de construir que nadie puede permitirse actualizarlas cada vez que la aplicación real cambia. Necesitamos una forma de observar al robot trabajar en la aplicación real sin que llegue a romper nada, para poder ver exactamente dónde se confunde y solucionarlo.

Aquí entra una nueva idea llamada Puntuación de Copia sobre Escritura (CoW Scoring), propuesta por los investigadores Joanna Roy y Sven Hölzel. Piensa en su método como una "pared de cristal mágica" construida directamente dentro de una base de datos (el archivador digital donde las aplicaciones guardan sus datos). Normalmente, si le dices a un robot "cambia este archivo", este va directamente al archivo real y escribe sobre él. Con CoW, se le dice al robot que escriba en una hoja de cristal especial e invisible que se sitúa encima del archivo real. El robot cree que está escribiendo en el objeto real, pero en realidad solo está escribiendo en el cristal. El archivo original debajo permanece perfectamente seguro e intacto.

Aquí está la parte ingeniosa: el sistema mantiene una versión de la "verdad fundamental" (ground truth) de lo que debería suceder (como un humano perfecto realizando la tarea) y la compara con lo que el robot hizo en el cristal. Debido a que el robot está escribiendo en una capa separada, los investigadores pueden ver instantáneamente: "Oh, el robot intentó eliminar la fila equivocada", o "Añadió un comentario a la tarea incorrecta". Pueden puntuar el rendimiento del robot basándose en qué tan cerca estuvo su escritura en el cristal de la versión humana perfecta. Si el robot falla, los investigadores simplemente limpian el cristal y vuelven a intentarlo, sin tener que restaurar una copia de seguridad ni preocuparse por corromper los datos reales.

En su estudio, el equipo probó esto en Plane, una plataforma de gestión de proyectos de código abierto. Configuraron 20 tareas diferentes del mundo real, como "mover todos los errores sin resolver a la lista de 'En progreso'" o "asignar nuevas tareas a miembros específicos del equipo". Dejaron que cinco modelos de IA diferentes intentaran realizar estos trabajos mientras el sistema CoW observaba. Los resultados fueron reveladores. Los investigadores descubrieron que muchos robots fallaban no porque fueran "tontos", sino debido a desajustes de vocabulario. Por ejemplo, la aplicación llamaba a ciertas cosas "elementos de trabajo", pero los robots buscaban "problemas" (issues). Los robots se quedaban atascados, se rendían o empezaban a alucinar (inventando comandos falsos) porque no encontraban las palabras correctas.

Al usar la Puntuación CoW, el equipo pudo señalar estos fallos exactos. Se dieron cuenta de: "Ah, el robot está fallando aquí porque no sabe que 'problema' significa 'elemento de trabajo'". Así que actualizaron las herramientas que utiliza el robot para incluir ambos términos. Cuando ejecutaron las pruebas de nuevo, los robots mejoraron mucho. Por ejemplo, un modelo llamado Gemini-2.5-Pro mejoró su puntuación en un 54%, y otro llamado GPT-4.1 subió un 47%. El estudio sugiere que este método de la "pared de cristal" es una forma poderosa y de bajo costo para depurar agentes de IA en aplicaciones reales, ayudando a los desarrolladores a arreglar las herramientas y los prompts específicos que confunden a los robots, en lugar de simplemente adivinar qué salió mal. Es una forma de dejar que los robots practiquen en el mundo real sin el riesgo de un desastre en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →