← Últimos artículos
💬 NLP

ORCA-bench: How Ready Are Language Model Agents for Oncall?

El artículo presenta ORCA-bench, un benchmark de fidelidad de producción para evaluar agentes de modelos de lenguaje en tareas de análisis de causa raíz de guardia, revelando que incluso los modelos de frontera más avanzados logran actualmente una precisión baja (25,3 % en dificultad media) y luchan contra las alucinaciones, lo que indica una brecha significativa antes de que puedan ser confiados de manera segura con la fiabilidad de la producción en el mundo real.

Autores originales: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

Publicado 2026-07-31
📖 4 min de lectura☕ Lectura para el café

Autores originales: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el capitán de una enorme y tecnológicamente avanzada nave espacial que surca la galaxia. De repente, la computadora de la nave empieza a actuar de forma extraña: las luces parpadean, la gravedad falla y la máquina de café escupe chispas. No sabes exactamente qué está mal, pero sabes que la nave está en problemas. En el mundo real, estas naves espaciales son los sitios web y las aplicaciones que usamos todos los días, y los "capitanes" son ingenieros especiales llamados Ingenieros de Confiabilidad de Sitio (SRE, por sus siglas en inglés). Su trabajo es descubrir por qué algo se rompió, a menudo comenzando con una queja vaga como "el botón de pago no funciona" o "el sitio está lento". Tienen que excavar a través de montañas de pistas digitales —como registros de tráfico, mensajes de error y código— para encontrar la única pieza rota antes de que toda la nave se estrelle.

Durante mucho tiempo, las personas han intentado enseñar a las computadoras a realizar este trabajo de detective utilizando Inteligencia Artificial (IA), específicamente Modelos de Lenguaje Extensos (LLM). Estos son las mismas computadoras inteligentes que pueden escribir historias, responder preguntas e incluso ayudar a escribir código. La gran pregunta que todos se hacen es: "¿Están estos detectives de IA listos para tomar el volante y arreglar nuestros sistemas del mundo real cuando las cosas salen mal?". Es un juego de alto riesgo porque, si una IA adivina mal, podría convertir un pequeño fallo en un desastre masivo.

Este artículo, titulado ORCA-BENCH, establece un campo de entrenamiento gigante y realista para probar exactamente eso. Los investigadores construyeron una tienda en línea falsa pero increíblemente detallada (llamada la "Tienda de Astronomía") que funciona durante seis días, generando una enorme cantidad de ruido digital, tal como lo haría un sitio web real y concurrido. Luego crearon 1,079 "incidentes misteriosos" diferentes donde rompieron secretamente cosas en el sistema y le pidieron a cinco de los agentes de IA más inteligentes disponibles que resolvieran el caso. Le dieron a la IA las mismas herramientas que usaría un ingeniero humano: acceso a los flujos de datos en vivo, el código fuente y una queja vaga de un usuario.

¿Los resultados? Los detectives de IA todavía están en etapa de entrenamiento. Incluso los mejores modelos de IA solo pudieron resolver correctamente cerca del 25% de los casos de "dificultad media", y lograron apenas un 10% en los casos más difíciles. Para poner esto en perspectiva, si un ingeniero humano obtuviera una puntuación del 10% en un examen, sería despedido; para estas IA, es el estado del arte actual. El artículo encontró que cuando la IA no podía ver el código fuente, su rendimiento empeoraba aún más. Quizás lo más preocupante es que la IA a menudo "alucinaba", lo que significa que inventaba con confianza razones falsas para los problemas que no existían en absoluto. En un caso, una IA culpó a un fallo del navegador en una herramienta de prueba por el fallo del carrito de compras de un usuario, pasando por alto por completo al verdadero culpable.

Los autores concluyen que, si bien estos agentes de IA son impresionantes escribiendo código, aún no están listos para ser confiados con la seguridad de sistemas reales y en vivo. La brecha entre lo que la IA puede hacer en una prueba controlada y lo que se necesita para mantener internet funcionando de manera segura sigue siendo enorme. El artículo sugiere que, antes de dejar que la IA tome el turno de "guardia", necesitamos realizar mucho más trabajo de ingeniería para hacerlas confiables, porque en este momento, es más probable que adivinen mal que resuelvan el misterio.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →