← Últimos artículos
💬 NLP

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

El artículo introduce Skill-Use, un benchmark que evalúa si los agentes de LLM pueden reconocer e implementar correctamente y de forma independiente habilidades estructuradas en entornos aislados, revelando que el uso fiable de habilidades sigue siendo un desafío significativo que depende fuertemente del harness específico del agente más que de ser una capacidad inherente del modelo.

Autores originales: Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

Publicado 2026-08-06
📖 3 min de lectura☕ Lectura para el café

Autores originales: Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un pasante súper inteligente e hipercreativo que puede escribir código, analizar datos y redactar correos electrónicos. Le entregas una enorme biblioteca de "Libros de Habilidades". Cada libro es una receta para un trabajo específico, como "Cómo arreglar un servidor averiado" o "Cómo redactar un contrato legal". El truco es que no le entregas el libro completo de una vez. En su lugar, solo le muestras el título y una pequeña descripción en la contraportada. Si cree que el libro es relevante, tiene que pedirlo, encontrar las instrucciones completas y luego seguir esas instrucciones exactamente sin saltarse pasos ni hacer nada prohibido. Este es el mundo de los "agentes" de IA intentando usar "habilidades". Durante un tiempo, la gente esperaba que si simplemente le dabas a estos pasantes de IA los libros adecuados, se convertirían instantáneamente en trabajadores perfectos. Pero nadie sabía realmente si la IA podría de hecho determinar qué libro tomar, o si simplemente adivinaría y esperaría lo mejor.

Un equipo de investigadores de Tencent Hunyuan y varias universidades de primer nivel decidió poner esta idea a prueba. Construyeron un patio de juegos gigante llamado SKILL-USE, un banco de pruebas diseñado para ver si los agentes de IA realmente pueden "leer la situación" y usar estos libros de habilidades correctamente. No se limitaron a preguntar: "¿Terminó la IA la tarea?". Hicieron tres preguntas mucho más difíciles: Trigger (Disparador) (¿Supo la IA siquiera que debía tomar el libro correcto?), Compliance (Cumplimiento) (¿Siguió la receta paso a paso?) y Boundary (Límite) (¿Evitó hacer las cosas prohibidas enumeradas en el libro?). Probaron 177 tareas diferentes del mundo real, desde reparar errores de software hasta escribir informes comerciales, utilizando 79 documentos de habilidades reales y ocho de los modelos de IA más inteligentes disponibles hoy en día.

Los resultados fueron un golpe de realidad. Los investigadores descubrieron que incluso las mejores configuraciones de IA solo lograban obtener una puntuación de "Skill-Use" de aproximadamente 0.613 (en una escala de 0 a 1). Eso significa que el uso fiable de las habilidades sigue estando fuera de alcance. El mayor problema no era que la IA no pudiera seguir las reglas una vez que tenía el libro; era que la IA a menudo ni siquiera sabía que debía tomar el libro en primer lugar. Es como tener un chef genio que puede seguir una receta perfectamente, pero que se olvida constantemente de abrir la nevera para buscar los ingredientes. Además, los investigadores descubrieron que el rendimiento de una IA no dependía solo de qué tan "inteligente" fuera el modelo; dependía en gran medida del "arnés" o el envoltorio de software que lo rodeaba. Cambiar el envoltorio era como cambiar la disposición de la cocina: a veces el mismo chef se convertía en una estrella y otras veces tropezaba.

En resumen, el artículo sugiere que dar a los agentes de IA una biblioteca de habilidades no los convierte automáticamente en mejores trabajadores. La brecha entre "tener una habilidad" y "usar una habilidad" es enorme. La IA a menudo no reconoce cuándo se aplica una habilidad, o se distrae con las habilidades equivocadas cuando hay demasiadas opciones. Si bien la IA está mejorando en evitar movimientos prohibidos, todavía lucha por seguir procedimientos complejos fielmente. Los autores concluyen que no podemos asumir que estos agentes aprenderán mágicamente a usar sus herramientas; necesitamos construir sistemas que ayuden a los agentes a reconocer cuándo usar una habilidad y cómo ceñirse al plan, porque ahora mismo, esa es la parte más difícil del rompecabezas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →