← Últimos artículos
🤖 machine learning

Interactive Training 2: Auditable Control Plane for Live Model Training

Este artículo presenta Interactive Training 2, un plano de control de código abierto que permite la dirección auditable y en tiempo real del entrenamiento de modelos en vivo a través de un protocolo compartido y un espacio de trabajo Aim personalizado, permitiendo tanto a humanos como a agentes automatizados modificar de forma segura los parámetros de entrenamiento a través de diversos flujos de trabajo.

Autores originales: Wentao Zhang, Xuanhe Pan, Han Zhou, Yang Lu, Yuntian Deng

Publicado 2026-07-22
📖 4 min de lectura☕ Lectura para el café

Autores originales: Wentao Zhang, Xuanhe Pan, Han Zhou, Yang Lu, Yuntian Deng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás observando a un maestro chef cocinar un plato complejo. Puedes ver la olla burbujeando, oler las especias y notar que la salsa se está espesando demasiado. En los viejos tiempos, si querías decirle al chef que bajara el fuego o añadiera una pizca de sal, tenías que correr a la cocina, agarrar una herramienta específica y susurrar instrucciones que solo ese chef entendía. Si querías hablar con un chef diferente cocinando un plato distinto, necesitabas un conjunto de herramientas completamente nuevo y un lenguaje nuevo. Así es como solía funcionar el entrenamiento de modelos de inteligencia artificial: los investigadores podían observar el proceso de "cocción", pero cambiar la receta mientras sucedía era desordenado, requería código personalizado para cada experimento y era difícil de rastrear.

Ahora, imagina que cada cocina tuviera un sistema de intercomunicación universal y mágico. Podrías acercarte a él, decir "añade más sal" o "baja el fuego", y el chef te escucharía, comprobaría si es seguro hacerlo en este momento y luego realizaría el cambio exactamente cuando la olla esté lista. ¿Lo mejor de todo? El sistema anotaría exactamente quién pidió qué, cuándo lo pidió y si el chef lo hizo. Este es el mundo del "Entrenamiento Interactivo", un campo donde los investigadores intentan dirigir a los modelos de IA mientras están aprendiendo, en lugar de solo observarlos. La gran pregunta es: ¿cómo hacemos que este control sea fácil, seguro y registrable para cualquier chef de IA, no solo para los que usan una marca específica de estufa?

Este artículo presenta Interactive Training 2, un nuevo "plano de control" que actúa como ese intercomunicador universal para el entrenamiento de IA. Los autores construyeron un sistema de código abierto que permite a los humanos, scripts de computadora o incluso agentes de IA (como robots inteligentes) hablar con un modelo de entrenamiento a través de un lenguaje único y compartido. En lugar de escribir nuevo código para cada experimento, un investigador simplemente le dice al sistema: "Aquí están las perillas que puedo girar (como la velocidad de aprendizaje) y los botones que puedo presionar (como guardar un punto de control)".

Así es como funciona en la práctica: un investigador (o un agente de IA inteligente) observa un tablero en vivo que muestra cómo lo está haciendo el modelo. Si el modelo tiene dificultades, puede enviar una solicitud a través del sistema, como "baja la tasa de aprendizaje a 0.00002". El modelo de entrenamiento no cambia instantáneamente; en su lugar, espera hasta un momento seguro en su proceso de cocción —lo que los autores llaman un "punto de control"— para realizar el cambio. Luego, verifica si la solicitud es válida, la aplica y escribe toda la historia en un diario digital. Este diario conecta la solicitud con el resultado, la nueva puntuación y la versión guardada del modelo, creando un rastro claro y auditable de quién hizo qué y cuándo.

El equipo probó este sistema en cinco tipos diferentes de tareas de IA, incluyendo la enseñanza de modelos para entender los sentimientos humanos (análisis de sentimiento) y jugar juegos (aprendizaje por refuerzo). Demostraron que el mismo sistema podía manejar desde ajustes simples de la tasa de aprendizaje hasta cambios complejos en la forma en que el modelo procesa los datos. En estas pruebas, utilizaron un agente de IA para actuar como el "asistente del chef", que observaría los resultados, decidiría qué cambiar a continuación y enviaría la solicitud. El sistema registró con éxito cada paso, desde el plan inicial hasta el resultado final, demostrando que se puede dirigir un modelo de IA en vivo sin romper el código ni perder el rastro de la historia.

El artículo no pretende haber resuelto todos los problemas del entrenamiento de IA o ser una solución mágica que garantice resultados perfectos. En su lugar, ofrece una base reutilizable. Sugiere que, al separar el "dirigir" de la "cocción", podemos hacer que el entrenamiento sea más flexible y más fácil de estudiar. Los autores demuestran que este enfoque funciona a través de diferentes marcos de trabajo y que permite tanto a humanos como a agentes automatizados colaborar en la mejora de los modelos de IA en tiempo real, todo ello manteniendo un registro perfecto de todo el viaje.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →