← Últimos artículos
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

El artículo presenta a InfantAgent-Next, un agente generalista multimodal altamente modular que integra capacidades basadas en herramientas y puramente visuales para permitir una interacción colaborativa y paso a paso con el ordenador, logrando un rendimiento de vanguardia en diversos puntos de referencia, incluidos OSWorld, GAIA y SWE-Bench.

Autores originales: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Publicado 2026-05-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente personal muy inteligente, pero ligeramente torpe, llamado InfantAgent-Next.

En el mundo de la automatización informática, la mayoría de los asistentes actuales son como especialistas que solo saben hacer una cosa muy bien, o generalistas que intentan hacerlo todo pero a menudo se confunden.

  • Algunos asistentes son como Bibliotecarios: Son excelentes usando una lista específica de herramientas (como "buscar en la web" o "abrir un archivo"), pero si les pides que hagan clic en un botón en una pantalla que nunca han visto antes, se congelan porque no tienen una herramienta para ese botón específico.
  • Otros asistentes son como Artistas: Pueden mirar una pantalla y "ver" lo que hay, pero les cuesta hacer matemáticas complejas o escribir código porque intentan hacerlo todo solo con sus ojos, sin una calculadora ni un editor de texto.

InfantAgent-Next es diferente. Es como contratar a un Equipo de Navaja Suiza en lugar de a una sola persona.

Cómo Funciona: El Equipo de "Cerebro y Manos"

En lugar de un solo cerebro gigante que intenta hacerlo todo, InfantAgent-Next divide cada trabajo en pequeños pasos y envía cada paso al experto mejor adecuado para él.

  1. El Gerente (El Planificador): Cuando pides "Guardar esta página web en mis marcadores", un modelo de "Gerente" de alto nivel lee tu solicitud. No intenta hacer clic con el ratón él mismo. En su lugar, dice: "Bien, necesitamos abrir el navegador, encontrar el botón de marcadores y hacer clic en él".
  2. Los Especialistas: El Gerente luego llama al experto adecuado para el trabajo:
    • El Ojo (Anclaje Visual): Si la tarea es "hacer clic en el botón rojo", un modelo de visión especializado mira la pantalla, encuentra las coordenadas exactas de píxeles de ese botón rojo y le dice al sistema dónde hacer clic. Es como un observador de ojos agudos guiando a un arquero con los ojos vendados.
    • La Calculadora (Ejecución de Código): Si la tarea es "analizar este archivo de Excel", el Gerente entrega el archivo a un experto en codificación que escribe un script para hacer las matemáticas instantáneamente, en lugar de intentar contar las filas mirando la pantalla.
    • El Oído (Análisis de Audio): Si subes una grabación y preguntas "¿Qué número de página se menciona?", un modelo de audio especializado escucha el archivo y extrae la respuesta.
  3. La Memoria: El sistema mantiene una libreta compartida. Cada vez que un especialista termina un paso, lo escribe. El siguiente especialista toma la libreta, lee lo que sucedió y continúa la historia. Esto asegura que el equipo no pierda de vista el objetivo.

Por Qué Esto Importa (Los Trucos de "Magia")

El artículo destaca dos problemas principales que resuelve este sistema:

  • El Problema de "Hacer Clic": Muchos agentes de IA son malos haciendo clic en el lugar correcto de una pantalla. Podrían hacer clic 5 píxeles a la izquierda y perder el botón. InfantAgent-Next utiliza una técnica de "Acercar" (Zoom-In). Si necesita hacer clic en un botón, no solo adivina. Toma una foto de la pantalla, encuentra el área general, recorta esa área para hacerla más grande, encuentra el botón de nuevo, la recorta de nuevo y luego hace clic. Es como usar una lupa para encontrar una aguja en un pajar, asegurando que el clic sea preciso.
  • El Problema de "Editar": Al editar un archivo de texto, la IA a menudo se equivoca con los números de línea (por ejemplo, "Cambia la línea 5" cuando debería ser la línea 6). InfantAgent-Next tiene un sistema de "Doble Verificación". Propone un cambio, luego mira el texto real para verificar: "¿La línea 5 dice realmente lo que creo que dice?". Si no es así, ajusta su plan antes de hacer la edición, evitando errores desordenados.

Lo Que Puede Hacer (La Prueba)

Los investigadores probaron este "Equipo de Especialistas" contra otros agentes de IA de primer nivel en tres tipos de desafíos:

  1. Tareas de Escritorio del Mundo Real (OSWorld): Le pidieron al agente que hiciera cosas como "descargar un archivo", "editar un documento" y "navegar por un sitio web". InfantAgent-Next superó al famoso agente "Uso de Computadora de Claude" en un 7,27%. Fue mejor para realmente lograr el trabajo sin ayuda humana.
  2. Codificación y Corrección de Errores (SWE-Bench): Le pidieron al agente que corrigiera código roto en proyectos de software reales. Rindió tan bien o mejor que muchos agentes comerciales cerrados y costosos.
  3. Conocimiento General y Lógica (GAIA): Le hicieron preguntas complejas que requerían buscar en la web, leer archivos y razonar. InfantAgent-Next quedó en segundo lugar entre todos los agentes de código abierto, demostrando que puede manejar lógica complicada y de múltiples pasos.

La Conclusión

InfantAgent-Next no es solo un modelo de IA grande que intenta ser todo. Es un director modular que sabe exactamente cuándo llamar al "Ojo", al "Oído", al "Codificador" o al "Hacedor de Clics con el Ratón". Al permitir que cada especialista haga lo que mejor sabe hacer, todo el sistema se vuelve mucho más inteligente, más preciso y capaz de manejar las tareas desordenadas del mundo real que enfrentamos en nuestros computadoras todos los días.

Los investigadores han puesto el código de este "Equipo de Especialistas" a disposición de cualquiera para usarlo y estudiarlo, con la esperanza de ayudar a construir asistentes informáticos aún mejores en el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →