← Últimos artículos
💻 computer science

Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes

Este artículo propone y evalúa un sistema de agente virtual basado en el borde utilizando Modelos de Lenguaje Pequeños (SLM) para implementar los procesos de "Pensamiento" y "Memoria" de la Arquitectura de Agente Cognitivo Corpóreo (CEAA), demostrando una orquestación cognitiva eficiente y consciente del contexto en hardware NVIDIA Jetson para mundos virtuales inmersivos.

Autores originales: Aimilios Hadjiliasi, Louis Nisiotis

Publicado 2026-08-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Aimilios Hadjiliasi, Louis Nisiotis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde tus personajes de videojuegos, guías turísticos virtuales o amigos del Metaverso no solo siguen un guion como un robot leyendo un teleprompter. En su lugar, están verdaderamente "vivos" en el sentido digital: recuerdan lo que les dijiste ayer, entienden tus bromas y pueden tomar decisiones sobre la marcha. Este es el sueño de los "Agentes Virtuales Corporeizados". Pero hay un inconveniente. Para hacer que estos personajes sean inteligentes, normalmente necesitan enviar sus pensamientos a computadoras masivas y superpotentes en la nube. Esto toma tiempo, crea latencia y puede sentirse desconectado.

Entran en escena dos nuevos héroes: los Modelos de Lenguaje Pequeños (SLM, por sus siglas en inglés) y la Computación de Borde (Edge Computing). Piensa en los SLM como un cerebro brillante pero compacto que cabe en tu bolsillo, capaz de entender el lenguaje sin necesidad de una supercomputadora. La Computación de Borde es como mover ese cerebro desde un centro de datos distante directamente al lado de la acción, quizás incluso al dispositivo que estás usando. La gran pregunta que los científicos se están haciendo es: ¿Podemos poner este "cerebro de bolsillo" justo al lado de nuestros amigos virtuales para que puedan pensar, recordar y actuar instantáneamente, sin esperar a que una señal viaje hasta la nube y regrese? Este artículo profundiza precisamente en eso, probando si estos cerebros más pequeños y locales son lo suficientemente inteligentes para manejar la pesada carga de la memoria y la toma de decisiones para los agentes virtuales.


El Cerebro y el Bibliotecario: El Dilema de un Agente Virtual

En el mundo de la realidad virtual, un agente necesita dos cosas principales para sentirse real: un proceso de Pensar (para decidir qué hacer) y un proceso de Memoria (para recordar quién eres y de qué han hablado). Los investigadores detrás de este estudio querían ver si podían construir un "motor cognitivo" para estos agentes utilizando Modelos de Lenguaje Pequeños ejecutándose en un dispositivo local, específicamente una pequeña pero potente computadora llamada NVIDIA Jetson Orin NX. No solo querían que el agente pudiera charlar; querían que actuara como un verdadero asistente que pudiera dirigir tus solicitudes al servicio correcto (como generar un modelo 3D o reproducir un sonido) y llevar un diario de tu conversación.

Para probar esto, construyeron un sistema donde el "cerebro" del agente era un modelo Qwen2.5. Probaron tres tamaños diferentes de estos "cerebros": uno diminuto con 0.5 mil millones de parámetros, uno mediano con 1.5 mil millones y uno más grande con 3.0 mil millones. Los colocaron todos en el dispositivo de borde y les dieron una serie de desafíos para ver qué tan bien podían pensar y recordar.

La Prueba de "Pensar": Dirigir Solicitudes

Primero, probaron el proceso de Pensar. Imagina que estás en un mundo virtual y dices: "Necesito un efecto de sonido de un rugido de dragón" o "¿Puedes generar una textura para una pared de castillo?". El agente necesita determinar instantáneamente qué herramienta utilizar. Es como un recepcionista en un hotel concurrido que tiene que dirigir a los huéspedes a la habitación correcta: el spa, el gimnasio o el restaurante.

Los resultados mostraron un claro compromiso entre velocidad e inteligencia. El modelo diminuto de 0.5B fue rápido pero a menudo se perdía. Solo obtuvo la respuesta correcta el 29.4% de las veces. Confundía con frecuencia solicitudes similares, como mezclar "generación de imagen a 3D" con "generador conversacional". Era como un recepcionista que envía a todo el mundo al gimnasio porque olvidó dónde están las otras habitaciones.

El modelo de 1.5B fue una gran mejora, acertando el 85.4% de las veces. Podía manejar la mayoría de las solicitudes bien, aunque todavía tropezaba un poco con tareas 3D complejas. El modelo de 3.0B fue el más inteligente, logrando una precisión del 87.7%, especialmente en tareas de generación complicadas. Sin embargo, ser más inteligente tenía un precio: el modelo de 3.0B tardaba mucho más en pensar. Su tiempo de respuesta promedio fue de 5,067 milisegundos (unos 5 segundos), en comparación con los 3,349 milisegundos (unos 3.3 segundos) del modelo de 1.5B. El modelo de 0.5B fue el más rápido, con 1,504 milisegundos, pero era demasiado poco fiable para ser útil.

La Prueba de "Memoria": Recordar los Detalles

A continuación, probaron el proceso de Memoria. Esto es como pedirle al agente que recuerde un detalle específico que mencionaste anteriormente, o que actualice un dato si cambiaste de opinión. Por ejemplo, si dices: "El nombre de mi personaje es Alex", y más tarde dices: "En realidad, mi nombre es Alex el Bravo", el agente debe recordar la actualización y no confundirse.

Aquí, las diferencias fueron aún más marcadas. El modelo de 0.5B logró recordar los hechos correctamente el 72.8% de las veces, pero era terrible manejando correcciones. A menudo recordaba a la persona correcta pero el detalle equivocado, o no se daba cuenta de que habías cambiado de opinión. Era como un amigo que recuerda tu nombre pero sigue olvidando que te acabas de cortar el cabello.

El modelo de 1.5B lo hizo mejor, acertando el 78.4% de las respuestas. Era bueno con hechos simples, pero todavía tenía dificultades con actualizaciones complejas o para distinguir entre memorias similares. El modelo de 3.0B fue el claro ganador, alcanzando una precisión del 93.6%. Podía manejar de manera confiable hechos, actualizaciones y correcciones. Sin embargo, al igual igual que en la prueba de pensamiento, esta alta precisión vino acompañada de una fuerte penalización de velocidad. El modelo de 3.0B tardó un promedio de 9,693 milisegundos (casi 10 segundos) en procesar una solicitud de memoria, con algunas solicitudes tomando hasta 14,531 milisegundos (más de 14 segundos) en los peores casos. El modelo de 0.5B fue mucho más rápido, con 2,025 milisegundos, pero su baja precisión lo convertía en una mala opción para cualquier cosa seria.

El Veredicto: Depende del Trabajo

Entonces, ¿qué descubrieron los investigadores? Descubrieron que los Modelos de Lenguaje Pequeños pueden alimentar parcialmente las partes de "Pensar" y "Memoria" de un agente virtual directamente en el borde, sin necesidad de la nube. Pero no existe un tamaño "perfecto" único.

Si necesitas velocidad y puedes tolerar algunos errores, los modelos más pequeños son más rápidos pero poco fiables. Si necesitas alta precisión para recordar detalles o tomar decisiones complejas, los modelos más grandes son mucho mejores, pero son lentos. El artículo sugiere que la mejor solución podría ser un enfoque híbrido: utilizar un modelo más pequeño y rápido para tareas rápidas y simples (como dirigir una solicitud) y un modelo más grande e inteligente para el trabajo pesado (como recordar un historial complejo o manejar correcciones).

El estudio concluye que, si bien nos estamos acercando a tener agentes virtuales que puedan pensar y recordar localmente, aún tenemos trabajo por hacer. Los modelos actuales son un poco lentos para interacciones en tiempo real e instantáneas, y a veces se confunden sobre qué acción tomar. Pero este es un primer paso prometedor, que muestra que con la mezcla adecuada de tamaños de modelo y un diseño cuidadoso, podemos empezar a construir amigos virtuales que no solo sean bonitos de ver, sino verdaderamente lo suficientemente inteligentes como para pasar el rato con nosotros en el Metaverso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →