MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4
Este artículo presenta MiniGPT-Reverse-Designing, un modelo MiniGPT-4 ajustado que extiende las capacidades de visión y lenguaje a la compleja tarea de predecir ediciones de imágenes y sus parámetros dada una imagen de origen, una versión editada y descripciones textuales opcionales.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En el mundo moderno de la inteligencia artificial, las computadoras se han vuelto notablemente buenas en dos cosas separadas: ver y hablar. Por un lado, los sistemas de visión pueden mirar una fotografía y describir lo que está sucediendo con una precisión sorprendente. Por otro lado, los modelos de lenguaje pueden escribir historias, responder preguntas y mantener conversaciones procesando vastas cantidades de texto. Recientemente, los científicos han comenzado a unir estas dos capacidades, creando sistemas que pueden entender una imagen y una oración al mismo tiempo. Estas herramientas híbridas, conocidas como modelos de visión y lenguaje, ya pueden realizar tareas como responder preguntas sobre una imagen o escribir un pie de foto para una escena. Sin embargo, la mayoría de estos sistemas están entrenados para mirar una sola imagen y describirla, o para mirar una imagen y una pregunta y proporcionar una respuesta. Todamente no están entrenados para mirar un par de imágenes de "antes y después" y determinar exactamente qué cambió entre ellas, especialmente cuando ese cambio involucra ajustes específicos como el brillo, el contraste o el equilibrio de color.
Este vacío en la comprensión es el foco de un nuevo estudio realizado por los investigadores Vahid Azizi y Fatemeh Koochaki. Ellos se propusieron ver si un poderoso modelo de visión y lenguaje de código abierto llamado MiniGPT-4 podía ser enseñado a realizar una tarea que ellos llaman "diseño inverso". Imagine que tiene la foto de un atardecer, y luego tiene una segunda versión de esa misma foto donde el cielo ha sido hecho más naranja y el agua más oscura. Un editor humano podría saber exactamente qué controles deslizantes se movieron para lograr ese aspecto. Los investigadores querían saber si una computadora podía mirar la original y la versión editada, quizás con una pista vaga como "hazlo más dramático", y luego predecir los pasos técnicos específicos y los números utilizados para crear esa edición. Este es un desafío complejo porque la computadora debe entender simultáneamente dos imágenes diferentes y la relación entre ellas, una tarea que va más allá de simplemente describir lo que hay en una sola imagen.
Para probar esto, los investigadores tomaron el modelo MiniGPT-4, que ya estaba entrenado para entender imágenes y texto, y lo ajustaron (fine-tuned) utilizando un conjunto de datos específico llamado I-MAD-Dense. Este conjunto de datos contiene alrededor de 22,000 ejemplos, cada uno consistente en una imagen de origen, una versión editada de esa imagen y una descripción de alto nivel de la idea creativa detrás de la edición. Crucialmente, el conjunto de datos también incluye la "verdad fundamental" (ground truth), que es la lista exacta de operaciones y sus valores numéricos que fueron aplicados a la imagen original para crear la nueva. Los investigadores convirtieron estas listas técnicas de operaciones en oraciones para que la parte de lenguaje del modelo pudiera leerlas. Luego, alimentaron al modelo con pares de imágenes junto con descripciones de texto opcionales y le pidieron que predijera la lista de cambios que transformaron la primera imagen en la segunda.
El equipo realizó varios experimentos para ver qué tan bien podía el modelo aprender esta habilidad. En su primer intento, simplemente ajustaron el modelo existente sin cambiar su estructura. Los resultados mostraron que el modelo podía aprender la tarea, prediciendo con éxito los tipos de cambios aproximadamente el 72 por ciento de las veces en promedio. Sin embargo, los investigadores notaron que el modelo a veces adivinaba el número incorrecto de cambios o se equivocaba ligeramente en los valores específicos. Para mejorar esto, intentaron añadir una penalización matemática al proceso de entrenamiento cada vez que los números predichos por el modelo para los ajustes estaban lejos de los valores correctos. Este pequeño ajuste ayudó al modelo a ser más preciso con los números, reduciendo el error promedio en sus predicciones. También probaron si darle al modelo un comando específico en el texto, como "ajusta el brillo", ayudaría. Los resultados confirmaron que tener este contexto textual adicional mejoraba significamente la capacidad del modelo para encontrar los cambios correctos, especialmente cuando las instrucciones eran claras.
Los investigadores también exploraron si añadir marcadores especiales al texto para separar las imágenes de las palabras ayudaría al modelo a mantener el rastro de las diferentes entradas. Intentaron insertar un token específico para señalar dónde terminaba una imagen y comenzaba la siguiente, pero esto de hecho empeoró el rendimiento del modelo. Este hallazgo sugiere que la forma existente en que el modelo maneja las imágenes y el texto era suficiente y que añadir marcadores adicionales y artificiales lo confundió en lugar de aclararlo. Otro experimento consistió en intentar enseñar al modelo a predecir el número de cambios con mayor precisión al penalizarlo por adivinar demasiados o muy pocos, pero este enfoque también falló en mejorar los resultados y, en algunos casos, los empeoró.
La versión más exitosa de su sistema, que combinó el modelo ajustado con una forma específica de manejar errores numéricos, mostró que estos modelos de visión y lenguaje son, de hecho, capaces de aprender relaciones complejas de múltiples pasos entre imágenes. El modelo funcionó mejor cuando se le dio una descripción textual de la edición, resaltando la importancia del lenguaje para guiar la comprensión visual. Si bien el sistema aún no es perfecto y todavía tiene dificultades con algunos escenarios complejos, el estudio demuestra que los modelos disponibles comercialmente pueden extenderse para manejar tareas sofisticadas como la ingeniería inversa de ediciones de imagen. Los investigadores concluyen que, aunque sus resultados actuales son prometedores, todavía hay espacio para la mejora, como el uso de imágenes de mayor resolución para capturar detalles más finos o el entrenamiento del modelo en datos generados por humanos aún más cuidadosamente seleccionados. Este trabajo abre la puerta a futuras herramientas que podrían ayudar a los editores a comprender sus propios flujos de trabajo o permitir que las computadoras aprendan de la historia de cómo se crean las imágenes.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.