Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
Este artículo propone la Optimización de Política Relativa de Grupo con Calibración de Rechazo (RC-GRPO, por sus siglas en inglés), una estrategia de aprendizaje por refuerzo que permite a los Modelos de Lenguaje de Gran Escala Multimodales rechazar eficazmente objetos inexistentes en la Comprensión de Expresiones de Referencia Generalizada sin comprometer su precisión de localización en objetivos existentes.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que le estás enseñando a un robot a jugar al juego de "Veo, veo" con un humano. El humano señala una imagen y dice: "Busca la pelota roja". Si la pelota roja está ahí, el robot debe señalarla directamente. Pero, ¿qué pasa si el humano dice "Busca la pelota roja" y la imagen en realidad muestra un gato azul? Un robot inteligente debería decir: "No puedo encontrar una pelota roja aquí; no hay ninguna". Sin embargo, muchos de los cerebros informáticos superinteligentes de hoy en día (llamados Modelos de Lenguaje de Gran Escala Multimodales) son como estudiantes entusiastas que tienen terror a equivocarse. Están tan desesperados por dar una respuesta que, cuando no ven la pelota roja, simplemente adivinan de todos modos, señalando al gato azul e insistiendo: "¡Aquí está!". Esto se llama "alucinación": inventar hechos que no son ciertos.
Este artículo aborda una versión específica y complicada de este problema llamada "Comprensión de Expresiones Referenciales Generalizada". Es una forma elegante de decir: "¿Puede el robot encontrar el objeto si está ahí, y puede decir honestamente 'no lo veo' si no está?". Los investigadores descubrieron que, aunque estos robots son excelentes encontrando cosas, son pésimos admitiendo cuando algo falta. Si simplemente los entrenas para que digan "no" con más frecuencia, se asustan demasiado y dejan de encontrar las cosas que sí están ahí. El equipo necesitaba una forma de enseñar al robot a decir "no" solo cuando es realmente necesario, sin que olvide cómo decir "sí" cuando tiene razón.
Los autores de este artículo proponen un nuevo y astuto método de entrenamiento llamado Optimización de Política Relativa de Grupo Calibrada por Rechazo (RC-GRPO). Piensa en el proceso de aprendizaje del robot como en un juego de "Caliente o Frío". Normalmente, el robot recibe una puntuación basada en qué tan cerca está su suposición. Pero cuando el objeto no está, el robot sigue adivinando de todos modos, por lo que nunca aprende la respuesta correcta. El primer truco de los investigadores fue obligar al robot a decir "Ninguno, no lo veo" durante sus sesiones de práctica, incluso si quería adivinar. Esto le dio al robot una "recompensa" clara por decir lo correcto cuando el objeto faltaba.
Sin embargo, se dieron cuenta de que si solo elogiaban al robot por decir "Ninguno", este empezaría a decir "Ninguno" para todo, incluso cuando el objeto sí estaba allí. Para solucionar esto, añadieron una regla especial: si el robot dice "Ninguno" cuando un objeto está presente, recibe una gran penalización. Es como decirle al robot: "Está bien que digas que no ves la pelota si la pelota no está ahí, pero si dices que no la ves cuando la tienes justo delante, pierdes puntos". También añadieron una segunda etapa donde el robot tiene que explicar por qué cree que el objeto falta (por ejemplo, "No veo una pelota roja porque solo hay un gato azul"). Esto obliga al robot a comprender realmente la imagen en lugar de simplemente memorizar un patrón.
Los resultados muestran que este método funciona muy bien. Cuando probaron su nuevo método en tres pruebas diferentes y desafiantes, los robots mejoraron mucho tanto en la búsqueda de objetos como en el rechazo de adivinanzas cuando estos no estaban presentes. Por ejemplo, en una de las pruebas, su método mejoró la precisión general del robot del 45% al 62%, e incluso superó a otros métodos avanzados por un margen significativo. El artículo sugiere que este enfoque ayuda al robot a encontrar un equilibrio perfecto: deja de inventar ubicaciones falsas para objetos ausentes, pero no pierde su capacidad de encontrar los reales. Es un paso hacia la creación de una IA que no solo sea inteligente, sino también honesta sobre lo que ve y lo que no ve.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.