← Últimos artículos
🤖 AI

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol es un marco iterativo que escala el razonamiento matemático multimodal mediante el desacoplamiento de la expansión de la dificultad del prompt a través de operadores de evolución conscientes del tipo y la imposición de la fiabilidad de la respuesta mediante la falsificación de hipótesis de múltiples fuentes, generando así datos verificados de alta calidad que impulsan significativamente el rendimiento del modelo en evaluaciones de matemáticas visuales.

Autores originales: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñarle a un estudiante muy inteligente, pero ligeramente ingenuo, cómo resolver problemas matemáticos complejos usando imágenes (como diagramas, tablas y gráficos).

En el pasado, los investigadores intentaron hacer a este estudiante más inteligente simplemente dándole más tarea. Generaban miles de preguntas nuevas. Pero había un inconveniente: a menudo solo hacían las preguntas más largas o ligeramente más difíciles sin comprobar realmente si las respuestas eran correctas. Era como si un profesor entregara un examen donde la clave de respuestas tuviera errores. Si el estudiante estudiaba las respuestas incorrectas, empeoraba en lugar de mejorar.

VeriEvol es un nuevo sistema que cambia la forma en que creamos esta tarea. En lugar de solo crear "más" preguntas, se enfoca en "mejores" preguntas y respuestas "verificadas". Los autores lo llaman un marco de trabajo de "Instrucción Evolutiva Verificable" (Verifiable Evol-Instruct).

Así es como funciona, desglosado en pasos simples:

1. El gimnasio de la "Evolución" (Hacer las preguntas más difíciles)

Imagina que tienes un ejercicio simple: "Mira esta imagen de un triángulo y dime cuántos lados tiene". Eso es demasiado fácil para un estudiante inteligente.

VeriEvol tiene un entrenador especial (el Módulo de Evolución) que mira la imagen y la pregunta, y luego reescribe la tarea para que sea mucho más difícil, pero que siga requiriendo mirar la imagen.

  • La metáfora: En lugar de solo preguntar "¿Cuántos lados tiene?", el entrenador la reescribe como: "Si cortas este triángulo por la mitad y lo rotas, ¿cómo cambiaría el área en comparación con un cuadrado con el mismo perímetro?".
  • El truco: El entrenador es lo suficientemente inteligente como para saber qué tipo de imagen es. Si es una tabla, crea una pregunta basada en la tabla. Si es un dibujo de geometría, crea una pregunta de geometría. No le lanza palabras aleatorias al estudiante; construye un desafío específico que lo obliga a mirar realmente la imagen para resolverlo.

2. El detective "Escéptico" (Comprobar las respuestas)

Esta es la parte más importante. Normalmente, cuando una computadora genera una respuesta, simplemente asumimos que es correcta. VeriEvol dice: "De ninguna manera. Intentemos demostrar que es falsa primero".

Construyeron un sistema de detective llamado HTV-Agent.

  • La metáfora: Imagina un tribunal. La computadora genera una respuesta (la "Hipótesis"). El HTV-Agent es un equipo de abogados escépticos cuya única misión es encontrar evidencia de que la respuesta es falsa.
  • Cómo luchan:
    • Usan diferentes "testigos" (diferentes resolutores de IA) para ver si todos están de acuerdo.
    • Usan una "calculadora" (ejecución de código) para comprobar las matemáticas.
    • Usan "ojos" (herramientas visuales) para comprobar si los números en la respuesta coinciden realmente con los píxeles de la imagen.
  • El veredicto: Si los detectives pueden encontrar cualquier prueba de que la respuesta es incorrecta, la tarea se tira a la basura. La respuesta solo se acepta si los detectives hacen todo lo posible por romperla y fallan. Solo entonces se convierte en una respuesta "Verificada".

3. El resultado: Un libro de texto súper confiable

El sistema toma estos dos pasos y los pone en un ciclo:

  1. Toma una pregunta simple.
  2. La evoluciona en un desafío difícil basado en imágenes.
  3. Genera una respuesta.
  4. Envía la respuesta a los Detectives Escépticos.
  5. Si los detectives no pueden romperla, la conservan. Si pueden hacerlo, la tiran y lo intentan de nuevo.

El resultado es una enorme biblioteca de más de 250,000 problemas matemáticos donde cada respuesta ha sido sometida a pruebas de estrés y verificada.

¿Qué pasó cuando lo usaron?

Los investigadores probaron esto en un "estudiante" de IA (un modelo de 7 mil millones de parámetros).

  • Sin VeriEvol: El estudiante era aceptable, pero a menudo se confundía con las imágenes o adivinaba basándose en patrones de texto.
  • Con VeriEvol: El estudiante mejoró significamente.
    • Cuando solo usaron las preguntas "Evolucionadas" (sin el verificador estricto), el estudiante mejoró.
    • Cuando añadieron al "Detective Escéptico" para asegurar que las respuestas fueran perfectas, el estudiante mejoró aún más.
    • La escala: Demostraron que a medida que añadían más de estas preguntas verificadas (de 10,000 a 250,000), el estudiante se volvía cada vez más inteligente, demostrando que la calidad de los datos importa más que la cantidad.

Por qué esto es importante (en términos simples)

La mayoría de las investigaciones de IA intentan hacer al "profesor" (el optimizador de la IA) más inteligente. VeriEvol dice: "Primero arreglemos el libro de texto".

Al separar el proceso de "hacer las preguntas más difíciles" de "comprobar si las respuestas son correctas", crearon un sistema donde los datos en sí mismos son confiables. No solo construyeron un mejor estudiante; construyeron un currículo mejor. Incluso publicaron todos sus "reportes de detective" (los rastros de cómo verificaron cada respuesta) para que otros investigadores puedan auditar su trabajo, asegurando que nadie haga trampa en la tarea.

En resumen: VeriEvol es un sistema que escribe automáticamente problemas matemáticos más difíciles basados en imágenes y luego utiliza un equipo de detectives digitales para asegurarse de que las respuestas sean 100% correctas antes de permitir que una IA aprenda de ellas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →