← Últimos artículos
💻 computer science

OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training

El artículo presenta OracleAnalyser, un marco de post-entrenamiento de 3 mil millones de parámetros que utiliza un novedoso algoritmo de Optimización de Preferencia Focal Estable (SFPO, por sus siglas en inglés) y nuevos conjuntos de datos para avanzar significativamente en el análisis semántico implícito de las escrituras de huesos oraculares más allá de las tareas tradicionales de reconocimiento.

Autores originales: Zijia Song, Yelin Wang, Zhengyi Ma, Zitong Yu, Tianheng Wang, Jiahuan Zhang, Taorui Wang, Kaicheng Yu

Publicado 2026-06-25
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zijia Song, Yelin Wang, Zhengyi Ma, Zitong Yu, Tianheng Wang, Jiahuan Zhang, Taorui Wang, Kaicheng Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una caja de rompecabezas gigante y antigua hecha de caparazones de tortuga y huesos de animales. Estos son los Escritos de Huesos Oraculares, el sistema de escritura más antiguo de China, tallados hace miles de años. Durante mucho tiempo, los expertos han intentado descifrar qué significan estas extrañas imágenes. Hasta ahora, han logrado traducir unos 1,600 de los más de 4,500 caracteres, pero el resto sigue siendo un misterio.

Hasta ahora, la mayoría de los programas informáticos que intentaban resolver este rompecabezas eran como fotocopiadoras. Les muestras la imagen de un grabado en un hueso e intentan adivinar: "¿Es este el carácter 'A' o 'B'?". Son buenos reconociendo patrones que ya han visto antes, pero realmente no entienden la imagen. Solo memorizan la respuesta.

Este artículo presenta una nueva IA llamada OracleAnalyser. En lugar de ser solo una fotocopiadora, OracleAnalyser es como un detective o un traductor que realmente observa las pistas y explica por qué cree que un carácter significa lo que significa.

Así es como construyeron este detective, utilizando analogías sencillas:

1. El problema: "Adivinar a ciegas" vs. "Pensar"

Los modelos de IA anteriores eran como estudiantes que memorizaban la clave de respuestas pero no entendían las matemáticas. Si veían un carácter que no habían memorizado, simplemente adivinaban.

  • La forma antigua: Muestras la imagen de un hueso con el dibujo de una persona cargando algo sobre su cabeza. La IA adivina: "Este es el carácter para 'Cielo". Pero no puede explicar por qué.
  • La nueva forma (OracleAnalyser): La IA mira la misma imagen y dice: "Veo a una persona de pie. Hay una forma redondeada sobre su cabeza, como si estuviera cargando algo pesado. Esto parece el símbolo antiguo de 'Cielo'". Descompone la imagen en partes antes de dar la respuesta.

2. El entrenamiento: Enseñando al detective

Los investigadores no se limitaron a alimentar a la IA con más imágenes. Le enseñaron a pensar en tres pasos:

  • Paso 1: La clase magistral (Ajuste Fino Supervisado)
    Ellos tomaron una IA inteligente (Qwen2.5-VL) y le mostraron miles de ejemplos donde un experto explicaba la imagen antes de nombrar el carácter. Es como un profesor mostrándole a un estudiante: "Mira estas líneas; parecen un techo. Esto significa 'Casa'". La IA aprendió a imitar este razonamiento.

  • Paso 2: El examen de práctica (Generación de datos)
    Se le pidió a la IA que hiciera un examen. A veces acertaba, otras veces fallaba. Los investigadores recopilaron estos intentos.

    • La respuesta buena: "Esto parece un árbol con raíces". (Correcto)
    • La respuesta mala: "Esto parece un palo". (Incorrecto)
      Ellos usaron estos pares para enseñar a la IA la diferencia entre una buena explicación y una mala.
  • Paso 3: El entrenamiento especial (SFPO)
    Esta es la mayor innovación del artículo. Los métodos de entrenamiento estándar a veces pueden confundirse si las respuestas "malas" son en realidad más o menos correctas (por ejemplo, decir que un árbol parece un palo no es totalmente erróneo, pero no es lo suficientemente específico).
    Los investigadores crearon un nuevo método de entrenamiento llamado Optimización de Preferencia de Foco Estable (SFPO).

    • La analogía: Imagina a un entrenador que no se limita a gritar "¡Mal!" ante cada error. En su lugar, el entrenador se enfoca en los errores más importantes e ignora los que son demasiado confusos o triviales. También se asegura de que el estudiante no olvide todo lo aprendido en la primera clase (el paso de la "Clase magistral"). Esto mantiene a la IA estable y enfocada en las lecciones más valiosas.

3. El resultado: Un cerebro pequeño con grandes capacidades

Normalmente, para resolver problemas difíciles, necesitas un cerebro informático masivo (un modelo de IA gigante). Pero OracleAnalyser es sorprendentemente pequeño: solo tiene 3 mil millones de parámetros (piensa en esto como un cerebro pequeño y eficiente comparado con los cerebros gigantes de 70 mil millones de parámetros de sus competidores).

A pesar de ser más pequeño, funcionó mejor que todos los modelos gigantes.

  • En caracteres conocidos: Fue mucho mejor explicando el significado e identificando el carácter.
  • En caracteres desconocidos: Cuando se le mostró un grabado en hueso que nunca había visto, aún podía observar la imagen, describir las formas (como "parece humo" o "parece un techo") y hacer una suposición inteligente.

Resumen

El artículo afirma que, al enseñar a una IA a analizar la imagen primero (como un detective) en lugar de solo reconocer el patrón (como una fotocopiadora), y al utilizar un método de entrenamiento especial y estable para evitar la confusión, crearon una herramienta pequeña pero poderosa. Esta herramienta ayuda a los investigadores a comprender la historia antigua de China al explicar la "historia" detrás de los dibujos antiguos, no solo adivinando el nombre del carácter.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →