← Derniers articles
💻 computer science

OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training

L'article présente OracleAnalyser, un cadre post-entraîné de 3 milliards de paramètres utilisant un nouvel algorithme d'optimisation de préférence à foyer stable (SFPO) et de nouveaux ensembles de données pour faire progresser de manière significative l'analyse sémantique implicite des inscriptions sur os oraculaires au-delà des tâches de reconnaissance traditionnelles.

Auteurs originaux : Zijia Song, Yelin Wang, Zhengyi Ma, Zitong Yu, Tianheng Wang, Jiahuan Zhang, Taorui Wang, Kaicheng Yu

Publié 2026-06-25
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zijia Song, Yelin Wang, Zhengyi Ma, Zitong Yu, Tianheng Wang, Jiahuan Zhang, Taorui Wang, Kaicheng Yu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une boîte à énigmes géante et antique, faite de carapaces de tortues et d'ossements d'animaux. Ce sont des Écritures sur Os Oraculaires, le plus ancien système d'écriture en Chine, gravé il y a des milliers d'années. Pendant longtemps, des experts ont tenté de comprendre la signification de ces étranges dessins. Jusqu'à présent, ils ont réussi à traduire environ 1 600 des 4 500+ caractères, mais le reste demeure un mystère.

Jusqu'à présent, la plupart des programmes informatiques essayant de résoudre ce puzzle étaient comme des photocopieuses. Vous leur montrez l'image d'une gravure sur un os, et elles essaient de deviner : « Est-ce le caractère 'A' ou 'B' ? ». Elles sont douées pour faire correspondre des motifs qu'elles ont déjà vus, mais elles ne comprennent pas vraiment l'image. Elles se contentent de mémoriser la réponse.

Ce document présente une nouvelle IA appelée OracleAnalyser. Au lieu d'être une simple photocopieuse, OracleAnalyser est comme un détective ou un traducteur qui examine réellement les indices et explique pourquoi il pense qu'un caractère signifie ce qu'il signifie.

Voici comment ils ont construit ce détective, en utilisant des analogies simples :

1. Le Problème : « Deviner aveuglément » vs « Réfléchir »

Les modèles d'IA précédents étaient comme des étudiants qui mémorisent le corrigé sans comprendre les mathématiques. S'ils voyaient un caractère qu'ils n'avaient pas mémorisé, ils se contentaient de deviner.

  • L'ancienne méthode : Montrez l'image d'un os avec le dessin d'une personne portant quelque chose sur la tête. L'IA devine : « C'est le caractère pour 'Ciel'. » Mais elle ne peut pas expliquer pourlement.
  • La nouvelle méthode (OracleAnalyser) : L'IA regarde la même image et dit : « Je vois une personne debout. Il y a une forme ronde au-dessus de sa tête, comme si elle portait quelque chose de lourd. Cela ressemble au symbole ancien pour 'Ciel'. » Elle décompose l'image en plusieurs parties avant de donner la réponse.

2. L'Entraînement : Enseigner au Détective

Les chercheurs n'ont pas seulement nourri l'IA avec plus d'images. Ils lui ont appris à réfléchir en trois étapes :

  • Étape 1 : Le Cours Magistral (Ajustement Fin Supervisé)
    Ils ont pris une IA intelligente (Qwen2.5-VL) et lui ont montré des milliers d'exemples où un expert expliquait l'image avant de nommer le caractère. C'est comme un professeur montrant à un élève : « Regardez ces lignes ; elles ressemblent à un toit. Cela signifie 'Maison'. » L'IA a appris à imiter ce raisonnement.

  • Étape 2 : L'Examen Blanc (Génération de Données)
    L'IA a été mise à l'épreuve. Parfois, elle trouvait la bonne réponse, parfois elle se trompait. Les chercheurs ont collecté ces tentatives.

    • La bonne réponse : « Cela ressemble à un arbre avec des racines. » (Correct)
    • La mauvaise réponse : « Cela ressemble à un bâton. » (Faux)
      Ils ont utilisé ces paires pour apprendre à l'IA la différence entre une bonne explication et une mauvaise.
  • Étape 3 : Le Coaching Spécial (SFPO)
    C'est la plus grande innovation du papier. Les méthodes d'entraînement standard peuvent parfois s'embrouiller si les « mauvaises » réponses sont en fait plutôt proches de la vérité (par exemple, dire qu'un arbre ressemble à un bâton n'est pas totalement faux, mais ce n'est pas assez précis).
    Les chercheurs ont créé une nouvelle méthode de coaching appelée Stable Focal Preference Optimization (SFPO).

    • L'analogie : Imaginez un entraîneur qui ne se contente pas de crier « Faux ! » à chaque erreur. Au lieu de cela, l'entraîneur se concentre sur les erreurs les plus importantes et ignore celles qui sont trop confuses ou triviales. Il veille également à ce que l'étudiant n'oublie pas tout ce qu'il a appris lors du premier cours (l'étape du « Cours Magistral »). Cela permet de garder l'IA stable et concentrée sur les leçons les plus précieuses.

3. Le Résultat : Un petit cerveau avec de grandes capacités

Habituellement, pour résoudre des problèmes difficiles, il faut un cerveau informatique massif (un modèle d'IA géant). Mais OracleAnalyser est étonnamment petit — il n'a que 3 milliards de paramètres (considérez cela comme un petit cerveau efficace comparé aux cerveaux géants de 70 milliards de paramètres de ses concurrents).

Malgré sa petite taille, il est plus performant que tous les modèles géants.

  • Sur les caractères connus : Il était bien meilleur pour expliquer la signification et identifier le caractère.
  • Sur les caractères inconnus : Lorsqu'on lui montrait une gravure sur os qu'il n'avait jamais vue, il pouvait toujours regarder l'image, décrire les formes (comme « ressemble à de la fumée » ou « ressemble à un toit ») et faire une supposition intelligente.

Résumé

Le papier affirme qu'en apprenant à une IA à analyser l'image d'abord (comme un détective) plutôt qu'à simplement reconnaître le motif (comme une photocopieuse), et en utilisant une méthode d'entraînement spéciale et stable pour éviter la confusion, ils ont créé un outil petit mais puissant. Cet outil aide les chercheurs à comprendre l'histoire ancienne de la Chine en explant l'« histoire » derrière les dessins anciens, et non pas seulement en devinant le nom du caractère.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →