← Derniers articles
💻 computer science

Research on the Generation of Tibetan Word-levelAdversarial Samples Based on Morphosyntactic Linkage

Cet article propose TWLASBMSL, une nouvelle méthode de génération d'échantillons adverses au niveau du mot en tibétain qui intègre le lien morphosyntaxique pour garantir la correction grammaticale tout en trompant efficacement les modèles cibles dans les tâches d'analyse de sentiment et de classification de texte.

Auteurs originaux : Btsan lhaMgon, Qun Nuo, Nyima Tashi

Publié 2026-08-31
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Btsan lhaMgon, Qun Nuo, Nyima Tashi

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé technique : Recherche sur la génération d'échantillons adverses au niveau du mot pour le tibétain basés sur le lien morphosyntaxique

Énoncé du problème

Bien que le traitement intelligent de l'information en tibétain ait progressé de manière significative avec l'émergence des grands modèles de langage (par exemple, DEEPZANG, YangGuang QingYan), la sécurité et la robustesse de ces modèles face aux attaques adverses restent sous-recherchées par rapport à l'anglais et au chinois. Les méthodes existantes d'attaque adverse en tibétain reposent principalement sur des perturbations au niveau du caractère ou de la syllabe (par exemple, le remplacement, l'insertion ou la suppression de syllabes). Une limitation critique de ces approches est la négligence des normes grammaticales tibétaines, spécifiquement les règles régissant les mots-outils (particules indiquant le cas, la possession, la localisation, etc.).

Lorsque les méthodes existantes effectuent des substitutions au niveau du mot sans respecter le lien morphosyntaxique, les échantillons adverses résultants souffrent souvent d'une rupture de la logique de la phrase et de règles grammaticales invalides. Par exemple, remplacer un mot de contenu en tibétain nécessite souvent un changement correspondant dans le mot-outil suivant (par exemple, le génitif, l'ergatif ou le locatif) pour maintenir la légalité grammaticale. L'échec de la mise à jour de ces mots-outils rend l'échantillon adverse linguistiquement invalide, réduisant son efficacité et sa qualité.

Méthodologie : TWLAS-BMSL

Le papier propose le TWLAS-BMSL (Génération d'échantillons adverses au niveau du mot pour le tibétain basée sur le lien morphosyntaxique), une méthode conçue pour générer des exemples adverses de haute qualité et grammaticalement corrects. Le cadre opère sous un paradigme d'attaque en boîte blanche et se compose de quatre étapes centrales :

  1. Perturbation aléatoire des mots :

    • En utilisant une Base de connaissances de sémèmes tibétains construite (contenant 32 745 entrées), la méthode identifie les mots de contenu dans le texte original.
    • Elle associe aléatoirement ces mots à des alternatives sémantiquement similaires provenant de la base de connaissances.
    • Un remplacement d'un seul mot est effectué pour créer un texte perturbé qui préserve autant que possible le sens sémantique original.
  2. Détection et correction des mots-outils :

    • Reconnaissant que les relations sémantiques profondes en tibétain sont organisées par les mots-outils, la méthode emploie un algorithme de détection et de correction de l'attachement des mots-outils.
    • Lors du remplacement d'un mot-clé, l'algorithme analyse dynamiquement la catégorie grammaticale du nouveau mot (par exemple, s'il agit comme un sujet agent ou s'il nécessite une marque de cas spécifique).
    • Il met automatiquement à jour les mots-outils suivants (génitif, ergatif, locatif et suffixes de noms personnels) pour s'aligner sur les règles grammaticales tibétaines (spécifiquement les règles des « Trente Versets » concernant les lettres de suffixe).
  3. Reconstruction :

    • Le système reconstruit la phrase en intégrant le mot-clé sémantiquement similaire avec les mots-outils grammaticalement corrigés.
  4. Exécution de l'attaque :

    • L'échantillon adverse final reconstruit est injecté dans le modèle cible pour induire une erreur de classification.

Principales contributions

Les auteurs soulignent trois contributions primaires :

  • Méthode de lien morphosyntaxique : La proposition d'une méthode de génération adverse au niveau du mot qui incorpore explicitement le lien morphosyntaxique, garantissant que les mots-outils s'adaptent automatiquement pour correspondre aux mots de contenu remplacés. Cela améliore la robustesse des modèles de langue tibétains contre les attaques de perturbation en boîte blanche.
  • Algorithmes d'adaptation automatique : L'établissement de critères et d'algorithmes pour l'adaptation et la mise à jour automatique des mots-outils tibétains lors de la perturbation, comblant ainsi une lacune dans les stratégies d'attaque existantes centrées sur le chinois et l'anglais.
  • Base de connaissances de sémèmes tibétains : La construction d'une base de connaissances de sémèmes spécialisée pour le tibétain avec 32 745 entrées, spécifiquement conçue pour faciliter les expériences adverses au niveau du mot dans le texte tibétain.

Résultats expérimentaux

L'étude a évalué la méthode TWLAS-BMSL sur quatre ensembles de données (TNCC, TU_SA, QHNUTSA, MZUCTSA) couvrant les tâches de classification de texte et d'analyse de sentiment. Les modèles cibles incluaient TiBERT, CINO-base-v2 et CINO-large.

  • Efficacité de l'attaque :

    • La méthode a provoqué une baisse de précision moyenne (ADV) de 2,69 % à travers les modèles.
    • Le taux de réussite de l'attaque (ASR) moyen a atteint 28,83 %.
    • La distance de Levenshtein (LD) moyenne était de 6,80 %, indiquant que les attaques nécessitaient des perturbations relativement faibles pour être efficaces.
    • Le modèle CINO-base-v2 a montré la plus grande sensibilité à l'attaque, tandis que CINO-large a démontré la plus grande robustesse.
  • Performance de la correction grammaticale :

    • Dans la tâche d'adaptation automatique et de correction d'erreurs pour les mots-outils, la méthode a atteint 100 % dans trois indicateurs clés :
      • Le taux de détection d'erreur des mots-outils.
      • La précision globale.
      • Le taux de réussite de la correction complète des phrases erronées.
  • Analyse qualitative :

    • Sans le lien morphosyntaxique, les échantillons générés contenaient souvent des erreurs grammaticales qui brisaient la logique de la phrase. Avec la méthode proposée, les échantillons adverses ont maintenu la rigueur grammaticale tout en trompant avec succès les modèles cibles.

Signification et affirmations

Le papier affirme que la méthode TWLAS-BMSL proposée traite efficacement le problème de la « logique syntaxique imprécise » des attaques adverses tibétaines existantes. En garantissant que les mots-outils sont mis à jour de concert avec les substitutions de mots de contenu, la méthode garantit la rigueur de la logique grammaticale des échantillons générés.

Les auteurs affirment que cette approche non seulement parvient à induire les modèles en erreur pour prendre des décisions de classification incorrectes, mais garantit également la qualité textuelle des exemples adverses, les rendant indiscernables du texte naturel en termes de correction grammaticale. Cela est présenté comme une étape cruciale vers l'amélioration de la sécurité et de la robustesse des grands modèles de langage tibétains.

Le papier conclut modestement, reconnaissant des limites telles que la taille finie de la Base de connaissances de sémèmes construite (32 745 entrées) et la rareté des grands modèles spécifiques au tibétain pour les tests. Des travaux futurs sont suggérés pour appliquer cette méthode aux grands modèles de langage tibétains afin de renforcer davantage leurs capacités anti-interférence.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →