Research on the Generation of Tibetan Word-levelAdversarial Samples Based on Morphosyntactic Linkage
本文提出了一种名为 TWLASBMSL 的新方法,该方法通过整合形态句法链接来确保语法正确性,同时在情感分析和文本分类任务中有效地欺骗目标模型,从而生成藏语词级对抗样本。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:基于形态句法关联的藏语词级对抗样本生成研究
问题陈述
尽管随着大语言模型(如 DEEPZANG、阳光青岩)的出现,藏语智能信息处理已取得显著进展,但与英语和中文相比,这些模型的安全性和鲁棒性在对抗攻击研究方面仍处于不足状态。现有的藏语对抗攻击方法主要依赖于字符级或音节级的扰动(例如音节替换、插入、删除)。这些方法的一个关键局限在于忽视了藏语的语法规范,特别是关于功能词(表示格、所有关系、位置等的助词)的规则。
当现有方法在不遵循形态句法关联的情况下进行词级替换时,生成的对抗样本往往会导致句子逻辑破碎和语法规则失效。例如,在藏语中替换一个实词通常需要对随后的功能词(如属格、作格或方位格助词)进行相应的调整,以维持语法合法性。未能更新这些功能词会导致对抗样本在语言学上无效,从而降低其有效性和质量。
方法论:TWLAS-BMSL
本文提出了 TWLAS-BMSL(基于形态句法关联的藏语词级对抗样本生成方法),旨在生成高质量、语法正确的对抗样本。该框架在白盒攻击范式下运行,包含四个核心步骤:
随机词汇扰动:
- 利用构建的藏语义素知识库(包含 32,745 条条目),识别原文中的实词。
- 将这些词与知识库中语义相似的替代词进行随机匹配。
- 执行单词替换,以创建一个尽可能保留原始语义的扰动文本。
功能词检测与修正:
- 认识到藏语深层语义关系是通过功能词组织的,该方法采用了一种功能词黏附检测与修正算法。
- 在替换关键词后,算法会动态分析新词的语法类别(例如,它是作为施事主语还是需要特定的格标记)。
- 它会自动更新随后的功能词(属格、作格、方位格及名词人称后缀),使其符合藏语语法规则(特别是关于后缀字母的“三十颂”规则)。
重构:
- 系统通过整合语义相似的关键词与语法修正后的功能词来重构句子。
攻击执行:
- 将最终重构的对抗样本输入目标模型,以诱导分类错误。
主要贡献
作者强调了三个主要贡献:
- 形态句法关联方法: 提出了一种显式结合形态句法关联的词级对抗生成方法,确保功能词能够自动适配以匹配被替换的实词。这增强了藏语语言模型针对白盒扰动攻击的鲁棒性。
- 自动适配算法: 建立了在扰动过程中自动适配和更新藏语功能词的标准与算法,填补了现有以中英文为中心的攻击策略的空白。
- 藏语义素知识库: 构建了一个专门用于促进藏语文本词级对抗实验的专业藏语义素知识库,包含 32,745 条条目。
实验结果
研究在涵盖文本分类和情感分析任务的四个数据集(TNCC、TU_SA、QHNUTSA、MZUCTSA)上评估了 TWLAS-BMSL 方法。目标模型包括 TiBERT、CINO-base-v2 和 CINO-large。
攻击有效性:
- 该方法导致各模型平均准确率下降 (ADV) 为 2.69%。
- 平均攻击成功率 (ASR) 达到 28.83%。
- 平均编辑距离 (Levenshtein Distance, LD) 为 6.80%,表明攻击仅需较小的扰动即可生效。
- CINO-base-v2 模型对攻击最为敏感,而 CINO-large 展示了最强的鲁棒性。
语法修正性能:
- 在功能词自动适配与纠错任务中,该方法在三个关键指标上达到了 100%:
- 功能词错误检测率。
- 整体准确率。
- 完整错误句子修正成功率。
- 在功能词自动适配与纠错任务中,该方法在三个关键指标上达到了 100%:
定性分析:
- 在没有形态句法关联的情况下,生成的样本往往包含破坏句子逻辑的语法错误。使用所提方法后,对抗样本在成功误导目标模型的同时,保持了语法的严谨性。
意义与声明
论文声称,所提出的 TWLAS-BMSL 方法有效地解决了现有藏语对抗攻击中存在的“语法逻辑不精确”问题。通过确保功能词与实词替换同步更新,该方法保证了生成样本的语法逻辑严密性。
作者断言,这种方法不仅能成功误导模型做出错误的分类决策,还能确保对抗样本的文本质量,使其在语法正确性方面与自然文本无异。这被视为提升藏语大语言模型安全性与鲁棒性的关键一步。
论文结论较为谦逊,承认了诸如构建的义素知识库规模有限(32,745 条条目)以及用于测试的藏语特定大模型稀缺等局限性。建议未来的工作将此方法应用于藏语大模型,以进一步增强其抗干扰能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。