← 最新论文
💬 NLP

ArkTS-CodeSearch: A Open-Source ArkTS Dataset for Code Retrieval

本文提出了首个针对 OpenHarmony 生态中 ArkTS 语言的大规模开源数据集及基准测试,通过构建“自然语言注释-函数”检索任务并微调代码嵌入模型,填补了 ArkTS 代码智能研究在公开数据集和评估基准方面的空白。

原作者: Yulong He, Artem Ermakov, Sergey Kovalchuk, Artem Aliev, Dmitry Shalymov

发布于 2026-02-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yulong He, Artem Ermakov, Sergey Kovalchuk, Artem Aliev, Dmitry Shalymov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

📖 背景:一个“语言孤岛”的困境

想象一下,世界上突然出现了一种非常流行的新语言——ArkTS(它是华为 OpenHarmony 生态的核心语言)。由于这种语言太新了,虽然用的人越来越多,但互联网上并没有现成的、高质量的“词典”或“翻译指南”。

这就导致了一个问题:程序员们在写代码时,如果想通过一段中文描述(比如“帮我写一个计算圆面积的函数”)来快速找到现成的代码,由于缺乏数据,现有的 AI 工具(比如 ChatGPT 或各种代码助手)往往表现得像个“听不懂方言的游客”,根本搜不到想要的东西。

🛠️ 任务:打造“超级词典” (ArkTS-CodeSearch 数据集)

研究人员决定动手解决这个问题。他们做了三件事:

  1. 大规模搜集(采矿): 他们像矿工一样,在 GitHub 和 Gitee 这两个巨大的“代码矿山”里,把所有用 ArkTS 写的代码都挖了出来。
  2. 精准提取(精炼): 他们没有直接把乱七八糟的代码扔进去,而是用一种叫 tree-sitter 的“精密筛子”,把代码里的**“功能块”(函数)和对应的“说明书”**(注释/文档)一一对应地提取了出来。
  3. 建立标准(制定规则): 他们把这些“功能+说明”的配对整理成了标准格式,就像编纂了一本极其详尽的《ArkTS 功能说明大全》。

这就是论文提到的第一个贡献:第一个大规模、公开的 ArkTS 代码检索数据集。

🧠 训练:培养“超级翻译官” (模型微调)

有了“词典”,下一步就是训练 AI。研究人员找来了几个现成的“翻译官”(预训练模型),让他们学习如何理解 ArkTS。

他们尝试了三种“教学方法”:

  • 方法 A(突击训练): 直接给翻译官看 ArkTS 的词典。
  • 方法 B(跨语言学习): 先让翻译官学习一种很像 ArkTS 的语言(TypeScript),然后再教它 ArkTS。这就像是**“先学好法语,再学德语”**,因为两者很像,上手会更快。
  • 方法 C(两步走策略): 先学 TypeScript,再学 ArkTS。

实验结果发现: 这种“两步走”的方法效果最好!而且,即使是一个中等身材的“翻译官”(参数量适中的模型),只要经过针对性的“特训”,表现也能超过那些虽然块头大但没受过专业训练的“大块头”模型。

🏆 结论:这有什么用?

通过这项研究,我们得到了两样宝贝:

  1. 一本“超级词典”(数据集):以后全世界的研究者都可以用它来测试自己的 AI 聪不聪明。
  2. 一个“金牌翻译官”(微调后的模型):它能听懂人类的自然语言(甚至是中文),并精准地从成千上万行代码中,把你要的那段功能代码“揪”出来。

总结一句话:
这篇论文通过大规模收集数据并进行针对性训练,为 ArkTS 语言建立了一套“搜索引擎标准”,让未来的程序员可以用“说人话”的方式,更轻松地在代码海洋里“捞”到想要的功能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →