← 最新论文
💬 NLP

JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence

该论文针对多模态代码数据稀缺的瓶颈,提出了包含合成工具包、80 万规模数据集(JanusCode-800K)及统一视觉 - 程序化接口模型(JanusCoder/JanusCoderV)的完整方案,实现了从文本或视觉输入生成代码的卓越性能,并在多项任务中达到或超越商业模型水平。

原作者: Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 JANUSCODER 的新项目,你可以把它想象成给人工智能装上了一双“透视眼”和一双“灵巧手”,让它不仅能看懂代码,还能直接“看见”并“创造”出代码生成的视觉效果。

为了让你更容易理解,我们可以用几个生动的比喻来拆解这篇论文的核心内容:

1. 核心痛点:以前的 AI 是“盲人摸象”

在 JANUSCODER 出现之前,人工智能在“代码智能”领域存在一个巨大的割裂:

  • 文字型 AI:擅长写代码(比如写 Python 脚本),但如果你让它“画一个图”,它写出的代码往往跑不通,或者画出来的图跟你要的不一样。
  • 视觉型 AI:擅长看图说话,但如果你给它一张图表,让它写出背后的代码,它往往只能猜个大概,逻辑不通。

这就好比:

  • 有的厨师(AI)只会背菜谱(写代码),但做出来的菜(视觉图)很难吃。
  • 有的厨师(AI)只会看别人做的菜(看图),但让他自己写菜谱(写代码)时,却写得一塌糊涂。
  • 更糟糕的是,以前没有一本高质量的“菜谱 + 成品图”对照大全,导致 AI 学不到真正的精髓。

2. 解决方案:JANUSCODER 的“三把钥匙”

为了解决这个问题,研究团队做了三件大事:

第一把钥匙:造了一个“超级合成工厂”(数据合成工具包)

以前,收集“代码 + 对应图片”的高质量数据非常难,就像在沙滩上找特定的贝壳。

  • 比喻:研究团队建了一个自动化工厂。他们不再依赖现成的数据,而是利用 AI 自己“变”出数据。
  • 怎么变? 他们让 AI 扮演不同的角色:
    • 导演:给一段代码,让 AI 想象“如果我想让颜色变红,指令该怎么写?”(反向生成指令)。
    • 翻译官:把 R 语言写的科学图表代码,“翻译”成 Python 或 Mathematica 的代码,并生成对应的指令。
    • 编辑:给一张网页截图,让 AI 写出“把按钮变红”的修改指令,然后生成修改后的代码。
  • 成果:他们造出了 JANUSCODE-800K,这是目前世界上最大的“代码 + 视觉”数据宝库,里面有 80 万条高质量的“指令 - 代码 - 图片”三元组。

第二把钥匙:训练出了“全能型大厨”(JANUSCODER 模型)

有了好食材(数据),他们训练了两个新模型:JANUSCODERJANUSCODERV

  • 比喻:以前的 AI 是“专科医生”,有的只会写图表代码,有的只会修网页。JANUSCODER 则是一位全能型大厨
  • 它能做什么?
    • 看图写代码:给你一张复杂的科学图表,它能写出能画出这张图的代码。
    • 看图改代码:给你一张网页截图和一句“把导航栏变绿”,它能直接修改代码实现。
    • 看图做动画:给你一张图,它能写出代码,让图里的元素动起来(比如像 3Blue1Brown 那样解释数学原理的动画)。
    • 听指令画图:你直接说“画一个关于吉布斯自由能的交互图”,它直接生成代码并运行出图。

第三把钥匙:严格的“品控员”(奖励模型)

光有代码能运行还不够,画出来的图必须“好看”且“符合指令”。

  • 比喻:工厂里有一个挑剔的美食评论家(VLM/视觉大模型)。
  • 工作流程:AI 生成代码 -> 运行出图 -> 评论家拿着“指令”和“成品图”对比。
    • 如果图歪了、颜色错了、或者没画全,评论家就打分很低,这组数据就被扔进垃圾桶。
    • 只有那些“色香味俱全”(代码正确、视觉完美、指令匹配)的数据,才会被留下来训练模型。

3. 成果:小模型也能打败大模型

论文通过大量实验证明,JANUSCODER 系列(70 亿到 140 亿参数)的表现非常惊人:

  • 超越商业巨头:在生成图表、网页、科学动画等任务上,它的表现接近甚至超过了 GPT-4o 等顶级商业模型。
  • 开源普惠:以前这种能力只有大公司才有,现在开源了,任何人都可以用。
  • 通用性强:它不仅能做视觉任务,普通的写代码能力(如算法题)也没有退步,反而因为“多模态”的训练,逻辑理解能力更强了。

总结

JANUSCODER 就像是给 AI 打通了“任督二脉”。它不再把“代码逻辑”和“视觉呈现”分开看,而是建立了一个统一的视觉 - 编程接口

  • 以前:你想让 AI 画个图,你得先写代码,再调试,再改代码,像是一个笨拙的学徒。
  • 现在:你直接给 AI 一张图或一句话,它就能像一位经验丰富的艺术家兼工程师,直接生成完美的代码和视觉效果。

这项技术让未来的 AI 不仅能“写”出代码,还能真正“理解”和“创造”出我们肉眼可见的数字世界,无论是复杂的科学可视化,还是精美的网页交互,都将变得更加简单和智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →