A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks
本研究在 Codeforces 编程任务上对 ChatGPT 03-mini 与 DeepSeek-R1 进行了比较,结果显示,尽管两个模型在简单问题上表现相近且均难以应对高难度题目,但 ChatGPT 在中等难度挑战上显著优于 DeepSeek-R1。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,两位才华横溢但风格迥异的学生坐下来参加一系列编程考试。一位是ChatGPT(具体为 o3-mini 版本),一位是知名且训练有素的学生,几乎读遍了图书馆里的每一本书。另一位是DeepSeek-R1,一位来自中国的开源新挑战者,以其对逻辑推理和数学谜题的专注而闻名。
来自卑尔根大学的研究人员决定利用一个名为Codeforces的程序员“健身房”对他们进行测试。他们给这两位学生出了 29 道题目,从简单的热身题到艰苦的马拉松式难题,要求他们编写 C++ 代码来解决这些问题。
以下是这场对决按难度划分的详细情况:
1. 热身赛(简单任务)
把这些题目想象成简单的算术题或基础逻辑谜题。
- 结果:两位学生都表现出色。他们就像两名顶级运动员在参加 100 米短跑;两人都成功冲过了终点线。
- 细节:虽然两人都答对了答案,但 DeepSeek 有时运行得稍慢一些,并且比 ChatGPT 多消耗了一点“能量”(内存),不过它们都跨过了终点线。
2. 中距离赛(中等任务)
比赛在这里变得有趣起来。这些问题需要更多的策略和规划。
- ChatGPT:这位学生在这里是明确的赢家。他们正确解决了约**55%**的中等难度问题。他们就像一位经验丰富的马拉松运动员,完全知道如何控制自己的节奏。
- DeepSeek:这位学生表现挣扎,仅解决了约**18%**的中等难度问题。这就像他们在比赛半途感到困惑,被自己的脚绊倒,或者忘记了规则。
- 原因:论文指出,ChatGPT 可能在训练期间接触过更多此类“竞技编程”数据,从而获得了先发优势。
3. 超级马拉松(困难任务)
这些是最严峻的挑战,需要复杂的多步骤逻辑。
- 结果:两位学生都撞上了墙。
- ChatGPT 仅成功解决了 9 道难题中的1 道。
- DeepSeek 未能解决任何一道难题(0%)。
- 比喻:想象一下要求这两位学生在没有蓝图的情况下从零开始建造一座摩天大楼。他们都卡住了。ChatGPT 试图建造几层楼,但结构随后崩塌(运行时错误),而 DeepSeek 往往甚至无法开始打地基(编译错误),或者在完工前就耗尽了“能量”(内存限制)。
“能量”消耗(内存与时间)
研究人员还考察了每位学生使用了多少“燃料”(计算机内存)和时间。
- ChatGPT 在简单和中等任务上通常速度更快,资源利用更高效。
- DeepSeek 有时使用了大量的内存,或者思考时间非常长,尤其是在处理困难任务时。有一次,DeepSeek 思考一道问题花了太长时间,导致完全超时。
结论
论文总结道,虽然 DeepSeek-R1 是一位强大的新竞争者,能够很好地处理简单任务,但 ChatGPT o3-mini 目前仍是应对中等难度编程挑战的更优“教练”。然而,当问题变得真正困难时,两个模型都需要人类的帮助。它们尚未准备好独自解决最难的谜题。
研究中的重要说明:
研究人员只让每位学生尝试一次问题(“单次尝试”)。如果失败,他们没有让他们重试或请求提示。论文指出,如果允许人类指导他们,或者如果他们使用了不同、更专业的 DeepSeek 版本(称为 DeepSeek-Coder),结果可能会有所不同。但基于这项具体测试,ChatGPT 在中等难度领域领先,而两者在最高难度层面都表现挣扎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。