← 最新论文
🌿 ecology

Large language models possess some ecologicalknowledge, but how much?

本研究利用一个新的基准数据集评估了 Gemini 1.5 Pro 和 GPT-4o 的生态学知识,结果显示,尽管这些模型在物种存在预测等任务中表现优于朴素基准模型,但其整体性能仍显著低于专家水平,这表明若要将大语言模型有效地整合到生态科学中,迫切需要进行特定领域的微调。

原作者: Dorm, F., Millard, J., Purves, D., Harfoot, M., Mac Aodha, O.

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Dorm, F., Millard, J., Purves, D., Harfoot, M., Mac Aodha, O.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,像 Gemini 1.5 ProGPT-4o 这样的大型语言模型(LLM)是博学多才的图书管理员,他们几乎读遍了世界上所有的书。他们以能够轻松回答有关历史、数学和流行文化的问题而闻名。但这项研究背后的研究人员想要知道:这些图书管理员在谈论自然科学方面表现如何?

为了找出答案,团队将这些人工智能模型视为正在参加一场非常特定的“生态学考试”的学生。他们不仅仅是问一些宽泛的问题,而是给了他们五项艰巨的实践任务:

  1. 猜测谁住在哪里: 预测特定的动物或植物是否出现在某个特定区域。
  2. 绘制地图: 创建一张显示物种栖息范围的地图。
  3. 列出濒危物种: 命名那些处于灭绝边缘的物种。
  4. 识别危险: 对伤害这些物种的威胁进行分类。
  5. 描述特征: 估算不同物种的物理特征。

研究人员根据真实的专家数据创建了一个新的“标准答案”,以此来给人工智能的作业评分。

以下是这些“AI学生”的表现:

  • 好消息: 他们并非完全的初学者。在猜测物种是否出现在某一区域时,人工智能的分数比随机猜测高出约 20 个百分点。这就像是一个掌握了教科书基础知识、能够通过简单题目考试的学生。
  • 现实的考验: 当任务变得更加困难时,人工智能就显得力不从心了。
    • 当被要求绘制分布范围图(显示动物具体居住在哪里)时,人工智能仅达到了人类专家准确度的约 三分之一。这就像是试图凭记忆画出一张详细的城市地图,虽然能画出主要街道,但却漏掉了所有的社区。
    • 当被要求对威胁进行分类时,人工智能的分数仅比随机猜测提高了约 10 分。这仅仅比通过抛硬币来决定什么在伤害一个物种要好那么一点点。

底线结论:
该论文得出结论,虽然这些人工智能模型具备一定的生态学知识,但其深度和精确度尚不足以取代人类专家。它们就像是一个读过森林旅游指南、但从未真正走过林间小径的游客。

为了解决这个问题,作者建议这些模型需要针对生态数据进行专门的训练(微调),而不仅仅是依赖它们的通用知识。这篇论文的主要目标仅仅是建立一个公平的“测试”(基准),以便未来的研究人员可以衡量这些人工智能工具随时间推移究竟进步了多少。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →