← 最新论文
🤖 AI

Integrating knowledge graphs and multilingual scholarly corpora for domain-adaptive LLMs in SSH

本文概述了 LLMs4EU 项目及 ALT-EDIC 基础设施内的一项正在进行的倡议,即通过整合知识图谱与多语言语料库,使基础模型能够适配社会科学与人文研究,并采用严格的定量与定性评估框架,以确保为学术任务提供可靠、符合伦理规范且具备领域敏感性的人工智能支持。

原作者: Adam Faci, Alessio Miaschi, Anne Combe, Pascal Cuxac, Francesca Frontini, Nicolas Larrousse, Stéphane Pouyllau

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Adam Faci, Alessio Miaschi, Anne Combe, Pascal Cuxac, Francesca Frontini, Nicolas Larrousse, Stéphane Pouyllau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教 AI 像人文主义者一样阅读

想象你有一个超级聪明的机器人图书管理员(大语言模型,简称 LLM),它几乎读过了互联网上的所有内容。它非常擅长回答关于科学、数学和英语新闻的问题。但是,如果你用法语或意大利语问它关于历史、哲学或文学的问题,它经常会出错。它往往会忽略书籍,只关注英文期刊文章,并且无法理解人类学者实际思考的那种深刻、复杂且具有解释性的方式。

这篇论文描述了一个名为 ReSearch_SSH 的项目(它是欧洲更大规模倡议 LLMs4EU 的一部分),该项目正试图解决这个问题。其目标是将那个“通用型”机器人图书管理员进行专门训练,使其能够理解社会科学与人文科学(SSH)。他们希望拥有一个尊重不同语言、明白书籍与期刊文章同样重要,并且懂得同一文本根据读者不同可以有多种解读方式的 AI。

问题所在:“一刀切”的陷阱

目前,大多数用于研究的 AI 工具就像一张通用的世界地图。这些地图大多以英语绘制,并且只标注了最大的城市(主要期刊)。如果你试图用这张地图去寻找意大利的一个小村庄,或者法国的一场特定的历史辩论,你会迷失方向。

作者认为这并非中立的。它排挤了那些从事其他语言研究,或研究古籍手稿、数字博客或地方史的学者。它迫使每个人都像“硬科学研究者”(寻找简单的事实和引用)那样思考,而不是像“人文主义者”(寻找背景、细微差别和不同视角)那样思考。

解决方案:专业的工具包

该团队并不是要从头开始构建一个新的搜索引擎,而是正在升级一个现有的法国研究平台——ISIDORE。你可以把 ISIDORE 想象成一个巨大且组织有序的图书馆地下室,而团队正在其中安装一个新的“智能助手”。

以下是他们如何利用三种主要工具来构建它的:

1. “专业书单”(数据)

如果你只给厨师提供美国食谱,你无法教会他烹饪法国菜。为了训练这个 AI,他们正在喂给它大量经过精心挑选的社会科学与人文科学文本。

  • 菜单: 他们正在使用来自 ISTEX 数据库的约 300 万份文档。这包括超过 60 种语言的书籍、文章和数据,不过法语和英语是其中的“主菜”。
  • 配菜: 为了确保 AI 理解数字人文领域的特定术语,他们加入了意大利的会议论文和专业期刊。
  • 目标: 这确保了 AI 学习的是学者的特定“方言”,而不仅仅是互联网的“方言”。

2. “事实核查地图”(知识图谱)

这是最重要的部分。标准的 AI 经常会产生“幻觉”(胡编乱造),因为它们是基于模式进行猜测。本项目使用了一个知识图谱,它就像一个巨大的、互联的事实网络。

  • 类比: 想象 AI 是一个导游。普通的 AI 可能会猜测某个地标的位置。而这个 AI 则拿着一张详细的地图(Wikidata 及其他图谱),将作者与其著作、书籍与其主题、以及主题与历史事件联系起来。
  • 运作方式: 当 AI 回答问题时,它不仅仅是在猜测;它会查看地图,找到书籍中的确切页面,然后说:“我在这份特定文档中找到了这个答案。”这使得答案是可追溯可靠的。

3. “人类反馈循环”(评估)

团队不仅是用计算机评分来测试 AI,他们还在使用真正的专家进行测试。

  • 评审团: 他们组建了一个由来自法国和意大利的数字人文学者组成的团队。
  • 测试: 这些专家会向 AI 提出复杂的问题,并检查答案在真实的科研语境下是否合理。他们会检查:“这个答案对历史学家真的有用吗?它是否遗漏了关键的细微差别?”
  • 结果: 如果 AI 失败了,专家会告诉它原因,然后 AI 会学习如何像人类学者一样思考。

游戏规则(法律与伦理)

论文强调,这并不是一场“无法无天”的实验。他们是在严格的法律框架内(如欧盟 AI 法案和 GDPR)构建这个项目的。

  • 拒绝盲目猜测: 该 AI 被设计为一个“研究助理”,而不是决策者。它提供建议,但由人类做决定。
  • 隐私: 他们非常小心,不会使用个人数据来进行人物画像。
  • 版权: 他们尊重所使用的书籍规则。他们不是在窃取内容,而是使用授权数据,并确保 AI 指回原始出处,从而让作者获得认可。

进展如何?

该项目目前处于准备阶段

  • 他们正在收集并清洗数据(即“食材”)。
  • 他们正在建立法律和伦理规则(即“厨房安全协议”)。
  • 他们即将开始第一轮针对这些特定数据的模型训练。

核心总结

这篇论文是构建一个不仅能像人类一样“说话”,而且能像学者一样“思考”的 AI 的蓝图。通过结合专业的书籍库、事实核查地图和人类专家团队,他们希望创造出一个工具,帮助研究人员发现新思想,同时又不丢失使人文科学变得特别的细微差别、语言多样性和伦理精神。其核心在于确保 AI 服务于学者,而不是迫使学者改变自己的工作方式来适应 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →