← 最新论文
💻 computer science

Using LLMs for Ontology generation by video summarization

本文提出了一种两阶段算法,该算法利用大语言模型,通过先创建文本摘要再将其转换为结构化领域表示的方法,自动从 YouTube 视频 URL 生成 RDF 本体,并在一个体育数据集上实现了 90% 的准确率。

原作者: Khaled Omar

发布于 2026-09-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Khaled Omar

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在浩瀚的数字信息领域,存在着一个持久的挑战:如何教计算机不仅是存储数据,还要理解思想之间的关系。想象一下,如果一个图书馆里的每一本书都是按封面颜色而不是主题来归档的;那么寻找特定的故事将几乎是不可能的。在计算领域,这个问题是通过创建“本体”(ontologies)来解决的。可以将本体想象为针对特定领域(如体育或医学)的知识结构图。它定义了该领域内的核心概念,并且至关重要的是,画出了连接这些概念的线条。这张地图允许机器进行推理、搜索并分享信息,其方式模仿了人类的理解。然而,构建这些地图传统上是一个缓慢且昂贵的过程,需要专家团队手动定义每一个术м和连接。随着数字内容的爆炸式增长,特别是视频格式,传统的这种人工构建方法已难以跟上步伐。

大马士革大学的 Khaled Omar 博士最近的一项研究详细介绍了一种新方法,试图通过使用先进的人工智能直接从视频中构建这些知识图谱,从而绕过人力瓶颈。该研究侧重于一种被称为“大语言模型”的特定人工智能——这类系统在海量文本上进行了训练,能够以卓越的流畅度阅读、理解并生成人类语言。虽然这些模型此前已被用于总结文本,但这项研究提出了一个更宏大的问题:它们能否观看视频,理解其核心信息,并自动构建一个关于该主题的正式知识图谱?根据研究结果,答案是一个充满希望的“可以”。研究人员开发了一个两步走的系统:首先将视频转化为简洁的书面摘要,然后将该摘要转化为计算机可以用来对视频内容进行推理的结构化数据格式。

整个过程始于一个简单的输入:一个 YouTube 视频链接。该系统并不像人类那样通过处理动态图像来“观看”视频。相反,它首先提取视频中的语音内容,创建一个文本转录稿。随后,这个转录稿被输入到一个名为 Llama 3.2 的强大人工智能模型中,研究人员在自己的本地计算机上运行该模型,以避免云端成本。该模型扮演着一名熟练编辑的角色,阅读转录稿并将其分解成易于处理的块。它总结每个部分,然后将这些摘要组合成一个连贯的叙述。这个叙述不仅仅是随机的句子集合;它经过精心构建,旨在突出视频的主题,识别提到的重要人物或物体,并提取关键结论。其结果是一个干净的、基于文本的故事,捕捉了原始视频的精髓。

一旦文本摘要准备就绪,系统就会进入第二阶段:将故事转化为正式的地图。在这里,另一个人工智能模型 Gemini Pro 002 接管了工作。研究人员为该模型提供了一套特定的指令(即提示词),要求它扮演“知识架构师”的角色。模型被要求观察摘要,识别视频所属的领域,并列出其中发现的关键概念。接着,它利用这些概念开始绘制它们之间的联系,定义它们是如何相互关联的。最后,模型以一种被称为 RDF 的标准格式输出这一结构,这是一种允许不同计算机系统无缝交换和理解信息的资料编写方式。从原始视频链接到结构化知识图谱的整个工作流都是自动完成的,无需人工干预来定义术语或关系。

为了测试这种自动化方法是否真的有效,研究人员将其应用于一个包含一百个关于体育主题视频的数据集。他们并没有只是让系统运行并听天由命;他们根据高标准衡量了其性能。对于流程的第一部分,即视频摘要,他们将 AI 生成的书面摘要与视频原标题进行对比,以观察其含义的匹配程度。系统实现了高度的一致性,摘要与标题的契合度达到了百分之九十五左右。对于第二部分,即知识图谱的创建,研究人员将 AI 生成的地图与人类专家创建的地图进行了对比。这是测试机器是否理解知识结构(而非仅仅是单词)的真正考验。在这种比较中,自动化系统成功地复现了人类专家的地图,准确率达到百分之八十五。在评估整个流程的整体表现时,研究人员计算出总准确率为百分之九十。

这项工作的意义在于,它改变了我们管理互联网上日益增长的视频海洋的方式。通过自动化创建这些知识图谱,该系统减少了对人类专家的沉重依赖,使得在大规模范围内组织和理解视频数据成为可能,而这在以前是无法实现的。研究人员指出,虽然他们在体育视频上进行了测试,但该方法并不局限于该领域;它可以应用于医学讲座、教育教程或任何以视频作为主要信息来源的领域。研究表明,组织数字知识的未来可能在于这些混合系统——由人工智能处理提取和结构化的繁重工作,从而让人类能够专注于更高层次的验证与应用。这项研究证明,只要拥有正确的工具,将动态图像转化为结构化的、机器可读的世界理解的过程,不再仅仅是一个理论上的可能性,而是一个现实的实践。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →