← 최신 논문
💻 computer science

Using LLMs for Ontology generation by video summarization

이 논문은 유튜브 비디오 URL로부터 텍스트 요약을 먼저 생성한 다음 이를 구조화된 도메인 표현으로 변환함으로써, 스포츠 데이터셋에서 90%의 정확도를 달성하며 대규모 언어 모델을 활용해 RDF 온톨로지를 자동으로 생성하는 2단계 알고리즘을 제시한다.

원저자: Khaled Omar

게시일 2026-09-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Khaled Omar

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

방대한 디지털 정보의 풍경 속에는 지속적인 과제가 하나 있습니다. 그것은 바로 컴퓨터에게 단순히 데이터를 저장하는 법이 아니라, 아이디어 사이의 관계를 이해하는 법을 가르치는 것입니다. 모든 책이 주제가 아닌 표지 색깔별로 분류된 도서관을 상상해 보십시오. 특정 이야기를 찾는 것은 거의 불가능할 것입니다. 컴퓨팅의 세계에서 이 문제는 '온톨로지(ontologies)'를 생성함으로써 해결됩니다. 온톨로지를 스포츠나 의학 같은 특정 분야에 대한 지식의 구조화된 지도라고 생각하십시오. 온톨로지는 해당 분야 내의 핵심 개념을 정의하고, 결정적으로 그 개념들을 연결하는 선을 그려 넣습니다. 이 지도는 기계가 인간의 이해를 모방하여 정보를 추론하고, 검색하고, 공유할 수 있게 해줍니다. 그러나 이러한 지도를 구축하는 것은 전통적으로 전문가 팀이 모든 용어와 연결 고리를 수동으로 정의해야 하는 느리고 비용이 많이 드는 과정이었습니다. 디지털 콘텐츠의 양이 폭발적으로 증가함에 따라, 특히 비디오 형식의 경우, 수동 구축이라는 기존 방식은 그 속도를 따라잡는 데 어려움을 겪고 있습니다.

다마스쿠스 대학교의 칼레드 오마르(Khaled Omar) 박사의 최근 연구에서 상세히 다룬 새로운 접근 방식은, 고급 인공지능을 사용하여 비디오로부터 직접 이러한 지식 지도를 구축함으로써 인간 노동의 병목 현상을 우회하려고 시도합니다. 이 연구는 거대 언어 모델(large language models)이라 불리는 특정 유형의 인공지능에 초점을 맞추고 있습니다. 이 모델들은 방대한 양의 텍스트로 학습되어 인간의 언어를 놀라운 유창함으로 읽고, 이해하고, 생성할 수 있는 시스템입니다. 이러한 모델들은 이전에 텍스트를 요약하는 데 사용되어 왔지만, 이번 연구는 더 대담한 질문을 던집니다. "그들이 비디오를 보고, 핵심 메시지를 이해하며, 주제에 대한 공식적인 지식 지도를 자동으로 구축할 수 있는가?" 연구에 따르면 답은 유망한 "예"입니다. 연구진은 먼저 비디오를 간결한 서면 요약본으로 변환한 다음, 그 요약본을 컴퓨터가 비디오의 내용을 추론하는 데 사용할 수 있는 구조화된 데이터 형식으로 변환하는 2단계 시스템을 개발했습니다.

과정은 간단한 입력값인 유튜브 비디오 링크로부터 시작됩니다. 시스템은 움직이는 이미지를 처리하는 방식으로 인간처럼 비디오를 시청하지 않습니다. 대신, 먼저 비디오에서 말소리를 추출하여 텍스트 전사(transcript)를 만듭니다. 이 전사본은 연구진이 클라우드 비용을 피하기 위해 자신의 로컬 컴퓨터에서 실행한 강력한 인공지능 모델인 Llama 3.2로 전달됩니다. 이 모델은 숙련된 편집가처럼 작동하여, 전사본을 읽고 이를 관리 가능한 덩어리로 나눕니다. 모델은 각 섹션을 요약한 다음, 이 요약본들을 하나의 일관된 서사로 결합합니다. 이 서사는 단순히 문장들을 무작위로 모아놓은 것이 아닙니다. 이는 비디오의 주요 주제를 강조하고, 언급된 가장 중요한 인물이나 사물을 식별하며, 핵심 결론을 추출하도록 세심하게 구조화되었습니다. 결과물은 원래 비디오의 본질을 포착하는 깔끔한 텍스트 기반의 이야기입니다.

텍스트 요약이 준비되면, 시스템은 두 번째 단계인 '이야기를 공식적인 지도로 바꾸는 과정'으로 넘어갑니다. 여기서 다른 인공지능 모델인 Gemini Pro 002가 업무를 이어받습니다. 연구진은 이 모델에게 지식 설계자(knowledge architect)로서 행동하라는 구체적인 지침, 즉 프롬프트를 제공합니다. 모델은 요약본을 살펴보고, 비디오의 도메인을 식별하며, 그 안에 포함된 핵심 개념들을 나열하도록 요청받습니다. 그런 다음 모델은 이 개념들을 가져와 이들 사이의 연결 고리를 그리기 시작하며, 이들이 서로 어떻게 관계를 맺는지 정의합니다. 마지막으로, 모델은 이 구조를 RDF라고 알려진 표준 형식으로 출력합니다. RDF는 서로 다른 컴퓨터 시스템이 정보를 원활하게 교환하고 이해할 수 있게 해주는 데이터 작성 방식입니다. 가공되지 않은 비디오 링크에서부터 구조화된 지식 지도에 이르기까지의 전체 워크플로우는 용어나 관계를 정의하기 위한 인간의 개입 없이 자동으로 이루어집니다.

이 자동화된 방법이 실제로 작동하는지 테스트하기 위해, 연구진은 스포츠에 초점을 맞춘 100개의 비디오 데이터셋에 이를 적용했습니다. 그들은 단순히 시스템이 실행되기를 바라며 운에 맡긴 것이 아니라, 높은 기준으로 성능을 측정했습니다. 첫 번째 과정인 비디오 요약의 경우, AI가 작성한 요약본을 비디오의 원래 제목과 비교하여 의미가 얼마나 잘 일치하는지 확인했습니다. 시스템은 약 95%의 확률로 요약본이 제목과 일치하며 높은 수준의 합의를 달しまいました. 두 번째 과정인 지식 지도 생성의 경우, 연구진은 AI가 생성한 지도를 인간 전문가가 만든 지도와 비교했습니다. 이것이 바로 기계가 단지 단어를 이해하는 것을 넘어 지식의 구조를 이해하는지 확인하는 진정한 시험입니다. 이 비교에서 자동화된 시스템은 인간 전문가의 지도를 85%의 정확도로 성공적으로 재현했습니다. 전체 과정을 통합적으로 살펴보았을 때, 연구진은 90%의 전체 정확도를 산출했습니다.

이 연구의 함의는 인터넷상의 점점 커지는 비디오 콘텐츠의 바다를 관리하는 방식에 있어 매우 중요합니다. 이러한 지식 지도의 생성을 자동화함으로써, 이 시스템은 인간 전문가에 대한 과도한 의존도를 줄여 이전에는 불가능했던 규모로 비디오 데이터를 조직하고 이해하는 것을 가능하게 합니다. 연구진은 이 실험을 스포츠 비디오에 적용했지만, 이 방법이 해당 분야에 국한되지 않는다고 언급했습니다. 이는 의학 강의, 교육 튜토리얼, 또는 비디오가 주요 정보원인 모든 도메인에 적용될 수 있습니다. 이 연구는 디지털 지식을 정리하는 미래가 인공지능이 추출과 구조화라는 힘든 일을 처리하고, 인간은 더 높은 수준의 검증과 응용에 집중할 수 있는 이러한 하이브리드 시스템에 달려 있음을 시사합니다. 이 연구는 적절한 도구가 있다면, 움직이는 영상을 세상에 대한 구조화되고 기계가 읽을 수 있는 이해로 바꾸는 복잡한 작업이 더 이상 이론적인 가능성이 아니라 실질적인 현실임을 보여주는 증거입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →