← 최신 논문
🤖 AI

An Agentic Framework Using Rules and LLMs for Embedding and Annotating Descriptive Document Layouts: A Plant Science Use Case

본 논문은 규칙 기반 파싱과 거대 언어 모델을 결합하여 기술적 문서 레이아웃으로부터 식물 형질 주석을 견고하게 추출하고 풍부하게 만드는 모듈형 에이전트 기반 프레임워크를 제시하며, 이를 통해 약 5,000종의 식물에 걸친 55,000개 이상의 형질을 성공적으로 처리하였다.

원저자: Nicolas Turenne, Youcef Sklab, Eric Chenin, Jean-Daniel Zucker

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nicolas Turenne, Youcef Sklab, Eric Chenin, Jean-Daniel Zucker

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수 세기 동안 식물학자들은 세계의 식물들을 기술하기 위해 두꺼운 인쇄본 서적들에 의존해 왔습니다. 흔히 조밀한 텍스트 단락들로 채워진 이 책들은 한 종이 어떻게 살아가는지, 어디에서 자라는지, 그리고 어떤 모습인지를 이해하는 열쇠를 쥐고 있습니다. 그러나 컴퓨터가 이 지식을 활용하기 위해서는, 정보가 인간이 읽을 수 있는 페이지에서 기계가 검색하고 분석할 수 있는 구조화된 데이터로 변환되어야 합니다. 과제는 이 텍text들의 엄청난 양과 복잡성에 있는데, 이들은 여러 언어로 쓰여 있으며 '형질'이라고 알려진 식물의 특징에 대한 미묘한 묘사들을 포함하고 있습니다. 이 데이터를 수동으로 추출하는 것은 느리고 오류가 발생하기 쉬운 반면, 전통적인 컴퓨터 방식은 과학적 언어의 뉘앙스나 오래된 스캔 페이지의 레이아웃을 이해하는 데 어려움을 겪는 경우가 많습니다. 이를 해결하기 위해 연구자들은 엄격한 논리적 규칙과 인공지능의 유연한 추론을 결합하여, 식물 묘사가 담긴 도서관을 방대한 검색 가능한 데이터베이스로 바꾸는 것을 목표로 하는 시스템을 구축하기 시작했습니다.

최근의 한 연구에서, 연구팀은 식물의 특성에 관한 구체적인 세부 사항을 읽고 자동으로 추출하도록 설계된 새로운 시스템을 개발했습니다. 이 과정은 대개 텍스트의 이미지에 불과한 오래된 책의 디지털 스캔본으로부터 시작됩니다. 시스템은 먼저 이미지를 컴퓨터가 읽을 수 있는 실제 글자와 단어로 변로 변환하는 기술인 광학 문자 인식(OCR)을 사용합니다. 텍스트를 읽을 수 있게 되면, 시스템은 각 식물의 설명 아래에 내용을 그룹화함으로써 텍스트를 정리합니다. 이 단계는 매우 중요한데, 한 권의 책이 수천 종의 서로 다른 종을 설명할 수 있으므로 컴퓨터는 정확히 한 식물의 설명이 어디서 끝나고 다른 식물이 어디서 시작되는지를 알아야 하기 때문입니다. 연구자들은 단순히 텍스트를 읽는 것만으로는 충분하지 않으며, 시스템이 섹션을 정확하게 분리하기 위해 페이지의 구조를 이해해야 한다는 것을 발견했습니다.

실제 정보를 추출하기 위해, 팀은 전문화된 작업자 팀처럼 작동하는 파이프라인을 구축했습니다. 첫 번째 작업자 그룹은 특정 패턴을 찾기 위해 엄격하게 미리 작성된 규칙을 따릅니다. 예를 들어, 텍st에 "잎" 다음에 "4 센티미터"와 같은 측정값이 언급된다면, 시스템은 그 식물이 해당 크기의 잎을 가지고 있다고 기록합니다. 이러한 규칙은 정밀하고 신뢰할 수 있지만, 명시적으로 찾도록 지시받은 것만을 찾을 수 있습니다. 더 많은 세부 사항을 포착하기 위해, 시스템은 거대 언어 모델(LLM)로 구동되는 두 번째 작업자 그룹을 활용하는데, 이는 방대한 양의 인간 저술물로 학습된 고급 인공지능 프로그램입니다. 이 AI 에이전트들은 식물의 부위를 묘사하는 새로운 단어와 구절을 제안할 수 있는 가상의 전문가 역할을 하여, 규칙만으로는 놓쳤을 수도 있는 묘사들을 시스템이 인식할 수 있도록 돕습니다. 이러한 결합은 시스템이 원래 데이터의 명확성을 잃지 않으면서도 정확하고 적응 가능하게 만들어 줍니다.

연구진은 뉴칼레도니아, 세네갈, 카메룬의 세 가지 대규모 식물 텍스트 컬렉션을 대상으로 이 시스템을 테스트했습니다. 결과에 따르면, 시스템은 거의 5,000종의 서로 다른 식물에 걸쳐 약 56,000개의 구체적인 형질 주석을 성공적으로 추출했습니다. 평균적으로 시스템은 분석된 각 식물당 약 9개의 뚜렷한 형질을 식별했습니다. 엄격한 규칙 기반 시스템에 AI 기반 어휘 확장을 추가했을 때, 주석의 총 개수는 거의 60% 증가했으며, 이는 그들이 찾고자 했던 형질의 4분의 3을 포괄했습니다. 이러한 개선은 규칙이 견고한 토대를 제공하는 한편, AI 에이전트가 식물을 묘사하는 다양한 방식들을 이해하는 시스템의 능력을 크게 확장했음을 입증했습니다.

이 연구는 또한 시스템이 견고하다는 것, 즉 스캔된 텍스트의 품질이 변하더라도 일관되게 수행된다는 것을 보여주었습니다. 연구진은 이미지를 텍스트로 변환하는 다양한 방법들을 테스트했으며, 일부 방법이 식물 이름을 인식하는 데 약간 더 나은 성능을 보였음에도 불구하고, 추출된 형질의 전체 숫자는 사용하는 방법과 관계없이 안정적으로 유지된다는 것을 발견했습니다. 이는 이 파이프라인이 역사적 문헌의 무질서한 현실을 다룰 만큼 신뢰할 수 있음을 시사합니다. 그러나 이 시스템은 완전히 자동화된 것이 아닙니다. AI 에이전트가 제안한 내용을 최종 규칙에 추가하기 전에 여전히 인간 전문가의 검토가 필요합니다. 이러한 인간의 감독은 데이터가 신뢰할 수 있음을 보장하며, 인공지능만 사용할 때 발생하는 흔한 위험인 '사실을 지어내는 현상'을 방지합니다.

궁극적으로, 이 작업은 세계의 식물 지식을 정리하는 강력한 도구를 제공합니다. 비구조화된 텍스트를 구조화된 데이터로 변환함으로써, 이 시스템은 과학자들이 생물 다양성과 식물 진화를 연구하기 위한 더 나은 데이터베이스를 구축하도록 돕습니다. 이 접근 방식은 인간이 설계한 규칙의 정밀함과 인공지능의 유연한 추론을 결 kết하는 것이 어떻게 수백만 페이지의 과학 문헌 속에 숨겨진 정보를 잠금 해제할 수 있는지를 증명합니다. 연구진은 자신의 코드와 데이터를 다른 이들이 사용할 수 있도록 공개하여, 이 방법이 복잡한 텍스트를 이해하고 정리해야 하는 다른 분야에도 적용될 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →