← 최신 논문
💻 computer science

Effective Performance Measurement: Challenges and Opportunities in KPI Extraction from Earnings Calls

본 논문은 구조화된 SEC 문서로 훈련된 모델의 한계를 입증하고 개방형 정보 추출에서 79.7%의 정밀도를 달성하는 인간 검증 LLM 기반 시스템을 제안함으로써, 비정형 실적 발표 회의록에서 핵심 성과 지표 (KPI) 를 추출하는 과제를 해결합니다.

원저자: Rasmus T. Aavang, Rasmus Tjalk-Bøggild, Alexandre Iolov, Giovanni Rizzi, Mike Zhang, Johannes Bjerva

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rasmus T. Aavang, Rasmus Tjalk-Bøggild, Alexandre Iolov, Giovanni Rizzi, Mike Zhang, Johannes Bjerva

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 글은 간단한 언어와 창의적인 비유를 사용하여 해당 논문을 설명한 것입니다.

큰 그림: "공식 보고서" 대 "수다스러운 전화 통화"

회사의 상황을 파악하려고 한다고 상상해 보세요. 여러분에게는 두 가지 주요 정보원이 있습니다.

  1. SEC 제출 서류 (공식 보고서): 이는 기재된 세무 신고서와 같습니다. 엄격하며, 경직된 템플릿을 따르고, 특정 칸을 사용하며, 창의성의 여지가 없습니다. 컴퓨터에게 이를 읽게 하려면 스프레드시트를 읽는 것과 같습니다. 숫자가 항상 같은 위치에 있기 때문에 숫자를 찾기 쉽습니다.
  2. 실적 발표회 (수다스러운 전화 통화): 이는 회사의 CEO 와 CFO 와의 생방송 라디오 인터뷰와 같습니다. 그들은 투자자들에게 이야기하고, 질문에 답하며, 이야기를 풀어나가고, 때로는 즉석에서 실수를 수정합니다. 칸도, 템플릿도 없으며, 언어는 대화체입니다. 한 순간에는 '매출'에 대해 이야기하다가, 다음 순간에는 '기록적인 성장'에 대해 농담하거나 수학 오류를 명확히 하기도 합니다.

문제점:
연구자들은 컴퓨터가 '공식 보고서 (SEC 제출 서류)'를 읽는 데는 뛰어나지만, '수다스러운 전화 통화 (실적 발표회)'를 이해하는 데는 형편없다는 사실을 발견했습니다. 컴퓨터는 은어, 주고받는 대화, 그리고 구조의 부재에 혼란을 느낍니다.

미션: 더 나은 번역기 구축

팀원들은 이러한 messy 한 전화 통화를 듣고 인간 전문가만큼 중요한 숫자 (핵심 성과 지표, KPI) 를 추출할 수 있는 시스템을 만들 수 있는지 확인하고자 했습니다.

그들은 두 가지 유형의 AI 사이에 '경주'를 설정했습니다.

  1. "구식" AI (인코더): 이들은 '공식 보고서'의 엄격한 규칙을 암기한 도서관 사서와 같습니다. 그들은 이러한 엄격한 규칙을 '수다스러운 전화 통화'에도 적용해 보았습니다.
  2. "신식" AI (대규모 언어 모델 또는 LLM): 이들은 인터넷의 거의 모든 것을 읽은 초지능 인턴과 같습니다. 경직된 규칙서를 따르는 대신, 대화의 흐름인 '맥락'을 사용하여 중요한 숫자가 무엇인지 추측합니다.

실험: 세 가지 데이터셋

아이디어를 테스트하기 위해 그들은 세 가지 새로운 '훈련장 (데이터셋)'을 만들었습니다.

  • SECB: AI 가 규칙을 얼마나 잘 처리하는지 보기 위해 기존의 엄격한 '공식 보고서'를 사용한 테스트입니다.
  • ECB: 레이블이 지정되지 않은 '수다스러운 전화 통화'의 방대한 컬렉션입니다.
  • ECB-A: 인간 전문가가 신중하게 레이블을 붙인 전화 통화의 소규모 고품질 샘플입니다. 이는 시험의 **"정답지"**라고 생각하세요.

결과: 누가 경주에서 이겼나?

1. "구식" 도서관 사서들의 실패:
연구자들이 엄격한 '공식 보고서'로 훈련된 AI 를 사용하여 '수다스러운 전화 통화'를 읽게 했을 때, 그 결과는 처참하게 실패했습니다.

  • 비유: 바다에서 특정 종류의 물고기를 찾기 위해 금속 탐지기를 사용하는 것과 같습니다. 금속 탐지기는 해변의 금속을 찾는 데 뛰어나지만 (공식 보고서), 바다 아래로 가져가면 (전화 통화) 쓸모없이 윙윙거릴 뿐입니다. AI 는 경직된 텍스트에서 messy 한 대화로의 전환을 처리하지 못했습니다.

2. "신식" 인턴들의 가능성:
연구자들은 그런 다음 Llama, Qwen, Gemini 와 같은 초지능 LLM 들을 특별한 '프롬프트 (일련의 지시사항)'와 함께 사용하여 추출기로 작동하게 했습니다.

  • 좋은 소식: 이러한 모델들은 맥락을 이해하는 데 훨씬 더 뛰어났습니다. 단어들이 약간 다르더라도 3 월의 "아이폰 매출"과 6 월의 "아이폰 판매"가 같은 개념임을 파악할 수 있었습니다.
  • 나쁜 소식: 완벽하지는 않았습니다. 그들은 의미 (의미론적 이해) 를 매우 잘 이해했지만, 때로는 정확한 단어 (정확한 일치) 에 어려움을 겪었습니다.
    • 비유: 시험을 치르는 학생을 상상해 보세요. "구식" AI 는 질문이 다르다는 것을 몰라 0 점을 받았습니다. "신식" AI 는 에세이 부분에서 높은 점수를 받았지만 (개념을 이해했음), 정답을 교사가 기대한 것과 약간 다르게 철자했기 때문에 객관식 부분에서 감점을 받았습니다.

"인간 - 루프" 시스템

AI 가 완벽하지 않았기 때문에, 연구자들은 AI 와 인간의 논리를 결합한 시스템을 구축했습니다.

  1. 추출: AI 가 통화를 듣고 숫자와 레이블을 추출합니다.
  2. 클러스터링: 시스템은 유사한 답변들을 그룹화합니다. (예: 한 AI 가 "아이폰 판매"라고 하고 다른 AI 가 "아이폰 매출"이라고 하면, 시스템은 이것이 같은 것임을 인식하고 그룹화합니다.)
  3. 인간 확인: 그들은 최종 결과를 인간이 확인하도록 했습니다.
    • 결과: 시스템의 정확도는 **79.7%**였습니다. 이는 시스템이 추출한 100 개의 숫자 중 약 80 개가 정확했다는 것을 의미합니다.

이것이 중요한 이유 (논문에 따르면)

이 논문은 Lyft 라는 회사가 포함된 실제 실적 발표회의 특정하고 까다로운 순간을 강조합니다.

  • 상황: 회사가 잘못된 숫자가 포함된 보고서를 발표했습니다. 주가가 급등했습니다. 그 후, 전화 통화 도중 CFO 는 "잠깐, 그건 실수였습니다. 숫자는 실제로 더 낮습니다"라고 말했습니다. 주가는 즉시 폭락했습니다.
  • 교훈: '수다스러운 전화 통화'에는 '공식 보고서'가 놓치는 실시간 진실이 포함되어 있습니다. 자동화 시스템이 통화를 읽지 못한다면, 투자자들은 가장 중요한 정보를 놓치게 됩니다.

한계점 (논문이 인정하는 부분)

  • "골드 스탠다드"는 완벽하지 않음: 이러한 통화를 레이블링할 수 있는 전문가가 매우 적기 때문에, 그들은 한 명의 전문가만 데이터를 레이블링했습니다. 이는 "정답지"가 일부 내용을 놓쳤을 수 있음을 의미하며, AI 를 실제보다 더 나쁘게 보이게 만들 수 있습니다.
  • 기업 문화의 차이: 일부 기업 (예: JP 모건) 은 매우 형식적으로 말하지만, 다른 기업들은 매우 캐주얼합니다. 시스템은 일부 기업에서는 더 잘 작동합니다.
  • 위험: 이 시스템이 실수를 하면 투자자들이 잘못된 금융 결정을 내릴 수 있습니다. 논문은 여전히 인간의 감독이 필요하다고 경고합니다.

한 문장으로 요약

이 논문은 컴퓨터가 엄격한 재무 서류를 읽는 데는 뛰어나지만 messy 한 실적 발표회에는 어려움을 겪지만, 새로운 "초지능" AI 모델이 대화를 이해하는 데 훨씬 더 나아지고 있음을 보여주며, 실시간으로 기업 성과를 추적할 수 있는 유망하지만 아직 완벽하지는 않은 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →