← 최신 논문
💻 computer science

Interactive In-Meeting Speaker Correction with Human Feedback

본 논문은 처리 및 피드백 불확실성을 처리하도록 설계된 메커니즘을 통해 실시간으로 화자 귀속 오류를 수정하기 위해 인간 피드백을 통합하는 LLM 지원 회의 중 시스템을 제안하며, 이를 통해 AMI 데이터셋에서 디아리제이션 오류율을 크게 감소시켰습니다.

원저자: Xinlu He, Yiwen Guan, Badrivishal Paurana, Pitipat Kongsomjit, Zilin Dai, Jacob Whitehill

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinlu He, Yiwen Guan, Badrivishal Paurana, Pitipat Kongsomjit, Zilin Dai, Jacob Whitehill

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

네 명의 동료가 있는 바쁜 회의실에 앉아 있다고 상상해 보세요. 똑똑한 비서가 회의 내용을 듣고 누가 무엇을 말했는지 정확히 기록하려고 노력하고 있습니다. 하지만 피곤한 인간 기록원처럼 비서도 혼란에 빠질 수 있습니다. 실제로는 사라가 한 말인데 로사가 한 것으로 오인하거나, 서로 다른 두 문장을 섞어 잘못된 사람에게 할당할 수도 있습니다.

보통 이런 오류를 수정하는 것은 악몽과 같습니다. 회의를 중단하고 방대한 텍스트 더미를 스크롤하여 실수가 발생한 정확한 순간을 찾아 수동으로 드래그 앤 드롭하여 수정해야 합니다. 이는 지루하고 산만하며, 대화를 나누려는 동안 아무도 이런 작업을 하고 싶어 하지 않습니다.

이 논문은 이를 처리하는 새로운 방식을 제안합니다: "헤이 코비 (Hey Cobi)" 수정법입니다.

문제: "오픈 루프" 오류

대부분의 음성 시스템은 "오픈 루프" 모드로 작동합니다. 듣기, 추측하기, 기록하기만 할 뿐, 실수를 하면 이를 인지하지 못하거나 도움을 요청하지도 않습니다. 마치 GPS 가 계속 왼쪽으로 돌아 호수로 들어갈 것을 지시하지만, "이봐, 정말 그곳으로 가고 싶니?"라고 묻지 않는 것과 같습니다.

해결책: 똑똑한 대화형 비서

연구진들은 회의 중 유용한 공동 조종사처럼 작동하는 시스템을 구축했습니다. 작동 방식은 다음과 같습니다.

1. "한눈에" 요약 (하이라이트 리플레이)
전체 대본을 읽게 만드는 것 (압도적임) 대신, 시스템은 대규모 언어 모델 (LLM) 을 사용하여 방금 일어난 일을 빠르고 간결하게 요약합니다.

  • 유사성: 30 분짜리 전체 경기 영상을 보여주는 대신, 스포츠 해설자가 마지막 플레이에 대한 10 초 요약만 제공하는 것과 같습니다. 다음과 같이 알려줍니다: "사라가 모델 구축을 제안했지만, 로사는 과적합을 경고했습니다."

2. "헤이 코비" 수정 (자연스러운 교정)
요약을 보고 "잠깐, 그건 틀렸어! 로사가 그런 말을 한 게 아니라 사라가 한 말이야"라고 생각한다면, 타이핑이나 클릭이 필요 없습니다. 자연스럽게 말하기만 하면 됩니다.

  • 행동: **"헤이 코비, 과적합을 언급한 건 사라가 아니라 로사였어."**라고 말합니다.
  • 마법: 시스템은 "코비"를 웨이크 워드로 인식하고 회의 중 다른 소음은 무시한 채 사용자의 교정을 이해합니다.

3. "미세" 수술 (정밀한 교정)
이제 시스템이 영리해지는 부분입니다. 때로는 비서의 녹음이 지저분할 수 있습니다. 세 개의 다른 문장을 하나의 큰 블록으로 묶어 놓은 경우, 단순히 "그건 로사였어"라고 말하면 멍청한 시스템은 그 지저분한 블록 전체를 로사에게 재할당하여 대화의 다른 부분을 망칠 수 있습니다.

  • 혁신: 시스템은 "병합 시 분할 (Split-When-Merged)" 기법을 사용합니다. 이는 외과 의사가 메스로 작동하여, 실제로 누가 말했는지에 따라 그 지저분한 블록을 더 작고 깨끗한 조각으로 잘라냅니다. 그런 다음 사용자의 피드백을 활용하여 틀린 특정 문장만 수정하고 나머지는 그대로 둡니다.

4. "기억 업그레이드" (온라인 등록)
시스템이 실수를 수정한 후 단순히 텍스트를 이동하는 것을 넘어 학습합니다. 로사가 그 특정 단어를 말하는 생생한 오디오 샘플을 가져와 새로운 "음성 지문"으로 저장합니다.

  • 유사성: 새로운 사람을 만나고 "아, 너 재즈를 좋아하는 그 사람이구나!"라고 말하는 것과 같습니다. 다음에 재즈를 들으면 즉시 그 사람을 떠올리게 됩니다. 이제 시스템은 로사의 목소리에 대한 "귀"가 더 좋아져서 미래에 사라와 혼동할 가능성이 줄어듭니다.

결과: 효과가 있을까요?

연구진들은 표준 녹음 회의 세트 (AMI 데이터셋) 에서 이를 테스트했습니다. 실시간으로 실제 인간이 교정을 수행하게 할 수 없었으므로, 사용자의 교정을 시뮬레이션했습니다.

  • 기준선: 표준 시스템은 화자 할당의 약 **36%**를 잘못 수행했습니다.
  • 새로운 시스템: "헤이 코비" 워크플로우를 사용하면 오류율이 **24%**로 감소했습니다.
  • 큰 승리: "누가 무엇을 말했는지"에 대한 특정 오류 (화자 오류) 를 52% 줄였습니다. 이는 시스템이 누가 말하는지 아는 능력이 두 배 좋아졌음을 의미합니다.

함정 (한계점)

이 논문은 그들이 아직 하지 않은 일에 대해 매우 솔직합니다:

  • 시뮬레이션: 교정을 수행하는 사용자를 대신해 AI 를 사용했습니다. 아직 실제 인간이 있는 라이브 룸에서 테스트하지는 않았습니다.
  • "누가"만 해당: 이 시스템은 누가 말했는지는 수정하지만, 무엇이 말해졌는지는 수정하지 않습니다 (예: 시스템이 "bat"을 "cat"으로 잘못 들은 경우, 이 시스템은 그 단어를 수정하지 않습니다).
  • 미래 예측 불가: 시스템은 실시간 (스트리밍) 으로 작동합니다. 회의를 끝까지 기다렸다가 수정할 수 없으며, 진행되면서 결정하고 수정해야 합니다.

한 마디로 요약

이 논문은 단순히 듣고 추측하는 회의 비서를 제안합니다. 빠른 요약을 제공하고, 간단한 음성 명령으로 자연스럽게 오류를 수정하게 하며, 그 수정을 통해 회의 나머지 부분에서 더 똑똑해지도록 합니다. 이는 좌절스러운 수동 편집 작업을 빠르고 대화식인 교정으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →