← 최신 논문
💬 NLP

FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following

이 논문은 IWSWT 2026 지시 이행(Instruction Following) 공유 과제를 위한 FBK의 SpeechLLMs를 제시하며, 30초 고정 세그멘테이션이 반복적인 환각 현상의 어려움에도 불구하고 강력한 단문 성능을 유지하면서 HIFS 점수 2.0663으로 가장 견고한 장문 성능을 달성함을 입증한다.

원저자: Zhihang Xie, Marco Gaido, Sara Papi, Matteo Negri, Luisa Bentivogli

게시일 2026-06-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhihang Xie, Marco Gaido, Sara Papi, Matteo Negri, Luisa Bentivogli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 짧은 문장을 듣고 지시를 따르는 데 능숙한, 다국어를 구사하는 아주 똑똑한 로봇 비서가 있다고 상상해 보세요. 예를 들어 "이 문장을 번역해 줘"라거나 "프랑스의 수도는 어디야?"와 같은 명령을 수행하는 모델입니다. 이것이 이 로봇의 "단문(Short-Form)" 버전입니다.

FBK의 연구원들은 이 로봇이 혼란에 빠지거나, 무언가를 잊어버리거나, 말을 지어내지 않고도 길고 복잡한 이야기(예: 30분짜리 강연이나 전체 팟캐스트)를 처리할 수 있도록 업그레이드할 수 있는지 확인하고 싶었습니다. 이 논문은 그들이 IWSL 2026이라는 경연 대회를 위해 이를 어떻게 시도했는지에 대한 성적표입니다.

그들의 여정을 이해하기 쉽게 설명하면 다음과 같습니다:

1. 로봇의 두뇌 (아키텍처)

로봇을 세 가지 주요 부분으로 나누어 생각해 보세요:

  • 귀 (음성 인코더 - Speech Encoder): 이 부분은 가공되지 않은 음파를 듣고 뇌가 이해할 수 있는 언어로 변환합니다. 그들은 SEAMLESSM4T라는 사전 학습된 "슈퍼 귀"를 사용했습니다.
  • 번역기 (모달리티 어댑터 - Modality Adapter): 이것은 다리 역할을 합니다. 소리 데이터를 가져와서 로봇의 사고 공간에 딱 맞게 압축합니다. 마치 긴 소설을 뇌가 더 빨리 읽을 수 있도록 각 장을 요약하는 것과 같습니다.
  • 두뇌 (LLM 디코더 - LLM Decoder): 이것은 생각하는 부분으로, Qwen3라는 모델을 기반으로 합니다. 이 모델은 이미 텍ек스트 지시를 따르는 데 매우 능숙합니다. 연구원들은 단지 이 모델에게 텍스트를 읽는 대신 오디오를 듣는 법을 가르쳤을 뿐입니다.

2. 단거리 트랙: "스프린트(Sprint)"

먼저, 그들은 짧은 작업(예: 5초짜리 클립)을 통해 로봇을 테스트했습니다.

  • 결과: 로봇은 스프린트를 완벽하게 완수했습니다. 번역, 전사(transcription), 질문 답변에서 높은 점수(2.07)를 받았습니다. 이는 로봇이 이미 짧은 대화에서는 챔피언임을 입증했습니다.

3. 장거리 트랙: "마라톤(Marathon)"

여기서부터 까다로워집니다. 로봇에게 "이 30분짜리 오디오를 들어봐"라고 한꺼번에 말할 수는 없습니다. 그렇지 않으면 로봇의 기억력(컨텍스트 윈도우)이 과부하되어 혼란에 빠지거나 환각 현상(hallucination, 말을 지어내는 것)을 일으킬 수 있기 때문입니다.

이를 해결하기 위해, 그들은 긴 빵 한 덩어리를 슬라이스하듯 오디오를 관리 가능한 조각으로 자르는 세 가지 다른 방법을 시도했습니다:

  • 전략 A: 고정 슬라이서 (30초 단위 슬라이스).
    오디오에서 무슨 일이 일어나든 상관없이 오디오를 완벽하게 동일한 30초 단위로 자르는 기계를 상상해 보세요.

    • 결과: 이 방식이 승자였습니다. 가장 안정적이었습니다. 로봇은 혼란을 느끼지 않았고, 가짜 단어를 만들어내는 일도 적었습니다.
  • 전략 B: 스마트 슬라이서 (음성 감지).
    이 방식은 화자가 말을 멈추는 것과 같은 자연스러운 휴지기를 찾아내어 오디오를 자르는 도구를 사용합니다.

    • 결과: 괜찮기는 했지만, 때때로 오디오를 이상한 곳에서 자르거나 조각을 너무 짧게 만들어 로봇이 이야기의 흐름을 놓치게 만들기도 했습니다.
  • 전략 C: 하이브리드 슬라이서.
    이 방식은 두 가지를 결합하려고 시도합니다. 휴지기를 찾으면서도, 조각이 너무 길어지면 강제로 자릅니다.

    • 결과: 스마트 슬라이서보다는 나았지만, 단순하고 꾸준한 고정 슬라이서를 이기지는 못했습니다.

4. "환각(Hallucination)" 문제

로봇이 긴 오디오를 들으려고 할 때, 나쁜 습관이 하나 있었습니다: 반복적인 삽입(Repetitive Insertions).

  • 비유: 학생이 긴 받아쓰기 시험을 보고 있다고 상상해 보세요. 지치거나 혼란스러워지면, 방금 쓴 마지막 문장을 계속 반복해서 쓰거나, 말하지 않은 새로운 문단을 지어내기 시작합니다.
  • 영향: 이 현상은 로봇의 전사(말한 내용을 받아 적는 것) 결과물을 엉망으로 만들었습니다. 반복되는 헛소리로 가득 차게 되었기 때문입니다. 연구원들은 이 "환각" 현상이 로봇이 긴 오디오를 처리하는 데 있어 주요한 걸림돌임을 발견했습니다.

5. 최종 성적표

그들은 HIFS(환각 페널티 점수 - Hallucination-Penalized Score)라는 새로운 채점 시스템을 만들었습니다. 이 점수는 단순히 로봇이 얼마나 잘 이해했는지만 보는 것이 아니라, 로봇이 말을 지어내기 시작하면 점수를 삭감합니다.

  • 승자: 고정 30초 슬라이싱 전략을 사용한 로봇이 가장 높은 점수(2.06)로 장거리 트랙에서 우승했습니다.
  • 핵론: 이 로봇은 주로 짧은 클립으로 학습되었음에도 불구하고, 입력을 일정한 조각으로 잘 나누어 준다면 긴 오디오도 꽤 잘 처리할 수 있다는 것을 보여주었습니다. 짧은 작업을 수행하는 능력을 잃지는 않았지만, 말을 지어내는 것을 막기 위해 입력 길이를 관리하는 데 도움이 필요했습니다.

요약

이 논문은 짧은 것을 듣는 로봇을 긴 것을 듣는 로봇으로 바꿀 수 있지만, 오디오를 어떻게 입력하느냐에 주의를 기울여야 한다는 것을 보여줍니다. **단순하고 일정한 슬라이싱(30초씩 끊어서)**이 자연스러운 휴지기에 맞춰 자르려는 똑똑한 방식보다 더 효과적이었습니다. 가장 큰 적은 오디오의 길이가 아니라, 로봇이 과부하가 걸렸을 때 스스로를 반복하거나 단어를 지어내는 경향이었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →