← 최신 논문
⚡ electrical engineering

Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection

본 논문은 LLM 기반 음성 인식에서 고정된 프롬프트 설계로 인한 성능 불안정성을 해결하기 위해 프롬프트 임베딩을 최적화하도록 학습하는 단순하고 모델에 구애받지 않는 프롬프트 프로젝터 모듈을 제안함으로써 다양한 데이터셋에서 정확도를 일관되게 향상시키고 변이성을 감소시킨다.

원저자: Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Srikanth Madikeri, Andrés Carofilis, Pradeep Rangappa, Manjunath K E, Kadri Hacioglu, Petr Motlicek, Andreas Stolcke

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Srikanth Madikeri, Andrés Carofilis, Pradeep Rangappa, Manjunath K E, Kadri Hacioglu, Petr Motlicek, Andreas Stolcke

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 인간 목소리를 들어본 적이 없지만 매우 똑똑하고 다국어 번역이 가능한 뛰어난 번역가 (대형 언어 모델 또는 LLM) 가 있다고 가정해 봅시다. 이 번역가가 음성을 이해하도록 하려면 특수한 어댑터 (음성 프로젝터) 를 통해 마이크 시스템 (음성 인코더) 에 연결해야 합니다. 이 어댑터는 소리 파동을 번역가가 이해할 수 있는 언어로 변환합니다.

오랫동안 연구자들은 좋은 어댑터를 구축하는 것만이 중요하다고 생각했습니다. 그들은 번역가에게 주는 "지시문"이나 프롬프트(예: *"들리는 내용을 적어 주세요"*라는 메모) 가 일관성만 있다면 크게 중요하지 않다고 가정했습니다. 그들은 모든 테스트에 동일한 손으로 쓴 메모를 사용했습니다.

이 논문은 다음과 같이 말합니다: "이것은 문제입니다. 당신이 쓴 메모가 실제로 매우 중요하며, 이로 인해 시스템이 불안정해지고 있습니다."

간단한 비유를 사용하여 그들의 발견과 해결책을 살펴보겠습니다:

1. 문제: "손으로 쓴 메모" 로또

연구자들은 어떤 메모 (프롬프트) 가 가장 효과적인지 확인하기 위해 10 가지 다른 메모를 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  • 메모가 점수를 바꿉니다: 마치 학생이 교사가 시험 문제를 어떻게 표현하느냐에 따라 더 좋은 성적을 받을 수 있듯이, 음성 인식 시스템은 프롬프트의 문구에만 따라 결과가 크게 좋아지거나 나빠졌습니다.
  • 완벽한 "메모"는 없습니다: 모든 상황에 가장 잘 작동하는 단일 메모는 존재하지 않았습니다. 전화 통화에는 훌륭하게 작동하던 메모가 회의 녹음에는 끔찍하게 들렸습니다.
  • 불안정성: "가장 좋은" 메모가 데이터에 따라 변하기 때문에 시스템은 예측 불가능했습니다. 실수로 잘못된 메모를 선택하면 전사 내용이 오류로 가득 차게 될 수 있습니다.

비유: 라디오를 튜닝한다고 상상해 보세요. 오랫동안 사람들은 안테나 (음성 인코더) 가 좋기만 하면 라디오 방송국 (프롬프트) 은 중요하지 않다고 가정했습니다. 하지만 이 논문은 잘못된 방송국으로 튜닝하면 안테나가 완벽하더라도 음악이 정전기 소음처럼 들린다는 사실을 발견했습니다. 그리고 모든 청취자에게 좋은 음악을 재생하는 하나의 "마법 방송국"은 존재하지 않습니다.

2. 해결책: 메모를 위한 "스마트 번역가"

완벽한 메모를 찾으려 노력하는 대신 (이는 어렵고 일관성이 없습니다), 저자들은 프롬프트 프로젝터라는 새로운 도구를 개발했습니다.

원래의 프롬프트를 대략적인 스케치라고 생각하세요. 프롬프트 프로젝터는 그 대략적인 스케치를 가져와 메인 번역가 (LLM) 에게 도달하기 전에 자동으로 완벽하고 고해상도의 지시문으로 다듬어 주는 스마트 필터나 "번역가"와 같습니다.

  • 작동 방식: 이 도구는 당신이 주는 어떤 프롬프트든 LLM 이 이해할 수 있도록 가장 효과적인 형태로 재구성하는 법을 학습합니다.
  • 즉시 적용 가능한 업그레이드: 전체 시스템을 다시 구축할 필요가 없습니다. 기존 설정 위에 이 작고 학습 가능한 레이어만 추가하면 됩니다.
  • 결과: 시스템에 나쁜 메모를 주든 좋은 메모를 주든 더 이상 중요하지 않습니다. "스마트 번역가"가 메모를 자동으로 수정해 줍니다.

비유: GPS 에 길 안내를 한다고 상상해 보세요.

  • 이전: GPS 가 작동하도록 하려면 정확한 표현을 외워야 했습니다. "큰 나무에서 왼쪽으로 돌아라"라고 말했는지 "참나무에서 왼쪽으로 돌아라"라고 말했는지에 따라 GPS 가 혼란스러워할 수 있었습니다.
  • 이후: 당신과 GPS 사이에 "스마트 통역사"를 추가했습니다. 이제 "큰 나무에서 왼쪽으로 돌아라", "초록색 물건 근처에서 왼쪽으로 가라", 심지어 중얼거려도 통역사가 즉시 당신의 엉성한 지시문을 GPS 가 필요로 하는 완벽한 명령어로 번역합니다. 당신이 어떻게 말했든 GPS 는 매번 완벽하게 작동합니다.

3. 결과

연구자들은 이 방법을 네 가지 다른 유형의 오디오 (읽는 책, 전화 통화, 회의, 콜센터 채팅) 에 대해 테스트했습니다.

  • 일관성: 시스템이 훨씬 더 안정적이 되었습니다. "나쁜" 메모가 나쁜 결과를 초래하지 않게 되었습니다.
  • 성능: 프롬프트 프로젝터를 사용한 시스템은 프로젝터가 없는 상태에서 "가장 좋은" 원래 메모를 사용한 시스템보다 "가장 나쁜" 원래 메모를 사용했을 때에도 더 나은 성능을 발휘했습니다.
  • 간단함: 그들은 메인 두뇌 (LLM) 나 마이크 (음성 인코더) 를 변경할 필요가 없었습니다. 지시문을 처리하는 이 작고 스마트한 레이어만 추가하면 되었습니다.

요약

이 논문은 AI 음성 인식을 위해 고정된 인간이 작성한 지시문에 의존하는 것은 위험하다고 주장합니다. 왜냐하면 문구의 작은 변화가 성능에 큰 변동을 일으키기 때문입니다. 그들의 해결책은 지시문을 위한 "범용 번역가" 역할을 하는 간단하고 학습 가능한 모듈로, 지시문이 어떻게 표현되든 AI 가 작업을 완벽하게 이해하도록 보장합니다. 이는 시스템을 더 견고하고 신뢰할 수 있게 만들며, 전사를 요청하는 "완벽한" 방법을 인간이 추측하는 것에 대한 의존도를 줄여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →