← 최신 논문
⚡ electrical engineering

JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions

JASTIN은 평가를 자기 주도적 추론 작업으로 형식화하여 다양한 오디오 및 음성 콘텐츠에 대한 최첨단 제로샷 평가를 달성하기 위해 대규모 언어 모델을 고정된 오디오 인코더와 정렬시키는 새로운 지시 기반 프레임워크입니다.

원저자: Leying Zhang, Bowen Shi, Haibin Wu, Bach Viet Do, Yanmin Qian

게시일 2026-05-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Leying Zhang, Bowen Shi, Haibin Wu, Bach Viet Do, Yanmin Qian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

음악 프로듀서나 내레이션 아티스트라고 상상해 보세요. 새로운 오디오 클립을 방금 만들었는데, 이제 궁금합니다: "이게 좋은가?"

과거에는 두 가지 선택지가 있었습니다:

  1. "인간 패널": 사람들에게 청취를 의뢰하고 점수를 매기도록 하는 것입니다. 이는 금표준이지만 비용이 많이 들고 느리며 확장하기 어렵습니다.
  2. "로봇 자": 고정된 규칙 세트를 가진 컴퓨터 프로그램 (자처럼) 을 사용하여 소리를 측정하는 것입니다. 문제는 무엇일까요? 이러한 자는 경직되어 있습니다. 연필 선의 직선성을 측정하도록 설계된 자는 미소의 곡선을 측정하려 하면 부러질 수 있습니다. 마찬가지로, 오래된 오디오 도구는 음성에서 음악으로 전환하거나 "좋은" 소리의 "규칙"이 바뀔 때 종종 실패합니다.

이제 JASTIN이 등장합니다.

JASTIN 이란 무엇인가요?

JASTIN 을 인간처럼 듣지만 기계처럼 작동하도록 훈련된 초지능적이고 적응력 있는 오디오 비평가로 생각하세요.

단 하나이고 경직된 자를 사용하는 대신, JASTIN 은 "대화"를 사용합니다. 당신이 무엇을 알고 싶은지 알려줍니다 (예: "이 목소리가 얼마나 자연스러운지 1 에서 10 점까지 평가해 주세요" 또는 "이 음악이 너무 시끄러운지 알려주세요"). 그러면 JASTIN 은 오디오를 듣고 정확히 그 지시사항에 기반하여 점수를 매겨 줍니다.

어떻게 작동할까요? ("번역기" 비유)

이 논문은 전문가 팀처럼 작동하는 3 단계 시스템을 설명합니다:

  1. 귀 (동결된 인코더): 수백만 개의 소리를 이미 들어본 초고감도 귀 쌍을 상상해 보세요. 이들은 "동결"되어 있어 새로운 것을 배우지 않습니다. 태어날 때부터 하도록 설계된 일만 합니다: 소리를 작고 상세한 조각으로 분해하는 것입니다.
  2. 번역기 (어댑터): "귀"는 원시 파동이라는 언어로 말하지만, "뇌"는 인간의 언어만 이해합니다. 어댑터는 뉘앙스를 잃지 않고 그 파동을 뇌가 이해할 수 있는 단어로 변환하는 번역기입니다.
  3. 뇌 (LLM): 이는 매우 고급 챗봇과 같은 대규모 언어 모델입니다. 지시사항, 추론, 그리고 문맥을 이해하는 데 뛰어납니다. 번역된 소리와 당신이 준 구체적인 지시사항을 받아, "상식"을 사용하여 점수를 결정합니다.

비결: 어떻게 훈련시켰나요?

AI 비평가들의 가장 큰 문제는 질문의 표현을 바꾸면 종종 혼란을 겪는다는 점입니다. "이게 얼마나 시끄러운가?"라고 물으면 "이게 조용한가?"라고 물었을 때와 다른 답을 줄 수 있습니다. 비록 같은 의미로 물었더라도요.

이를 해결하기 위해 연구자들은 AI 를 위한 "훈련 병사" 같은 훈련 파이프라인을 구축했습니다:

  • 다중 소스: 그들은 AI 에게 인간의 음성, 음악, 그리고 무작위 소리 등 모든 곳의 오디오를 공급했습니다.
  • 다중 작업: 그들은 단순히 "품질"을 평가하도록 요청하지 않았습니다. "감정", "왜곡", "자연스러움"을 평가하도록 요청했고, 심지어 AI 가 어떻게 생각할지 가르치기 위해 가짜 작업을 만들기도 했습니다.
  • "재표현" 트릭: 이것이 가장 창의적인 부분입니다. 그들은 하나의 질문을 가져와 다른 AI 로 하여금 그것을 20 가지 다른 방식으로 (짧게, 길게, 격식 있게, 캐주얼하게, 논리 반전으로) 다시 쓰게 했습니다. 그들은 JASTIN 에게 "소음을 평가하라"와 "신호의 선명도를 알려라"는 동일한 요청임을 가르쳤습니다. 이로 인해 JASTIN 은 강건해졌습니다. 질문을 어떻게 표현하든 흔들리지 않게 된 것입니다.

그들은 무엇을 발견했나요?

이 논문은 JASTIN 이 세 가지 주요 이유로 게임 체인저라고 주장합니다:

  1. "제로샷" 챔피언: 보통 AI 가 음악을 평가하게 하려면 음악에 대해 특별히 훈련시켜야 합니다. 음성을 평가하게 하려면 음성으로 훈련시켜야 합니다. JASTIN 은 다릅니다. 당신이 한 번도 본 적 없는 노래, 음성, 또는 효과음을 평가하도록 요청해도 추가 훈련 없이도 여전히 훌륭한 성과를 냅니다.
  2. 인간의 취향과 일치: 연구자들이 JASTIN 의 점수를 실제 청취자들의 점수와 비교했을 때, JASTIN 은 오래된 "로봇 자"나 다른 정교한 AI 모델들보다 인간의 의견에 훨씬 더 가까웠습니다.
  3. 유연성: JASTIN 에게 15 점 척도, 1100 점 척도, 또는 심지어 "합격/불합격" 시스템을 사용하도록 지시하면, 즉시 점수 매기기 논리를 조정합니다.

어디에서 어려움을 겪나요? (한계점)

최고의 비평가라도 맹점이 있습니다. 논문은 JASTIN 이 모든 것에 완벽하지 않다고 인정합니다:

  • 속도 평가자: 누군가가 얼마나 빠르거나 느리게 말하는지 평가하는 데는 뛰어나지 않습니다. 때때로 리듬을 놓칩니다.
  • 속삭임 (ASMR): ASMR (속삭이는 소리) 을 평가할 때 AI 는 혼란을 겪습니다. 그것은 종종 속삭임의 "숨이 섞인" 특성을 기술적 결함이나 소음으로 오인합니다. 왜냐하면 그것은 선명하고 큰 목소리를 평가하는 데 익숙하기 때문입니다.

결론

JASTIN 은 오디오를 평가하는 새로운 방법입니다. 오디오를 단일 측정치로 박스에 넣는 대신, 오디오 평가를 대화로 취급합니다. AI 에게 지시사항을 이해하고 다양한 문맥에 적응하도록 가르침으로써, 연구자들은 이전의 어떤 것보다 더 유연하고 정확하며 인간 청취자와 더 유사한 도구를 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →