← 최신 논문
🤖 machine learning

Building Better Activation Oracles

이 논문은 환각 현상과 모호함을 해결하기 위해 네 가지 학습 개선 사항을 도입하여 Activation Oracles(AOs)를 강화하는 한편, 확장 가능한 엔드 투 엔드 해석 가능성을 발전시키기 위한 최초의 종합적인 평가 스위트인 AObench를 공개한다.

원저자: Jan Bauer, Celeste De Schamphelaere, Adam Karvonen, Niclas Luick, Neel Nanda

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jan Bauer, Celeste De Schamphelaere, Adam Karvonen, Niclas Luick, Neel Nanda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 이야기를 쓰고, 수학 문제를 풀거나, 질문에 답하는 아주 똑똑한 로봇(거대 언어 모델)이 있다고 상상해 보세요. 하지만 그 로봇의 "두뇌" 내부에는 인간은 이해할 수 없는 언어로 된 수십억 개의 작은 전기 신호들이 번쩍이고 있습니다. 이 신호들을 **활성화(activations)**라고 부릅니다.

오랫동안 우리는 로봇이 왜 특정한 결정을 내렸는지 그 이유를 알기 위해 그 두뇌 내부를 들여다보고 싶어 했습니다. 이때 등장한 것이 바로 **활성화 오라클(Activation Oracle, AO)**입니다. AO를 로봇의 "번역가" 또는 "전기 작가"라고 생각해보세요. 당신이 번역가에게 로봇의 전기 신호를 보여주며, "바로 이 순간에 무슨 생각을 하고 있었나요?"라고 물으면, 번역가는 그 내용을 평이한 영어로 설명하려고 노력합니다.

하지만 기존의 번역가들에게는 몇 가지 큰 문제가 있었습니다:

  1. 모호했습니다: "사과라는 단어를 생각하고 있었다"라고 말하는 대신, "문장의 개념을 생각하고 있었다"라고 말하곤 했습니다. (전혀 도움이 되지 않는 답변이죠!)
  2. 환각 현상을 일으켰습니다: 신호에 들어있지도 않은 세부 사항을 지어내곤 했습니다.
  3. "속임수"를 썼습니다: 때때로 이들은 신호를 실제로 읽지도 않았습니다. 그저 신호 앞뒤에 오는 단어들만 보고 문맥을 통해 답을 추측했습니다. 이를 "텍스트 역전(text inversion)"이라고 합니다라고 합니다.

이 논문의 저자들은 더 나은 번역기를 만들고자 했습니다. 그들은 단순히 코드를 수정하는 데 그치지 않고, 네 가지 구체적인 방식으로 훈련 과정을 재구축했습니다. 여기 그 방법들을 일상적인 비유를 들어 설명하겠습니다.

1. 더 나은 교과서 (대화형 데이터셋)

문제점: 기존의 번역가는 까다로운 프롬프트에 대해 질문하는 교과서(LatentQA)로 훈련되었습니다. 답변들이 신호만을 보고는 찾아내기가 불가능할 정도로 복잡했기 때문에, 번역가는 그저 추측하거나 모호한 답변을 내놓기 시작했습니다.
해결책: 저자들은 새로운 교과서를 만들었습니다. 그들은 로봇의 실제 "사고 과정"(내부 추론)을 가져와서 절반으로 자른 뒤, 다른 AI에게 "앞부분의 신호를 직접 확인해야만 답할 수 있는 질문"을 뒷부분에 대해 작성하도록 시켰습니다.
비유: 지도 읽는 법을 가르치는 학생을 상상해 보세요. 기존 방식은 지도와 함께 "보물이 어디 있나요?"라고 물었지만, 지도의 범례(legend)는 보여주지 않았습니다. 새로운 방식은 지도의 특정 지형지물을 보여주며 "바로 이곳의 지형은 어떠한가?"라고 묻습니다. 이는 번역가가 문맥에 의존해 추측하는 대신, 실제로 신호를 직접 들여다보도록 강제합니다.
결과: 이것이 가장 큰 개선 사항이었습니다. 새로운 번역기는 훨씬 더 구체적이 되었으며, 모호함을 탈피했습니다.

2. 더 많은 층 살펴보기 (멀티 레이어 피드)

문제점: 기존의 번역기는 로봇 두뇌의 특정 "층(floor)"(약 25% 또는 50% 깊이) 하나만을 관찰했습니다. 하지만 로봇의 "생각"은 여러 층에 걸쳐 퍼져 있습니다.
해결책: 저자들은 가장 흥란한 "생각"들이 60~80% 지점에서 일어난다는 것을 깨달았습니다. 그래서 단 하나의 층만 보는 대신, 다섯 개의 연속된 층에서 나오는 신호를 한꺼번에 번역기에게 입력했습니다.
비유: 영화를 이해하려고 할 때, 단 한 프레임(한 층)만 보는 것은 정보가 매우 적습니다. 다섯 프레임(다섯 층)의 짧은 클립을 보면, 움직임과 맥락을 파악하여 상황을 이해할 수 있습니다.
결과: 이는 번역기가 서로 다른 모델들을 비교할 때, 로봇의 "영화" 같은 사고 과정을 더 잘 이해하도록 도왔습니다.

3. "실시간" 데이터로 훈련하기 (온-폴리 롤아웃)

문제점: 기존의 번역기는 오래되고 정적인 데이터(로봇이 존재하기 전의 도서관 책들 같은 것)로 훈련되었습니다. 이는 50년 동안 변하지 않은 도시의 지도를 가지고 운전 교육을 하는 것과 같습니다.
해결책: 저자들은 로봇이 실제로 생각하는 동안 생성되는 데이터로 번역기를 훈련시키기 시작했습니다.
비유: 예전에 끝난 연극의 대본을 가지고 번역가를 가르치는 대신, 연극이 실시간으로 진행되는 동안 관객석에 번역가를 앉혀둔 것입니다. 이를 통해 번역가는 과거의 생각이 아니라, '지금 바로 이 순간' 로봇이 어떻게 생각하는지를 배울 수 있습니다.
결과: 효과가 약간 있었지만, 결정적인 해결책은 아니었습니다. 다만 번역기가 로봇의 현재 상태를 이해하는 데 도움을 주었습니다.

4. 볼륨 높이기 (주입 강도)

문제점: 번역기에게 신호를 보여줄 때, 신호의 "볼륨"(또는 강도)이 너무 작았습니다. 번역기는 소음이 심한 방 안에서 속삭임을 들으려고 애쓰는 격이었습니다.
해해결책: 저자들은 번역기에 입력되는 신호의 "볼륨"을 높였습니다.
비유: 시끄러운 콘서트장에서 친구의 말을 들으려고 한다고 상상해 보세요. 만약 메모지 한 장만 건네준다면 친구는 놓칠 수 있습니다. 하지만 메모를 크게 외쳐서 전달한다면(강도를 높인다면), 훨씬 더 잘 들을 수 있습니다.
결과: 이 방법이 전체 점수를 크게 바꾸지는 않았지만, 환각 현상을 현저히 줄여주었습니다. 실제 신호가 더 크고 명확해졌기 때문에, 번역기가 사실을 지어내는 일이 줄어들었습니다.

최종 결과: AObench

새로운 번역기가 정말 더 나은지 증명하기 위해, 저자들은 AObench라는 새로운 테스트를 만들었습니다. 이것은 이 번역기들을 위한 전용 "운전면허 시험"이라고 생각하면 됩니다. 이 시험은 다음을 체크합니다:

  • 모호성: 번역기가 구체적인 답을 주는가, 아니면 두루뭉술한 답을 주는가?
  • 환각: 번역기가 사실을 지어내는가?

판결:
이 네 가지 해결책을 모두 결합함으로써, 새로운 번역기는 기존의 것보다 훨씬 더 뛰어납니다.

  • 덜 모호합니다 (구체적인 답을 제시합니다).
  • 환각이 적습니다 (더 자주 진실을 말합니다).
  • 지시사항을 더 잘 따릅니다.

저자들은 이 번역기가 아직 완벽하지는 않지만, 견고한 토대를 마련했다고 인정합니다. 그들은 번역기에게 더 나은 훈련 데이터를 제공하고, 뇌의 활동을 더 많이 보여주며, 볼륨을 높여주면, AI 모델이 어떻게 생각하는지에 대한 훨씬 더 신뢰할 수 있는 창이 된다는 것을 보여주었습니다.

요약하자면: 그들은 추측하고 모호하게 말하던 번역기를, 실제로 경청하고, 전체적인 그림을 보며, 진실을 말하는 번역기로 탈바꿈시켰습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →