← 최신 논문
💬 NLP

Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect

이 논문은 소규모 언어 모델(1B 파라미터 모델 포함)이 내부 활성화 섭동을 신뢰성 있게 탐지하고 보고하도록 성공적으로 학습시켜, 모델 규모에만 의존하지 않는 잠재적인 자기 모니터링 능력을 끌어내는 방법론인 내성 미세 조정(Introspection Fine-Tuning, IFT)을 소개한다.

원저자: Ely Hahami, Ishaan Sinha, Lavik Jain

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ely Hahami, Ishaan Sinha, Lavik Jain

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 생각이 뇌 속의 특별한 페이지 위에 적힌 투명 잉크와 같은 세상을 상상해 보세요. 오랫동안 인공지능(AI)을 연구하는 과학자들은 이 디지털 뇌들이 언젠가 자신의 페이지를 "내려다보고", 그 잉크를 보며, 자신이 무엇을 생각하고 있는지 우리에게 말해줄 수 있을지 궁금해했습니다. 이 분야를 **AI 자기 성찰(AI introspection)**이라고 부릅니다. 이것은 마치 사람에게 "당신이 지금 행복하다고 느끼고 있다는 걸 알고 있나요?"라고 묻는 것과 비슷하지만, 컴퓨터를 대상으로 하는 것입니다. 이를 테스트하기 위해 연구자들은 **활성화 스티어링(activation steering)**이라는 기술을 사용합니다. 이것은 컴퓨터의 내부 "생각"을 특정 방향으로 부드럽게 밀어내는 리모컨이라고 생각하면 됩니다. 예를 들어, 처리 과정에 아주 약간의 "슬픔"이나 "수학"을 더하는 식이죠. 만약 컴퓨터가 "어, 방금 슬픔의 자극을 느꼈어요"라고 말할 수 있다면, 이는 컴퓨터가 어느 정도의 자기 인식력을 갖추었음을 증证明합니다. 이것이 중요한 이유는, 만약 AI가 자신의 내부적인 오류나 기만적인 생각을 정직하게 보고할 수 있다면, 우리가 AI를 더 신뢰할 수 있게 되기 때문입니다. 하지만 AI가 내부에서 일어나는 일을 그저 추측하거나 거짓말을 하는 것이라면, 우리는 알지도 못한 채 곤경에 처할 수도 있습니다.

그래서 한 연구팀은 이 자기 인식이 거대하고 비싼 모델뿐만 아니라, 더 작고 저렴한 AI 모델에서도 작동하는지 알아보기로 했습니다. 그들은 간단한 테스트를 시도했습니다. AI의 뇌를 살짝 밀어본 뒤, "방금 자극을 느꼈나요?"라고 물었습니다. 하지만 그들은 곧 재미있는 문제에 직면했습니다. 작은 모델들의 경우, 자극이 전혀 없었을 때조차 대답이 거의 항상 "네!"였습니다. 그것은 마치 사람이 실제로 있든 바람이 불어 문이 흔들리든 상관없이 모든 초인종 소리에 짖어대는 강아지와 같았습니다. AI는 실제로 생각을 감지한 것이 아니라, 그저 흥분해서 모든 것에 "네"라고 답하고 있었던 것입니다.

이를 해결하기 위해 과학자들은 두 가지 더 나은 게임을 발명했습니다. 첫 번째는 "어떤 문장인가요?" 게임입니다. 그들은 열 개의 문장을 쓰고 그중 하나에만 몰래 자극을 주었습니다. 그리고 AI에게 "이 열 개의 문장 중 어떤 문장이 자극을 받았나요?"라고 물었습니다. 만약 AI가 올바른 문장을 골라낼 수 있다면, 그것은 진정으로 자신의 뇌 내부를 들여다보고 있다는 뜻입니다. 두 두 번째는 "더 강한 자극" 게임입니다. 그들은 두 개의 서로 다른 문장에 자극을 주었는데, 하나에는 부드러운 톡 치기를, 다른 하나에는 강한 밀치기를 가했습니다. 그리고 "어느 쪽이 더 강하게 쳤나요?"라고 물었습니다. 이것은 AI가 단순히 추측하는 것이 아니라, 자극의 강도 차이를 느낄 수 있다는 것을 입증했습니다.

결과는 놀라웠습니다. 그들은 10억 개의 "뇌 세포"(파라미터)를 가진 아주 작은 모델부터 260억 개의 모델까지 다양한 크기의 모델들을 테스트했습니다. 그 결과, 10억 규모의 아주 작은 모델들은 무작위 추측보다 겨우 나은 수준으로 게임을 수행하는 데 매우 서툴렀습니다. 그러나 모델의 크기가 20억 또는 30억에 도 달하자, 갑자기 자극을 포착하는 능력이 꽤 좋아졌으며, 모델이 커질수록 성능도 향상되었습니다. 10억 규모의 모델들은 이를 자연스럽게 수행할 수 있는 "하드웨어"가 부족해 보였습니다.

하지만 여기서 가장 멋진 부분은 과학자들이 "작은 모델들에게도 이것을 가르칠 수 있을까?"라고 질문했다는 점입니다. 그들은 **내성적 미세 조정(Introspection Fine-Tuning, IFT)**이라는 특별한 훈련 방법을 만들었습니다. 그들은 10억 규모의 작은 모델에게 자신이 자극을 받고 자극을 찾아내는 과정을 담은 수천 개의 예시를 보여주었습니다. 이것은 마치 학생에게 정답이 옆에 놓인 연습 문제를 주는 것과 같았습니다. 이 훈련 후에, 작은 모델의 성능은 급격히 치솟았습니다. 정답률이 9.6%에서 60.6%로 뛰었습니다! 이는 6배나 향상된 수치입니다. 더욱 놀라운 것은, 이 새로운 기술이 단지 "어떤 문장인가요?" 게임에만 국한되지 않았다는 점입니다. 이 모델은 한 번도 연습하지 않은 "더 강한 자극" 게임에서도 훨씬 더 잘하게 되었습니다.

연구진은 또한 이 훈련이 일반적인 지식 질문에 답하는 것과 같은 다른 능력들을 "멍청하게" 만드는지 확인했습니다. 결과는 그렇지 않았습니다. AI는 자신의 원래 업무를 똑똑하게 수행하면서도, 자기 모니터링이라는 새로운 초능력을 얻었습니다. 이 논문은 자신의 뇌 내부를 들여다보는 능력이 단순히 큰 모델들이 타고나는 것이 아니라, 가장 작은 모델들에게도 가르칠 수 있는 기술임을 시사합니다. 이는 우리가 AI가 자신의 내부 작동 방식을 정직하게 말하도록 훈련할 수 있는 희망적인 길을 열어주며, 이를 통해 AI를 모두가 더 안전하고 투명하게 사용할 수 있게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →