Open Technical Problems in Open-Weight AI Model Risk Management
이 논문은 오픈 웨이트 AI 모델의 생애주기 전반—학습에서 생태계 모니터링에 이르기까지—에 걸친 16가지의 개방형 기술적 과제를 식별하며, 위험 관리의 엄격한 과학을 발전시키기 위해서는 모델 가중치뿐만 아니라 연구 방법론과 평가에서도 투명성이 필요하다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계를 거대하고 북적이는 도서관이라고 상상해 보십시오. 오랫동안 이 도서관에서 가장 강력한 책들은 몇몇 거대 기업들에 의해 유리 케이스 안에 갇혀 잠겨 있었습니다. 당신은 그 책들을 읽을 수는 있었지만, 집으로 가져갈 수는 없었으며, 페이지를 찢거나 장(chapter)을 새로 쓸 수도 없었습니다. 이것들이 바로 "폐쇄형 가중치(closed-weight)" 모델입니다. 하지만 최근에 새로운 트렌드가 폭발적으로 등장했습니다: 바로 "오픈 웨이트(open-weight)" 모델입니다. 이것들은 도서관의 가장 강력한 책들을 누구나 다운로드하여 집으로 가져가 영원히 소장할 수 있는 디지털 복사본과 같습니다. 더 멋진 점은 무엇일까요? 당신은 그것들을 복사하거나, 서로 붙이거나, 심지어 새로운 기능을 수행하도록 텍스트를 새로 쓸 수도 있다는 것입니다. 이는 놀라운 도구를 만들고자 하는 연구자들과 발명가들에게 매우 흥분되는 일입니다.
하지만 함정이 있습니다. 모두에게 책의 복사본을 주고 내용을 수정하게 허용하면, 통제력을 잃게 됩니다. 만약 누군가 자신의 버전의 책에 위험한 이야기를 쓴다면, 그가 그것을 전 세계에 공유하는 것을 막을 방법이 없습니다. 잠겨 있는 책들과 달리, 위험한 버전이 퍼졌을 때 사서에게 전화하여 그 버전을 다시 회수해 달라고 요청할 수 없습니다. 일단 세상에 나오면, 끝입니다. 대학과 안전 기구의 수많은 전문가들로 구성된 이 논문은 결정적인 질문을 던집니다: 누구나 책을 바꿀 수 있는 상황에서, 어떻게 이 열린 도서관을 안전하게 유지할 것인가? 그들은 도서관을 다시 잠그려는 것이 아닙니다. 대신, 책이 수정되는 중에도 안전하게 유지될 수 있는 새로운 종류의 "마법 잉크"와 "보안 요원"을 발명하려고 합니다. 그들은 AI가 모두에게 개방적이면서도, 무기로 변질되는 것에 저항할 수 있을 만큼 강력하게 구축되는 방법을 알아내고자 합니다.
거대한 문제: 멈출 수 없는 복사기
저자들은 오픈 웨이트 AI 모델이 점점 더 강력해지고 있으며, 때로는 대기업들이 비밀리에 유지하는 초비밀 모델보다 불과 6~12개월 뒤처지는 수준에 불과하다고 설명합니다. 문제는 폐쇄형 모델은 이상하게 작동하기 시작할 때 패치를 하거나 회수할 수 있지만, 오픈 모델은 디지털 바이러스와 같다는 점입니다. 일단 누군가 다운로드하면, 그것은 영원히 수정되고 공유되며 퍼져나갈 수 있습니다.
폐쇄형 모델을 스마트폰 앱이라고 생각해 보십시오. 만약 앱에 해커가 당신의 사진을 훔칠 수 있는 버그가 있다면, 회사는 이를 수정하기 위해 업데이트를 배포하거나 앱을 스토어에서 삭제할 수 있습니다. 하지만 오픈 웨이트 모델은 케이크 레시피와 같습니다. 만약 레시피에서 위험한 재료를 발견했다면, 이미 레시피를 가진 사람들이 케이크를 굽는 것을 막을 수 없습니다. 훨씬 더 나쁜 것은, 누군가 그 레시피를 가져가서 "독"이 되는 재료(예: 사람을 해치라는 숨겨진 지시 사항)를 추가하고, 그 새로운 위험한 레시피를 수백만 명에게 공유할 수 있다는 점입니다. 원래의 제빵사는 이를 막을 방법이 없습니다.
이 논문은 필터처럼 나쁜 단어를 차단하는 현재의 안전 도구들이 오픈 모델에는 무용지물이라고 강조합니다. 왜 그럴까요? 만약 당신이 레시피(모델의 코드)를 가지고 있다면, 필터를 그냥 지워버릴 수 있기 때문입니다. 이것은 마치 주방 카운터에 "먹지 마시오"라는 표지판을 두어 누군가가 케이크를 굽는 것을 막으려는 것과 같습니다. 만약 그들이 주방 전체를 가지고 있다면, 그 표지판을 그냥 무시하면 그만입니다.
16가지 과제: 와일드 웨스트를 위한 툴킷
이 논문은 단순히 문제점을 지적하는 데 그치지 않고, 과학자들이 오픈 AI를 안전하게 만들기 위해 해결해야 할 16가지 구체적인 기술적 과제를 제시합니다. 저자들은 이를 AI 모델을 만드는 공장의 서로 다른 스테이션처럼 다섯 가지 주요 범주로 분류했습니다.
1. 재료 (학습 데이터 큐레이션)
AI가 학습하기 전, AI는 수백만 권의 책을 읽는 학생처럼 방대한 양의 데이터를 섭취합니다. 첫 번째 과제는 다음과 같습니다: 어떻게 하면 학생이 나쁜 책을 절대 읽지 않도록 보장할 것인가?
저자들은 만약 AI가 학습을 시작하기 전에 위험한 정보(폭탄 제조법이나 불법 이미지를 만드는 법 등)를 걸러낸다면, AI가 애초에 그런 나쁜 기술을 배우지 못할 수도 있다고 제안합니다. 이는 아이에게 나쁘게 행동한 후에 착하게 행동하라고 가르치는 것이 아니라, 친절함에 관한 책만 주어 아이를 친절하게 가르치는 것과 같습니다. 그러나 논문은 이것이 까다로운 일이라고 언급합니다. 때때로 특정 주제를 제거하는 것이 의도치 않게 AI의 다른 능력을 떨어뜨릴 수 있으며, 혹은 AI가 무해해 보이는 단서로부터 여전히 나쁜 것들을 알아낼 수도 있기 때문입니다.
2. 깨지지 않는 갑옷 (변조 방지 학습)
설령 우리가 안전한 AI로 시작한다 하더라도, 누군가 나중에 그것을 '파인 튜닝(fine-tuning)'하여 나쁜 기술을 가르치려 들 수 있습니다. 두 번째 과제는 다음과 같습니다: 누군가 강제로 시키더라도 나쁜 기술을 배우기를 거부하는 AI를 어떻게 만들 것인가?
강아지에게 물라고 가르치려 하는데, 그 강아지가 너무 잘 훈련되어 있어서 물리적으로 그 명령을 배울 수 없는 상황을 상상해 보십시오. 논문은 현재의 방법들이 취약하다고 말합니다. 만약 누군가 안전한 AI를 위험하게 재학습시키려 한다면, 보통 단 몇 백 단계 만에 그것을 해낼 수 있습니다. 저자들은 AI가 "면역"을 갖게 하여, 누군가 해킹을 시도하더라도 AI가 안전하게 유지되도록 하는 방법을 찾고자 합니다. 또한 "언러닝(unlearning, 망각)"—AI가 배웠을지도 모르는 특정 나쁜 것들을 잊게 만드는 방법—을 탐구하지만, 현재의 방식은 쉽게 되돌려질 수 있습니다.
3. 스트레스 테스트 (모델 변조 평가)
새로운 AI를 출시하기 전에 우리는 테스트를 해야 합니다. 세 번째 과제는 다음과 같습니다: 해킹을 시도하는 사람에 의해 AI가 파괴될 수 있는지 어떻게 테스트할 것인가?
현재 대부분의 테스트는 AI에게 일반적인 질문을 던지는 수준입니다. 저자들은 "레드 팀(red teams)"—AI를 모든 가능한 방식으로 조작하여 깨뜨리는 것이 임무인 해커 그룹—을 고용해야 한다고 말합니다. 그들은 도움이 되는 AI를 해로운 AI로 바꾸는 데 얼마나 많은 단계가 필요한지, 비용은 얼마나 드는지 알고 싶어 합니다. 논문은 아직 이에 대한 좋은 테스트가 없다고 지적합니다. 우리는 모델을 출시하기 전에 문제를 해결할 수 있도록, 이 모델들을 깨뜨리는 것이 정확히 얼마나 쉬운지 알아야 합니다.
4. 단계적 배포 (Staged Deployment)
새로운 AI를 한꺼번에 세상에 던지는 대신, 네 번째 과제는 다음과 같습니다: 무슨 일이 일어나는지 관찰하면서 단계적으로 공개할 수 있는가?
새로운 비디오 게임을 상상해 보십시오. 개발자들은 모든 사람이 즉시 플레이하게 하는 대신, 먼저 소수의 테스터들이 플레이하게 합니다. 만약 버그를 발견하면, 전 세계에 공개하기 전에 수정합니다. 저자들은 AI에 대해서도 이 방식을 제안합니다. 신뢰할 수 있는 소수의 연구자들에게 먼저 모델을 사용하게 하여 그들이 어떻게 사용하는지 관찰한 뒤, 안전하다는 확신이 들 때 비로소 모두에게 공개할 수 있습니다. 또한, AI의 일부는 당신의 컴퓨터에서 실행되고 일부는 보안 서버에서 실행되도록 하여 전체를 훔치기 어렵게 만드는 "분할 배포(split deployment)"와 같은 기술적 트릭도 살펴봅니다.
5. 탐정 업무 (모델 출처 및 포렌식)
마지막으로, AI가 세상에 나온 후, 다섯 번째 과제는 다음과 같습니다: 특정 AI가 어디에서 왔으며 어떤 변화가 가해졌는지 어떻게 알 수 있는가?
만약 인터넷에서 위험한 AI 모델을 발견했다면, 누가 그것을 만들었는지 어떻게 알 수 있을까요? 저자들은 모델의 코드 속에 심어진 보이지 않는 디지털 지문인 "워터마크(watermarks)"를 사용하는 것을 제안합니다. 만약 누군가 모델을 변경하려 해도, 그 지문은 여전히 남아 있어야 하며, 적어도 모델의 가계도를 추적하여 누가 수정했는지 알아낼 수 있어야 합니다. 이는 연구자들이 위험한 모델이 어떻게 퍼지고 있는지, 그리고 누가 책임이 있는지를 추적하는 데 도움이 됩니다.
논문이 발견한 것 (그리고 발견하지 못한 것)
저자들은 2025년에 출시된 가장 인기 있는 상위 10개 오픈 AI 모델의 기술 보고서와 몇몇 유명한 이미지 및 비디오 생성기를 살펴보았습니다. 그들은 우려스러운 격차를 발견했습니다.
- 데이터 정제: 대부분의 기업은 데이터 정제(학습 전 나쁜 것을 제거하는 것)에 대해 조금 언급했습니다. 어떤 곳은 한 단락을, 어떤 곳은 한 섹션을 통째로 할애했지만, 많은 곳이 별로 언급하지 않았습니다.
- 누락된 조각들: 거의 아무도 모델을 변조에 저항하도록 만드는 것에 대해 이야기하지 않았습니다. 상위 모델 중 "언러닝" 알고리즘이나 "변조 방지" 학습을 언급한 모델은 단 하나도 없었습니다. 오직 하나의 모델(gpt-oss)만이 모델을 깨뜨리는 데 얼마나 어려운지를 테스트하는 전용 논문을 가지고 있었습니다.
- 침묵: 가장 큰 모델들의 보고서에서 "단계적 배포"나 "출처(provenance, 모델의 이력 추적)"에 대한 언급은 거의 없었습니다.
이 논문은 이러한 침묵이 세 가지 중 하나를 의미한다고 제안합니다: 이 기술들이 아직 사용되지 않고 있거나, 사용되고 있지만 언급되지 않았거나, 혹은 단순히 아직 충분히 효과적이지 않다는 것입니다. 저자들은 단순히 모델을 출시하는 것을 넘어, 어떻게 하면 안전하게 유지할 것인지에 대한 엄격한 과학을 구축해야 한다고 주장합니다.
결론
이 논문은 행동 촉구(call to action)입니다. 이 논문은 오픈 AI가 놀랍고 엄청난 혜택을 가져다주지만, 현재 우리는 악의적인 행위자들로부터 안전하게 지키는 데 있어 눈을 가린 채 비행하고 있다고 말합니다. 우리는 단지 기업들이 착하기를 바라는 것만으로는 부족합니다. 우리는 AI 자체가 깨지기 어렵도록 만드는 새로운 수학적 도구들을 발명해야 합니다.
저자들은 희망적이면서도 현실적입니다. 그들은 문제를 해결했다고 주장하는 것이 아닙니다. 대신, 그들은 우리가 어디에 구멍이 났는지 정확히 보여줌으로써 영역을 지도화했습니다. 그들은 안전한 AI의 미래가 개방성에 달려 있다고 제안합니다. 이는 단순히 코드를 공유하는 것뿐만 아니라, 연구, 방법론, 그리고 실패 사례까지 공유하는 것을 의미합니다. 우리가 함께 새로운 방어 체계를 구축하기 위해 협력할 수 있다면, 우리는 이 도서관을 열려 있으면서도 안전하게 유지할 수 있을 것입니다. 하지만 그렇지 못한다면, 이러한 모델의 위험한 버전들은 우리가 막을 수 있는 속도보다 더 빠르게 퍼져나갈 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.