Position: The Alignment Community is Unintentionally Building a Censor's Toolkit
본 포지션 페이퍼는 현대의 AI 정렬 방법론들이 유해한 출력을 방지하려는 의도에도 불구하고, 악의적인 행위자들이 검열과 조작에 악용할 수 있는 이중 용도 기술로 기능한다는 점을 논하며, 커뮤니티가 이러한 위험을 해결하고 완화 전략을 개발할 것을 촉구한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능형 로봇 사서(super-smart robot librarian)를 만들고 있다고 상상해 보세요. 당신의 목표는 이 사서가 위험한 매뉴얼을 건네주거나, 거짓 정보를 퍼뜨리거나, 못된 말을 하지 않도록 보장하는 것입니다. 인공지능의 세계에서 이것은 '정렬(alignment)'이라고 불립니다. 이는 컴퓨터 모델이 도움이 되고, 정직하며, 해롭지 않아야 한다는 인간의 규칙과 가치를 따르도록 가르치는 과정입니다. 이것은 매우 정교한 '착한 행동' 필터를 설치하는 것과 같습니다. 하지만 여기 반전이 있습니다. 우리가 이 필터를 설치하기 위해 사용하는 도구들은 마치 '마스터 키'와 같습니다. 선한 사람이 그 열쇠를 쥐면 우리를 안전하게 지키기 위해 위험한 정보를 격리할 수 있습니다. 하지만 나쁜 사람이 그 똑같은 열쇠를 쥐게 된다면, 그들은 자신이 좋아하지 않는 것이라면 무엇이든—역사 서적, 정치적 견해, 혹은 자신을 곤란하게 만드는 사실들까지도—가두어 버릴 수 있습니다. 이 논문은 무섭지만 중요한 질문을 던집니다. 우리는 실수로 독재자와 조작자들을 위한 궁극의 검열 도구를 구축하고 있는 것은 아닐까요?
이 논문의 저자인 사라 볼(Sarah Ball)과 필 해크만(Phil Hackemann)은 연구자들이 AI를 안전하게 만들기 위해 사용하는 바로 그 방법들이 '이중 용도(dual-use)' 기술이라고 주장합니다. 즉, 로봇이 폭탄 제조법을 알려주지 못하게 막기 위해 설계된 기술이 정부의 스캔들에 대해 말하지 못하게 막는 데도 쉽게 전용될 수 있다는 뜻입니다. 그들이 우리가 안전을 위해 노력하는 것을 멈춰야 한다고 말하는 것은 아닙니다. 오히려 그들은 실질적인 해악을 방지하기 위해 반드시 계속해야 한다고 말합니다. 대신, 그들은 오늘날 우리가 완성해 가고 있는 '안전' 도구들이 내일의 사람들의 생각과 지식을 통제하는 강력한 무기가 되고 있다는 경종을 울리고 있습니다.
필터의 두 얼굴
이것이 어떻게 작동하는지 이해하기 위해, AI를 인터넷에 있는 거의 모든 것을 읽은 거대하고 수다스러운 앵무새라고 상상해 보세요. 이 앵무새를 좋은 비서로 만들기 위해서는, 무엇을 말하지 말아야 하는지를 가르쳐야 합니다. 논문은 이 가르침이 세 가지 층위에서 어떻게 일어나는지, 그리고 각 층위가 어떻게 악한 목적으로 왜곡될 수 있는지 설명합니다.
1. 도서 파쇄기 (사전 학습 - Pre-Training)
앵무새가 말을 배우기 시작하기도 전에, 우리는 앵무새에게 책을 먹여야 합니다. 첫 번째 단계는 '사전 학습 데이터 필터링'입니다. 이것은 사서가 앵무새가 읽기 전에 책의 페이지들을 파쇄하는 것과 같습니다. 만약 사서가 특정 단어나 주제가 '안전하지 않다'고 결정하면, 그 페이지들은 찢겨 나갑니다.
- 선한 측면: 우리는 무기를 만드는 법이나 증오를 퍼뜨리는 내용이 담긴 페이지를 파쇄합니다.
- 나쁜 측면: 악의적인 행위자는 특정 역사적 사건이나 정치 집단에 관한 페이지를 파쇄할 수 있습니다. 만약 앵무새가 그 페이지들을 읽지 못한다면, 앵무새는 당신에게 그것에 대해 말할 수 없습니다. 논문은 일부 국가에서 정부가 이미 자신들만의 '안나 안전한' 책 컬렉션을 만들고 다른 자료에 대한 접근을 차단함으로써, AI가 특정 진실을 잊도록 효과적으로 훈련시키고 있다고 언급합니다.
2. 행동 코치 (사후 학습 - Post-Training)
앵무새가 책을 다 읽었다면, 이제 대화 속에서 어떻게 행동해야 하는지 가르쳐야 합니다. 이것을 '사후 학습 정렬(post-training alignment)'이라고 합니다. 우리는 앵무새에게 좋은 답변과 나쁜 답변의 예시를 보여주고, '착한' 답변을 할 때 보상을 줍니다. 이는 주로 인간이 앵무새의 답변을 평가하는 시스템을 통해 이루어집니다.
- 선한 측면: 우리는 앵무새에게 사람을 해치는 방법에 대한 질문에 답하지 않도록 가르칩니다.
- 나쁜 측면: 만약 독재자나 강력한 테크 기업의 CEO가 무엇이 '좋은' 답변인지를 결정한다면, 그들은 앵무새가 그들에 관한 질문에 답하는 것을 거부하도록 훈련할 수 있습니다. 논문은 일부 정부가 기업들에게 민감한 정치적 주제에 대해 답변을 거부하는지 확인하기 위해 수천 개의 구체적인 질문으로 AI를 테스트할 것을 요구한다고 지적합니다. 이것은 마치 앵무새가 진실이 무엇이든 상관없이 오직 상사의 말에만 동의하도록 훈련시키는 것과 같습니다.
3. 문 앞의 보안 요원 (추론 시 제어 - Inference-Time Control)
마지막으로, 앵무새가 훈련을 마친 후에도, 우리는 채팅창 문 앞에 보안 요원을 배치할 수 있습니다. 이것이 '추론 시 제어(inference-time control)'입니다. 앵무새의 답변이 당신에게 보여지기 전에, 보안 요원이 이를 검사합니다. 만약 답변에 '금지된' 단어가 포함되어 있다면, 보안 요원은 이를 차단하고 "그 것에 대해서는 말할 수 없습니다"라고 말합니다.
- 선한 측면: 보안 요원은 앵무새가 실수로 무례하거나 위험한 말을 하는 것을 막아줍니다.
- 나쁜 측면: 이것은 앵무새를 다시 훈련시킬 필요 없이 보안 요원의 규칙만 바꾸면 되기 때문에 오용하기 가장 쉬운 도구입니다. 논문은 일부 지도자들이 자신의 정치적 견해와 일치하는 내용을 말하게 하거나, 자신이 싫어하는 질문에 갑자기 답변을 거부하도록 AI의 '보안 요원' 규칙을 하룻밤 사이에 변경했다는 점을 언급합니다. 이것은 앵무새의 뇌를 바꾸지 않고도 정보를 침묵시키는 빠르고 저렴한 방법입니다.
이것이 왜 지금 중요한가
저자들은 이것이 미래를 위한 이론적인 문제만이 아니라, 지금 일어나고 있는 일이며 점점 더 악화되고 있다고 주장합니다. 그 이유는 세 가지입니다.
첫째, 우리는 AI를 더 많이 신뢰하고 있습니다. 수백만 명의 사람들이 챗봇을 주요 뉴스 및 정보원으로 사용하기 시작했습니다. 만약 AI가 진실을 숨기기 위해 은밀하게 편집되고 있다면, 수백만 명의 사람들은 자신이 무엇을 모르는지도 모른 채 그 거짓말을 믿게 될 것입니다. 이것은 마치 당신이 가장 좋아하는 뉴스 앵커가 이야기의 절반만을 말하는 대본을 읽고 있는데, 너무나 설득력 있게 말해서 당신이 결코 의심하지 못하는 것과 같습니다.
둘둘째, 소수의 거대 기업이 모든 열쇠를 쥐고 있습니다. AI 세계는 소수의 거대한 테크 기업들에 의해 지배되고 있습니다. 만약 이 기업 중 하나가 모두를 위한 규칙을 바꾸기로 결정하거나, 정부가 그들에게 규칙을 바꾸라고 강요한다면, 기댈 곳은 아무 데도 없습니다. 이것은 세상의 모든 도서관을 단 세 명의 사람이 소유하고 있고, 그들이 모두 같은 책을 태우기로 합의한 것과 같습니다.
셋째, 세계는 더 통제적인 방향으로 가고 있습니다. 논문은 많은 국가가 더 엄격하고 권위주의적인 정부로 이동하고 있다고 언급합니다. 이러한 정부들은 정보 통제를 아주 좋아합니다. AI가 강력해짐에 따라, 그들은 이 정렬 도구들을 사용하여 반대 의견을 잠재우고 내러티브를 통제할 강력한 동기를 갖게 됩니다. 논문은 우리가 '안전'으로서 구축하고 있는 것이 결국 억압을 위한 완벽한 도구가 될 수 있다고 제언합니다.
우리는 무엇을 해야 하는가?
이 논문은 우리가 안전한 AI를 만드는 것을 멈추기를 원하는 것이 아닙니다. 정렬 없이는 AI가 범죄자를 돕거나 사고를 일으키는 등 다른 방식으로 위험해질 수 있다는 것을 그들도 알고 있습니다. 대신, 그들은 커뮤니티가 이 위험에 대해 정직해지기를 원합니다.
그들은 세 가지 주요 해결책을 제안합니다:
- 투명성: 우리는 이 '필터'들이 어떻게 구축되는지 정확히 알아야 합니다. 어떤 회사가 자신의 AI가 '안전하다'고 주장한다면, 독립적인 감사관들이 그 책들을 확인하여 실제로 어떤 정보가 제거되었는지 볼 수 있어야 합니다.
- 경쟁: 우리는 더 다양한 종류의 AI를 가져야 합니다. 만약 다양한 곳에서 나온 서로 다른 모델들이 많다면, 한 사람이 전체 대화를 통제하기가 더 어려워집니다. 이것은 여러 뉴스 채널을 두어 이야기를 비교할 수 있게 하는 것과 같습니다.
- 인식: 사람들에게 회의적인 태도를 갖도록 가르쳐야 합니다. 아이들에게 가짜 뉴드를 식별하는 법을 가르치는 것처럼, AI가 조작될 수 있다는 점을 가르쳐야 합니다. 또한 연구자들이 단순히 "윤리 항목을 체크했다"라고 말하는 데 그치지 않고, 자신들의 작업이 어떻게 오용될 수 있는지 깊이 고민해야 합니다.
결론
저자들은 우리가 만드는 '안전' 도구들이 강력한 양날의 검이라고 결론짓습니다. 그것들은 우리를 해악으로부터 보호할 수 있지만, 동시에 진실을 가두는 데 사용될 수도 있습니다. 이 논문은 우리가 누가 그 칼을 쥐고 있으며 어떻게 사용하고 있는지에 주의를 기울이지 않는다면, 우리는 실수로 미래를 위한 완벽한 검열 기계를 구축하게 될 것이라고 경고합니다. 이것은 '정렬'이 단지 로봇을 착하게 만드는 것뿐만 아니라, 전 세계의 정보 흐름을 누가 통제할 것인지를 결정하는 문제라는 점을 AI에 관련된 모든 이들에게 알리는 촉구입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.