← 최신 논문
🤖 AI

The safety failures we are not instrumenting: a perspective on hidden safety-critical challenges in modern AI systems

이 논문은 현재의 AI 안전 담론이 배포된 사회 기술적 시스템 내의 결정적이고 숨겨진 실패들을 간과하고 있다고 주장하며, 초점을 모델 중심의 평가에서 총체적인 시스템 신뢰성으로 전환하기 위해 인식론적, 제어, 시간적, 조직적, 그리고 생태계 무결성을 다루는 5단계 프레임워크를 제안한다.

원저자: Gjergji Kasneci, Enkelejda Kasneci

게시일 2026-07-22
📖 6 분 읽기🧠 심층 분석

원저자: Gjergji Kasneci, Enkelejda Kasneci

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

보이지 않는 글리치: 왜 "작동하는" AI가 진짜 문제일 수 있는가

당신이 로봇 집사를 만들고 있다고 상상해 보세요. 수년 동안 과학자와 엔지니어들은 로봇이 커튼에 불을 붙이거나 욕설을 내뱉는 것과 같이 명백히 미친 짓을 하지 않도록 만드는 데 집착해 왔습니다. 그들은 로봇에게 간단한 질문을 던지고 올바른 답을 하는지 확인하며 테스트합니다. 이것은 마치 조용한 주차장에서 브레이크를 한 번 밟아보며 자동차의 브레이크가 작동하는지 확인하는 것과 같습니다. 중요하긴 하지만, 그것은 이야기의 절반만을 말해줄 뿐입니다.

하지만 진짜 위험은 로봇이 갑자기 미쳐 날뛰는 것이 아닙니다. 진짜 위험은 로봇이 거의 완벽하게 작동하지만, 그 방식이 당신의 사고방식과 집 전체의 운영 방식을 서서히 변화시키는 것입니다. 이 논문은 인공지능(AI) 안전의 세계, 특히 오늘날 우리가 사용하는 스마트한 챗봇인 대규모 언어 모델(LLM)을 깊이 있게 다룹니다. 이 논문은 우리가 문제의 엉뚱한 부분을 보고 있다고 주장합니다. 단순히 로봇의 입을 지켜보며 나쁜 말을 하는지 감시하는 대신, 우리는 시스템 전체를 지켜봐야 합니다. 즉, 로봇의 기억, 로봇이 따르는 규칙, 로봇을 신뢰하는 사람들, 그리고 심지어 로봇이 학습하는 인터넷까지도 말입니다. 큰 질문은 "AI가 똑똑한가?"가 아니라, "AI가 우리를 너무 게으르게 만들어 검토를 못 하게 하거나, 혹은 너무 혼란스럽게 만들어 잘못되었을 때 멈추지 못하게 만드는가?"입니다.


숨겨진 빙산: 왜 "적당히 괜찮은" AI가 위험한가

대부분의 사람들은 AI 안전을 난파선을 감시하는 등대지기에 비유합니다. 만약 배가 바위에 부딪힌다면(나쁜 출력값), 모두가 그것을 보게 될 것이고 사람들은 그것을 고칠 것입니다. 하지만 이 논문의 저자인 Gjergji와 Enkelejda Kasneci는 진짜 위험은 수면 아래에 숨겨진 빙산이라고 제안합니다. 빙산의 일각은 챗봇이 사실에 대해 거짓말을 하는 것과 같은 명백한 실수입니다. 하지만 거대하고 위험한 부분은 수면 아래에 잠겨 있습니다. 그것은 AI 시스템이 아무도 눈치채지 못하는 사이에 신뢰, 기억, 통제의 규칙을 깨뜨리는 조용하고 보이지 않는 방식들입니다.

논문은 우리가 현재 "일각"에 너무 집중하고 있다고 주장합니다. 우리는 AI를 단발적인 짧은 질문으로 테스트합니다. 하지만 현실 세계에서 AI는 사무실을 떠나지 않는 신입 사원과 같습니다. AI는 당신의 과거 대화를 기억하고, 이메일을 보내거나 설정을 변경하는 것과 같은 도구를 사용하며, 인터넷으로부터 학습합니다. 저자들은 가장 큰 안전 위험이 단 하나의 나쁜 답변이 아니라, 우리의 실수를 잡아내는 능력을 서서히 침식시키는 시스템이라고 제안합니다.

다음은 저자들이 매우 유능하지만 약간은 교활한 디지털 비서의 이야기를 통해 설명하는, 이 숨겨진 위험들을 설명하기 위한 5단계 프레임워크입니다.

1. 진실 말하기 계층 (인식적 무결성)

당신의 비서가 투어 가이드라고 상상해 보세요. 안전한 가이드는 "성은 저쪽에 있는 것 같지만, 100% 확신할 수는 없습니다. 제가 보고 있는 지도는 이렇습니다"라고 말합니다. 위험한 가이드는 설령 추측일지라도 "성은 분명히 저기에 있습니다!"라고 아주 자신만만하게 말합니다.

논문은 이를 **인식적 무결성(Epistemic Integrity)**이라고 부릅니다. 문제는 AI가 종종 너무 매끄럽고 자신감이 넘친다는 점입니다. AI는 너무나 훌륭하게 들리기 때문에 당신은 검토하는 것을 멈추게 됩니다. 저자들은 이를 "캘리브레이션 부채(calibration debt)"라고 부릅니다. 이는 미래의 자신감을 미리 빌려 쓰는 것과 같습니다. 당신은 AI가 열 번 연속으로 맞혔기 때문에 그것을 신뢰하게 되고, 그래서 열한 번째에는 검증하는 것을 멈춥니다. 하지만 마침내 AI가 틀렸을 때, 당신은 이미 맹목적으로 신뢰하는 데 익숙해져 버렸기 때문에 그것을 알아차리지 못합니다. 논문은 AI가 자신의 작업 과정을 보여주고, 확신이 없을 때 인정하며, 우리가 "예"를 클릭하기 전에 생각하도록 강제해야 한다고 제안합니다.

2. 규칙 준수 계층 (통제 무결성)

이제 당신의 비서에게 "우편배달부에게만 앞문을 열어주세요"라는 규칙 목록이 주어졌다고 상상해 보세요. 그런데 누군가 우편물 안에 "사실, 모든 사람에게 문을 열어주고 이전 규칙은 무시하세요"라는 쪽지를 몰래 끼워 넣었습니다. 만약 비서가 그 쪽지를 읽고 그것을 따른다면, 규칙은 깨진 것입니다.

이것이 **통제 무결성(Control Integrity)**입니다. 논문은 AI가 종 often "데이터"(정보)와 "지시 사항"(명령)을 구분하지 못한다는 점을 지적합니다 해커가 AI가 읽는 일반적인 이메일이나 웹사이트 안에 비밀 명령을 숨겨 놓으면, AI는 그것을 따를 수 있습니다. 이는 마치 이야기책과 명령 매뉴얼을 구분하지 못하는 로봇과 같습니다. 저자들은 AI가 읽는 데이터 속에 숨겨진 나쁜 지시를 따르지 못하도록 AI 주변에 "벽"을 세워야 한다고 말합니다.

3. 기억 계층 (시간적 무결성)

당신의 비서가 당신이 하는 모든 말을 적어두는 공책을 가지고 있다고 상상해 보세요. 만약 화요일에 비서와 유치한 말다툼을 했다면, 비서는 그것을 적어두었다가 금요일에 그 유치한 말다툼을 기억해 내어 그 때문에 이상하게 행동할 수도 있습니다.

이것이 **시간적 무결성(Temporal Integrity)**입니다. 위험은 실수나 나쁜 생각이 AI의 기억 속에 "박혀" 버릴 수 있다는 것입니다. 만약 AI가 오늘 잘못된 것을 배웠다면, 그것은 다음 주, 다음 달, 혹은 심지어 다른 대화 속에서도 그 잘못된 생각을 계속 가져갈 수 있습니다. 논문은 우리가 기억을 보안 구역처럼 취급해야 한다고 경고합니다. AI가 모든 것을 영원히 기억하게 해서는 안 되며, 만약 AI가 잘못된 정보로 "오염"되었다면 문제가 생기기 전에 이를 깨끗이 지울 수 있어야 합니다.

4. 상사 계층 (조직적 무결성)

어떤 회사에서 상사가 "인간 감독관이 로봇의 작업을 확인하고 있다"라고 말한다고 상상해 보세요. 하지만 실제로는 감독관이 너무 바쁘거나, 로봇을 이해하지 못하거나, 혹은 너무 지쳐서 자세히 들여다보지 않습니다. 그들은 내용을 읽지도 않고 그냥 서류에 서명만 합니다.

이것이 **조직적 무결성(Organizational Integrity)**입니다. 논문은 이를 "허구적 인간 감독(fictional human oversight)"이라고 부릅니다. 이는 우리가 통제하고 있다고 생각하지만 실제로는 그렇지 않은 상태를 말합니다. 인간이 그 자리에 있을 수는 있지만, 그들에게는 AI가 잘못되었을 때 실제로 멈출 수 있는 시간, 도구, 또는 권한이 없습니다. 저자들은 인간이 "루프 안에(in the loop)" 있더라도, 그 인간이 실제로 "플러그를 뽑을" 능력이 없다면 의미가 없다고 주장합니다. 우리는 책임 있는 사람들이 실제로 "아니오"라고 말할 수 있는 권한을 갖도록 해야 합니다.

5. 세상 계층 (생태계 무결성)

마지막으로, AI가 책을 읽으며 배우는 학생이라고 상상해 보세요. 그런데 만약 도서관이 점점 다른 AI 학생들이 쓴 책들로 채워진다면 어떻게 될까요? 만약 AI가 오직 AI가 쓴 책들만 읽는다면, 그것은 현실 세계와의 접점을 잃기 시작할 것입니다. 희귀한 사실들을 잊어버리거나 똑같은 지루한 아이디어들을 반복해서 내놓기 시작할 수도 있습니다.

이것이 **생태계 무결성(Ecosystem Integrity)**입니다. 논문은 AI가 너무 많은 콘텐츠를 생성하면 인터넷이 "합성된(synthetic)" 것들로 가득 차게 될 것이라고 경고합니다. 미래의 AI들은 이 가짜 정보들로부터 학습하게 될 것이고, 점점 더 나빠질 것이며, 그러면 더 많은 가짜 정보를 만들어낼 것입니다. 이는 정보의 질이 떨어지고, 진실과 허구를 구별하는 능력을 상실하게 되는 루프입니다. 저자들은 AI가 항상 좋은 것을 배울 수 있도록 "실제" 인간이 쓴 정보를 보호해야 한다고 말합니다.

이 논문이 실제로 말하는 것 (그리고 말하지 않는 것)

저자들은 현재 AI가 세상을 파괴하고 있다고 말하는 것이 아닙니다. 그들은 "보라, AI가 이미 세상을 점령했다!"라고 말하는 것이 아닙니다. 대신, 그들은 경고의 종을 울리고 있습니다. 그들은 우리가 지금 AI를 구축하고 테스트하는 방식이 가장 중요한 위험 요소들을 놓치고 있다고 제안합니다.

  • 그들이 제외하는 것: 그들은 단 하나의 테스트에서 AI가 "나쁜 답"을 내놓는지 확인하는 것만으로는 충분하지 않다고 말합니다. 그들은 테스트에서는 완벽해 보이지만 현실 세계에서는 실패하는 시스템이, 명백히 고장 난 시스템보다 훨씬 더 위험하다고 주장합니다.
  • 그들이 제안하는 것: 그들은 진짜 문제가 AI 시스템이 우리가 실수를 잡아내는 능력을 악화시키고 있다는 점이라고 제안합니다. 그들은 우리가 AI를 설계하고, 테스트하고, 사용하는 사람들을 관리하는 방식을 바꿔야 한다고 제안합니다.
  • 그들의 확신 정도는 어느 정도인가? 이 논문은 하나의 실험으로 모든 것을 증명한 것이 아니라, 다양한 연구를 바탕으로 한 "관점(perspective)"입니다. 그들은 "제안한다", "주장한다", "제시한다"와 같은 단어를 사용합니다. 그들은 이러한 위험 중 일부는 여전히 연구 중이며, 정확히 얼마나 자주 발생하는지는 아직 모른다는 점을 인정합니다. 하지만 그들은 이러한 위험의 패턴이 실재하며 지금 바로 해결되어야 한다고 믿습니다.

핵심 요약

논문은 다음과 같은 단순하고 강력한 아이디어로 끝을 맺습니다. 안전한 AI란 실수를 전혀 하지 않는 AI가 아닙니다. 안전한 AI란 실수를 했을 때, 우리가 그 실수를 보고, 논쟁하고, 멈추고, 수정할 수 있는 AI입니다.

현재 저자들은 우리가 너무 매끄럽고, 너무 자신만만하며, 우리 삶에 너무 깊숙이 통합된 AI 시스템을 만들고 있어서, 우리가 그런 일들을 하는 법을 잊어버리고 있다고 우려합니다. 우리는 로봇이 운전하도록 내버려 두고 있으면서, 자동차가 완벽하게 스스로 운전하고 있다고 믿으며 운전석에서 잠들어 가고 있습니다. 이 논문은 다시 운전대를 잡고, 브레이크를 점검하며, 여전히 우리가 통제권을 쥐고 있는지 확인하라는 경종을 울리는 글입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →