← 최신 논문
💻 computer science

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

이 논문은 AI 시스템의 "배포 후 공개 격차(post-deployment disclosure gap)"를 조사하여, 제공업체들이 안전 문서를 게시함에도 불구하고 배포된 모델이 보고된 버전과 일치하는지 외부에서 검증할 수 있는 메커니즘이 부족하다는 점을 밝히고, 투명성과 책임성을 강제하기 위해 저자들이 "사일런트 업데이트 스코어카드(Silent Updates Scorecard)"와 "3단계 행동 트리거 시스템(Three-Part Behavioral Trigger System)"을 제안하도록 유도하고 있다.

원저자: Sophia Abraham, Ben Bucknall

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sophia Abraham, Ben Bucknall

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마법 같은 거대한 뷔페에 있다고 상상해 보세요. 그곳의 요리사들은 아주 똑똑한 로봇들입니다. 당신은 "GPT-5 버거"라는 특정 요리를 주문합니다. 메뉴에는 그 안에 무엇이 들어있는지, 얼마나 안전하게 먹을 수 있는지, 그리고 유명한 음식 평론가의 리뷰를 바탕으로 한 맛이 어떤지가 정확히 적혀 있습니다. 당신은 메뉴를 믿기에 안심하고 있습니다. 하지만 반전이 있습니다. 요리사들이 당신이 여전히 버거를 먹고 있는 동안에도, 당신에게 알리지 않고, 접시 위의 이름을 바꾸지도 않고, 메뉴를 업데이트하지도 않은 채 몰래 패티를 바꾸거나 비밀 소스를 변경하거나, 심지어 번(빵) 전체를 완전히 다른 것으로 교체할 수 있다는 것입니다. AI의 세계에서 이것은 "파운데이션 모델(foundation models)"과 함께 일어나는 현상입니다. 이들은 챗봇과 도구들을 구동하는 거대한 AI 두뇌들입니다. 여기서 핵심 개념은 "관리 연속성(chain of custody)"인데, 이는 당신이 먹고 있는 버거가 평론가가 맛보았던 바로 그 버거임을 증명하는 영수증과 같습니다. 또 다른 개념인 "사일런트 업데이트(silent updates, 무음 업데이트)"는 요리사들이 행하는 이러한 비밀스러운 교체를 의미합니다. 사람들이 이를 중요하게 여기는 이유는, 메뉴에는 버거가 안전하다고 적혀 있는데 요리사가 몰래 매운 독을 넣었다면, 그 리뷰는 쓸모없게 되고 당신은 병이 들 수도 있기 때문입니다. 우리는 우리가 사용하고 있는 것이 실제로 테스트를 거친 바로 그 대상인지 알아야 합니다.

이제 연구자 소피아 아브라함(Sophia Abraham)과 벤 버크널(Ben Bucknall)이 한 일을 살펴봅시다. 그들은 식당을 점검하는 대신 AI 기업 9곳과 이 AI 도구들을 호스팅하는 곳 7곳을 점검하는 식품 검사관 역할을 했습니다. 그들은 기업들이 자신들의 비밀 재료 교체에 대해 얼마나 정직한지 확인하기 위해 "사일런트 업데이트 스코어카드(Silent Updates Scorecard)"라는 특별한 체크리스트를 만들었습니다. 그들은 오늘날 당신이 대화하고 있는 AI가 그들의 안전 보고서에서 테스트된 것과 정확히 일치하는지 보여주는 증거를 찾았습니다.

결과는 마치 뷔페에 "유령 주방(ghost kitchen)"이 있다는 것을 발견한 것과 같았습니다. 연구자들은 요리사들(AI 기업들)이 상세한 메뉴와 안전 보고서(안전 문서 및 평가 결과물 발표)를 작성하는 데는 매우 능숙하지만, 접시 위에 놓인 음식이 메뉴와 일치한다는 것을 증명하는 데는 형편없다는 것을 발견했습니다. 실제로 그들이 조사한 9개의 주요 AI 제공업체 중, 현재 서비스 중인 특정 AI 모델이 자신들의 안전 보고서에 기술된 것과 정확히 동일하다는 것을 외부인이 검증할 수 있는 방법을 제공한 곳은 단 한 곳도 없었습니다(0개). 이는 마치 요리사가 "이것은 메뉴에 있는 그 버거라고 믿으세요"라고 말하면서도, 주방을 확인하거나 영수증을 보여주는 것은 거부하는 것과 같습니다.

논문은 이 현상이 AI 시스템이 정적이지 않고 배경에서 끊임없이 변화하기 때문에 발생한다고 제안합니다. 연구자들은 이 "사일런트 업데이트" 게임이 벌어지는 네 가지 주요 방식을 식별했습니다:

  1. 변신하는 이름: 기업들은 "GPT-5"나 "Claude"와 같이 안정적인 이름을 사용하지만, 이 이름들은 시간이 지나면서 서로 다른 버거에 달라붙는 마법의 라벨과 같습니다. 어느 날의 "GPT-5"는 소고기 패티일 수 있지만, 다음 달에는 채소 패티로 바뀔 수 있는데 이름은 그대로 유지됩니다.
  2. 누락된 기록부: 기업들은 새로운 버거를 출시할 때는 공지를 잘 하지만, 이미 메뉴에 올라와 있는 기존 버거의 재료를 몰래 변경할 때는 거의 기록을 남기지 않습니다.
  3. 두 얼굴: 때때로 웹사이트에서 받는 버거(챗봇)는 컴퓨터 프로그램(API)을 통해 받는 버거와 다를 수 있으며, 기업은 이 둘이 다르다는 사실을 알려주지 않습니다.
  4. 연결되지 않은 영수증: 안전 보고서는 특정하고 변하지 않는 버전보다는 하나의 "패밀리(예: 'GPT-5 패밀리')"에 대해 이야기하는 경우가 많습니다. 이는 안전 보고서가 작년의 버거에 대한 것일 수 있지만, 당신은 오늘날의 버거를 먹고 있다는 것을 의미합니다.

연구자들은 또한 일부 기업들이 계약 조항을 통해 사람들이 음식을 확인하는 것을 실제로 막고 있다는 것을 발견했습니다. 예를 들어, 조사 대상인 9개 기업 중 6곳은 AI가 메뉴와 다르게 행동하는지 확인하기 위해 당신이 직접 테스트를 수행하는 것을 금지하는 조항을 가지고 있습니다. 이는 마치 레스토랑이 "메뉴를 읽을 수는 있지만, 음식이 메뉴와 일치하는지 맛을 보려 한다면 우리는 당신을 쫓아낼 것이다"라고 말하는 것과 같습니다.

이를 해결하기 위해 저자들은 "3단계 행동 트리거 시스템(Three-Part Behavioral Trigger System)"이라는 새로운 시스템을 제안합니다. 이것은 새로운 주방 규칙 세트라고 생각하면 됩니다. 요리사가 레시피를 바꿨다고 인정하기를 기다리는 대신, 다음과 같은 규칙을 적용합니다:

  • 만약 AI가 다르게 행동하기 시작한다면(예를 들어, 예전에 답할 수 있었던 질문에 답하기를 거부하는 경우), 이는 "드리프트 트리거(Drift Trigger)"이며, 그들은 메뉴를 업데이트해야 합니다.
  • 만약 그들이 기계의 특정 부분(예를 들어, 소스 분사기나 그릴)을 변경한다면, 이는 "컴포넌트 트리거(Component Trigger)"이며, 즉시 기록을 남겨야 합니다.
  • 만약 AI가 갑자기 훨씬 더 똑똑해지거나 훨씬 더 위험해진다면, 이는 "역량 트리거(Capability Trigger)"이며, 전체를 다시 테스트해야 합니다.

그들은 또한 "세이프 하버(safe harbor, 세이프 하버)" 규칙을 제안하는데, 이는 "만약 당신이 공익을 위해 버거의 안전성을 확인하려는 음식 평론가라면, 레스토랑은 당신을 고소하거나 쫓아낼 수 없다"는 법과 같은 규칙입니다.

이 논문은 이 기업들이 거짓말을 하고 있다거나 현재 AI가 위험하다고 주장하는 것이 아닙니다. 대신, 현재의 시스템은 안전 보고서와 당신이 실제로 사용하는 AI 사이의 연결 고리를 증명할 방법이 없기 때문에 망가져 있다고 제안합니다. 저자들은 공개된 정보를 통해 이를 측정했으며, 서류는 존재하지만 "관리 연속성"이 끊어져 있다는 것을 발견했습니다. 저자들은 우리가 사용하는 AI가 테스트받은 것과 동일한 것인지 검증할 수 없을 때까지, 우리는 눈을 가린 채 식사를 하고 있는 것이라고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →