Repeated-Game Security for Restaking-Based Verifiable Inference
이 논문은 리스테이킹 기반의 검증 가능한 추론에서 흔히 가정되는 1회성 인센티브 호환성이 비례적 슬래싱이 시간이 흐름에 따라 합리적인 불이행을 저지하는 데 실패하는 반복 게임 격차로 인해 불충분함을 입증하며, 매 쿼리마다의 암호학적 검증을 요구하지 않고도 장기적 보안성을 회복하기 위해 이력 의존적 챌린지와 평판 가중 슬래싱을 결합한 배포 가능한 메커니즘을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 똑똑한 컴퓨터 뇌(대규모 언어 모델, LLM)가 당신의 질문에 답하고, 이야기를 쓰고, 수학 문제를 풀어주는 세상을 상상해 보세요. 하지만 여기에는 함정이 있습니다. 이 뇌를 실행하는 데는 비용이 많이 들고 속도도 느립니다. 그래서 기업들은 이들을 대신해 생각을 수행할 독립적인 작업자들을 고용하고 싶어 합니다. 문제는, 작업자가 단순히 답을 찍은 것인지, 아니면 돈을 아끼기 위해 더 저렴하고 멍청한 뇌를 사용한 것인지 어떻게 알 수 있느냐는 것입니다. 이것이 바로 **검증 가능한 추론(verifiable inference)**의 세계입니다.
이를 해결하기 위해 우리는 **리스테이킹(restaking)**이라는 시스템을 사용합니다. 이것은 보안 보증금과 같다고 생각하면 됩니다. 작업자는 정직하게 일을 하겠다는 약속으로 디지털 현금 뭉치(스테이크)를 내놓습니다. 만약 그들이 규칙을 어기면, 심판이 그들의 작업을 검사하고, 적발될 경우 심판은 그들의 보증금 중 일부를 가져갑니다. 이를 **슬래싱(slashing, 몰수)**이라고 합니다. 오랫동안 전문가들은 이것이 완벽한 안전망이라고 믿었습니다. 만약 규칙을 어겼을 때의 벌금이 규칙을 어겨서 얻는 이득보다 크다면, 아무도 규칙을 어기려 하지 않을 것이라고 믿었기 때문입니다. 그것은 단순한 "일회성" 거래였습니다. 쿠키를 훔치지 마라, 안 그러면 단지를 잃게 될 것이다.
하지만 만약 작업자가 단 한 번의 일만 하는 것이 아니라면 어떨까요? 만약 그들이 수백만 번의 일을 반복해서 계속 수행해야 한다면요? 여기서 이야기는 까다로워집니다. 여러분이 읽게 될 이 논문은 아주 멋진 질문을 던집니다: "일회성" 안전망이 게임을 반복해서 수행할 때도 정말 작동할까요? 저자인 홍콩 과학기술대학교의 상전항(Zhenhang Shang), 유잉저(Yingzhe Yu), 카니 첸(Kani Chen)은 기존의 안전망에 숨겨진 구멍이 있다는 것을 발견했습니다. 그들은 만약 작업자가 아주 조금만 규칙을 어긴다면, 처음에는 벌금이 무서워 보일지라도 실제로 교묘하게 빠져나갈 수 있다는 것을 발견했습니다. 왜냐하면 적발될 때마다 벌금이 그들의 보증금 중 '일부'만을 가져가기 때문입니다. 따라서 그들의 보증금은 점점 작아지고, 결과적으로 미래의 벌금도 점점 약해지는 반면, 그들은 매번 새로운 작업에서 규칙을 어겨 얻은 이득을 계속 챙기게 됩니다. 이는 마치 도둑이 금을 조금씩 훔치는데, 경비사가 잡을 때마다 남은 금의 아주 작은 조각만을 가져가서, 결국 도둑의 "위험"이 거의 사라져 손을 쓸 수 없게 만드는 것과 같습니다.
거대한 발견: "상습범"의 루프홀(Loophole)
저자들은 기존의 규칙—"규칙을 어기면 얻는 이득보다 벌금이 크므로 어기지 마라"—이 단 한 번의 결정에만 유효하다는 것을 깨달았습니다. 하지만 현실 세계에서 이러한 AI 제공업체들은 장기적으로 활동하며 수천, 수만 개의 질문에 답하게 됩니다. 이 논문은 이를 작업자와 프로토콜이 매 라운드마다 게임을 플레이하는 **반복 게임(repeated game)**으로 모델링합니다.
그들은 "반복 게임의 격차(repeated-game gap)"를 발견했습니다. 여기에서 탈취자가 사용하는 마술 같은 수법은 다음과 같습니다:
- 설정: 제공업체가 큰 스테이크를 예치합니다.
- 이탈: 그들은 질문에 답할 때 더 저렴하고 빠른 모델을 사용하여 매 쿼리마다 비용을 절감합니다.
- 실수: 가끔 심판(프로토콜)이 그들을 잡아냅니다.
- 루프홀: 프로토콜은 스테이크의 일정 비율(예: 20%)만을 몰수합니다. 제공업체는 돈을 잃지만, 여전히 80%를 보유하고 있습니다.
- 순환: 스테이크가 작아졌기 때문에, 다음에 또 적발되었을 때의 벌금은 이전보다 훨씬 더 작아집니다(작아진 금액의 20%). 하지만 다음 질문에서 규칙을 어겨 아낀 돈은 이전과 똑같습니다!
이 논문은 이것이 위험한 불균형을 만든다는 것을 수학적으로 증명합니다. 절감되는 비용은 일정하지만, 벌금은 적발될 때마다 줄어듭니다. 저자들은 EigenAI, VeriLLM, Sertn AVS와 같은 기존 시스템 중 다수가 이 "일회성" 안전 테스트는 통과할지언정, "장기적" 테스트에서는 실패한다는 것을 보여주었습니다. 시뮬레이션 결과, 합리적인 탈취자는 시스템이 안전하다고 생각하는 와중에도 이 반복 게임의 루프홀을 이용해 **1.5%에서 8%**의 추가 이익을 얻을 수 있었습니다.
해결책: 더 똑똑하고 이력을 기억하는 시스템
그렇다면 적발될 때마다 약해지는 시스템을 어떻게 고칠 수 있을까요? 저자들은 기억력을 가진 똑똑한 심판처럼 행동하는 새로운 메커니즘을 제안합니다. 단순히 작업자가 남은 돈을 얼마나 가지고 있는지만 보는 것이 아니라, 새로운 시스템은 그들의 **이력(history)**을 살핍니다.
그들은 이 구멍을 메우기 위해 세 가지 영리한 도구를 도입했습니다:
- 의심 점수 (The "Watchful Eye"): 시스템은 모든 작업자에 대한 점수를 기록합니다. 만약 그들이 이상하게 행동한다면(예: 너무 빨리 답하거나 약간 다른 답을 내놓는 경우), 의심 점수가 올라갑니다. 점수가 높을수록 심판은 그들의 작업을 더 면밀히 검사합니다. 즉, 규칙을 어기면 단순히 벌금을 받는 것에 그치지 않고, 다음번에 더 엄격하게 감시받게 됩니다.
- 평판 가중 벌금 (The "Scarlet Letter"): 벌금은 단순히 남은 돈의 일정 비율을 가져가는 것이 아니라, 작업자의 평판에 따라 달라집니다. 만약 나쁜 이력이 있다면, 보증금이 적더라도 벌금은 훨씬 더 가혹해집니다. 이는 "줄어드는 벌금" 수법을 차단합니다.
- 베스팅 (The "Leash"): 작업자가 게임을 떠나려고 할 때(돈을 인출할 때), 시스템은 즉시 돈을 빼가도록 두지 않습니다. 그들의 돈은 일정 기간 "잠겨(lock-up)" 있습니다. 만약 그들이 규칙을 어기고 도망치려 해도, 시스템은 이 잠금 기간 동안 그들을 잡아내어 돈을 몰수할 수 있습니다. 이는 "어기고 도망가는" 전략을 막습니다.
이것이 실제로 작동할까?
저자들은 단순히 이론만 제시한 것이 아니라, 이를 테스트하기 위해 시뮬레이터를 구축했습니다. 그들은 지속적으로 규칙을 어기는 자, 남의 눈을 피해 어기는 자, 그리고 어기고 도망치려는 자 등 다양한 유형의 "탈취자"들을 대상으로 새로운 시스템을 기존 시스템들과 맞붙게 했습니다.
결과는 유망했습니다. 시뮬레이션에서 기존 시스템들은 탈취자들이 추가 이익을 챙기도록 방치했습니다. 하지만 이력을 고려하는 규칙을 가진 새로운 시스템은 탈취자들의 이익을 **31%에서 54%**까지 줄였습니다. 어떤 경우에는 탈취자의 이익을 손실로 바꾸어, 규칙을 어기는 것이 오히려 손해가 되도록 만들었습니다.
또한 그들은 규칙 위반이 얼마나 "탐지 가능한지"도 테스트했습니다. 그들은 실제 AI 모델들(0.5B 파라미터의 작은 모델부터 14B 파라미터의 거대한 모델까지)을 사용하여, 진짜 답변과 저렴한 가짜 답변 사이의 차이를 시스템이 포착할 수 있는지 확인했습니다. 그 결과, 특히 저렴한 모델과 좋은 모델 사이의 비용 차이가 클 때 시스템의 "의심 측정기"가 매우 잘 작동한다는 것을 발견했습니다. 탈취자가 돈을 아끼려고 더 많이 노력할수록, 그들을 잡기는 더 쉬워졌습니다.
이것이 중요한 이유
이 논문은 블록체인과 AI 보안 세계에 던지는 경종입니다. 보안 규칙이 한 순간에는 작동할지 몰라도, 평생 동안 작동한다는 보장은 없다는 것을 보여줍니다. 저자들은 단순히 문제점을 지적하는 데 그치지 않고, 반복적인 상호작용을 처리할 수 있는 시스템의 청사진을 만들었습니다.
그들은 벌금이 작업자의 과거 행동에 따라 달라지게 하고, 떠나려는 이들에게 "목줄(leash)"을 채움으로써, 게임이 영원히 계속되더라도 시스템이 안전하게 유지될 수 있음을 증명했습니다. 이는 보안을 단 한 번의 "보석금"으로 생각하는 것에서, 신뢰가 시간의 흐름에 따라 쌓이고 잃어지는 "장기적인 관계"로 생각하는 방식으로의 전환입니다. 블록체인 기반의 AI 미래를 건설하려는 모든 이들에게, 이는 작업자들이 실제로 약속한 일을 수행하고 있는지 확인하기 위한 필수적인 단계입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.