← 최신 논문
🤖 AI

Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework

이 논문은 다중 소스 지식 검증과 동적 GNN 기반 신뢰도 점수 산출을 활용하여 문서의 출처를 안전하게 검증하고, 비독립 동일 분포(non-IID) 데이터 환경에서도 도메인 지식의 무결성을 유지하면서 지식 오염 공격을 방지하는 비잔틴 결함 허용 협업 RAG 프레임워크인 SecureCollaRAG를 소개한다.

원저자: Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇 사서에게 진실을 묻고 있다고 상상해 보세요. 이 로봇은 거대 언어 모델(LLM)로 알려져 있는데, 세상에 쓰인 거의 모든 것을 읽었지만 때때로 이야기를 지어내거나 최근의 사건들을 잊어버리기도 합니다. 이를 해결하기 위해 우리는 RAG(검색 증강 생성)라는 시스템을 만들었습니다. RAG를 질문에 답하기 직전, 로봇에게 도서관에서 가져온 신선하고 관련성 높은 책 몇 권을 건네주는 것이라고 생각해보세요. 그러면 로봇은 추측하는 대신 사실을 인용할 수 있습니다. 하지만 여기 함정이 있습니다. 만약 교활한 악당이 도서관에 몰래 잠입하여 그 책들의 몇몇 페이지를 거짓말로 바꿔치기한다면 어떻게 될까요? 만약 로봇이 그 가짜 페이지들을 믿게 된다면, 달은 치즈로 만들어졌거나 위험한 약이 안전하다는 식의 말을 하게 될 것입니다. 이것을 "지식 오염(knowledge corruption)" 공격이라고 부릅습니다. 이제 당신이 읽게 될 논문은 이 무서운 문제를 다룹니다. 즉, 로봇이 여러 곳의, 때로는 의심스러운 도서관들로부터 책을 가져올 때, 어떻게 하면 우리가 거짓말쟁이들의 말을 믿지 않도록 막을 수 있을지에 대해 질문을 던집니다.

이 논문의 저자인 왕자오치(Zhaoqi Wang)와 그의 팀은 **SecureCollaR

RAG**라는 이름의 영리하고 새로운 방패를 제안합니다. 그들은 만약 당신이 같은 사실에 대해 다섯 개의 서로 다른 도서관에 물어봤을 때, 네 곳은 "하늘은 파랗다"라고 말하고 한 곳이 "하늘은 초록색이다"라고 말한다면, 아마도 다수의 의견을 믿어야 한다는 점을 깨달았습니다. 하지만 항상 그렇게 간단한 것만은 아닙니다. 때때로 거짓말쟁이는 매우 잘 숨어서 가짜 페이지를 진짜 페이지와 거의 똑같이 보이게 만들거나, 아주 작고 미묘한 세부 사항에 대해서만 거짓말을 할 수도 있기 때문입니다.

이를 해결하기 위해 팀은 슈퍼 조직적인 탐정단처럼 행동하는 시스템을 구축했습니다. 그들의 시스템은 단순히 책을 읽는 대신, 책들이 서로 어떻게 연관되어 있는지를 살펴봅니다. 문서들을 파티에 모인 사람들이라고 상상해 보세요. 시스템은 비슷한 주제에 대해 이야기하고 있는 사람들 사이에 보이지 않는 선을 긋습니다. 만약 거짓말쟁이 집단이 가짜 이야기를 퍼뜨리려 한다면, 그들은 모두 서로에게 똑같은 헛소리를 속삭이며 파티의 나머지 사람들과는 잘 어울리지 않는 기묘하고 끈끈한 파벌을 형성할 것입니다. 시스템은 "그래프 신경망(Graph Neural Network)"이라는 특별한 종류의 수학(일종의 매우 똑똑한 패턴 인식기라고 생각하세요)을 사용하여 이러한 의심스러운 파벌을 포착합니다. 시스템은 모든 문서에 "신뢰도 점수", 즉 일종의 신뢰 등급을 부여합니다. 만약 어떤 문서의 등급이 너무 낮으면, 그 문서는 로봇 사서가 보기 전에 쫓겨나게 됩니다.

연구진은 단순히 이것을 만든 것에 그치지 않고, 매우 까다로운 악당들을 상대로 테스트했습니다. 그들은 심지어 "적응형 변조 공격(Adaptive Tampering Attack, ATA)"이라는 새로운 유형의 공격까지 만들어냈습니다. 이것은 악당이 단순히 가짜 페이지를 붙여넣는 것이 아니라, 로봇의 두뇌를 이용해 매우 자연스럽게 들리면서도 매번 조금씩 변하여 잡기 어렵게 만드는 거짓말을 써 내려가는 것과 같습니다. 이러한 교활한 기술에도 불구하고, SecureCollaRAG는 가짜를 찾아낼 수 있음을 보여주었습니다. 테스트 결과, 기존 방식들은 악당들이 성공할 확률을 거의 80%까지 허용했지만, 이 새로운 시스템은 공격자의 성공률을 많은 경우에서 한 자릿수(예를 들어 5% 이하)로 낮추었습니다.

이 논문은 우리가 이 "비잔틴 내결함성(Byzantine-tolerant)" 접근 방식(일부 조력자가 배신자일지라도 이를 처리할 수 있다는 뜻의 멋진 용어입니다)을 사용함으로써, 신뢰할 수 없는 다양한 출처로부터 정보를 가져올 때도 AI 시스템을 안전하게 유지할 수 있다고 제안합니다. 이는 단순히 신분증을 확인하는 것을 넘어 사람들이 어떻게 상호작용하는지를 관찰하여, 설령 방 안에 몇 명의 스파이가 있더라도 여전히 진실이 승리하도록 만드는 보안 요원을 두는 것과 같습니다. 저자들은 악당들의 수가 전체 출처의 절반보다 적은 한, 그들의 시스템이 거짓을 걸러내고 로봇을 정직하게 유지할 수 있다는 것을 수학적으로 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →