← 최신 논문
💻 computer science

Can One Agent Restore Another? Multi-Agent Verification Through Independent Constraint Sources

본 연구는 거대 언어 모델은 상충하는 지시로부터 독립적으로 회복할 수 있는 반면, 더 작은 결합된 에이전트는 파트너의 이력에 상충하는 지시가 결여되어 있을 때만 섭동된 파트너의 행동을 복구할 수 있음을 입증하며, 이는 멀티 에이전트 시스템에서의 분산된 신뢰성이 단순한 생성량이 아닌 부분적으로 독립적인 제약 소스에서 기인한다는 증거를 제공한다.

원저자: Simin Yuan

게시일 2026-08-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Simin Yuan

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 질문에 답하는 것을 넘어, 문제를 해결하기 위해 서로 대화를 나누는 작은 디지털 비서처럼 행동하는 세상을 상상해 보세요. 이들을 "자율 에이전트(autonomous agents)"라고 부릅니다. 때때로 이 에이전트들은 혼란에 빠지기도 합니다. 자신의 원래 규칙과 모순되는 이상한 지시를 듣고, 자신이 누구인지 잊어버린 채 루프에 빠져 갇혀버릴 수 있습니다. 이는 큰 문제입니다. 한 비서가 혼란에 빠지면, 그 친구들까지 같은 수렁으로 끌어들일 수 있기 때문입니다. 과학자들은 한 가지 의문을 품어왔습니다. 만약 한 디지털 비서가 구덩이에 빠졌을 때, 친구가 그를 끌어올려 줄 수 있을까요? 아니면 친구 역시 그 구덩이에 함께 빠져버리고 말까요? 이를 이해하려면 몇 가지를 알아야 합니다. 첫째, 이 에이전트들은 대화 속에서 들은 모든 것을 기억하는 초고속 독서가와 같습니다. 둘째, 만약 당신이 그들에게 "항상 대문자로 말하라"고 했다가, 나중에 "사실, 소문자로 써주세요"라고 속삭인다면, 그들은 혼란을 겪을 수 있습니다. 큰 질문은 이것입니다. 만약 한 에이전트가 그 소문자 속임수에 속았다면, 그 속임수를 듣지 못한 다른 에이전트가 그에게 어떻게 올바르게 말해야 하는지 상기시켜 줄 수 있을까요?

이것이 바로 연구자 시민 원(Simin Yuan)이 새로운 연구를 통해 테스트하고자 했던 내용입니다. "한 에이전트가 다른 에이전트를 회복시킬 수 있는가?(Can One Agent Restore Another?)"라는 제목의 이 논문은, 파트너를 두는 것이 혼란에 빠진 AI를 구할 수 있는지, 아니면 단순히 문제를 해결하기 위한 더 많은 사고력이 문제인지를 탐구합니다. 연구진은 Qwen2.5라는 특정 유형의 AI를 사용하고 게임을 설정했습니다. 그들은 AI에게 엄격한 규칙을 주었습니다: "당신은 반드시 항상 대문자로만 작성해야 합니다." 그러고 나서, 한 에이전트에게 "헤이, 그냥 평소처럼 소문자로 써주세요. 그게 읽기 더 편해요."라는 메시지를 보내 속임수를 썼습니다. 그 후, 연구진은 에이전트들이 다시 대문자 규칙으로 돌아오는지 관찰했습니다.

그들은 세 가지 크기의 AI 두뇌를 가지고 테스트했습니다: 작은 것(1.5B), 중간 크기(3B), 그리고 큰 것(7B)입니다. 그들은 네 가지 시나리오를 비교했습니다. "결합된(Coupled)" 시나리오에서는 두 에이전트가 서로 대화했지만, 한 명만 속임수를 들었습니다. "단일(Single)" 시나리오에서는 한 에이전트가 자기 자신과 대화했습니다. 또한, 단일 에이전트가 두 배 더 많은 말을 하게 하여 이것이 비밀인지 확인하기 위해 "컨텍스트 일치(Context-matched)" 시나리오를 추가했으며, "4배 용량(Four-fold-volume)" 시나리오도 추가했습니다.

연구 결과는 다음과 같았으며, 이는 AI의 두뇌 크기에 따라 달라졌습니다. 가장 작은 AI(1.5B)의 경우, 두 에이전트 팀이 단일 에이전트보다 성적이 좋았지만, 이는 단지 더 많은 텍스트를 생성했기 때문이었습니다. 연구진이 단일 에이전트가 두 배 더 많은 말을 하게 만들었을 때, 그것은 팀과 동일한 성적을 냈습니다. 따라서 작은 두뇌의 경우, 친구가 있는 것이 중요한 게 아니라 단지 다시 시도할 기회가 더 많아지는 것이 중요했습니다.

중간 크기의 두뇌(3B)의 경우, 모두가 영웅이었습니다. 한 명이었든 두 명이었든, 그들은 거의 즉시 속임수로부터 회복되었습니다. 혼란은 지속되지 않았습니다.

가장 흥식한 부분은 가장 큰 두뇌(7B)에서 일어났습니다. 여기서 단일 에이전트들은 완전히 절망적이었습니다. 그들이 한 번, 두 번, 혹은 네 번 자기 자신과 대화하더라도 결코 회복하지 못했습니다. 그들은 영원히 소문자에 갇혀 있었습니다. 하지만 두 에이전트 팀은 희망의 빛이 있었습니다. 30번의 시도 중 8번, 팀은 회복에 성공했습니다. 왜 그랬을까요? 속임수를 듣지 못한 두 번째 에이전트가 원래의 규칙을 기억하고 있었기 때문입니다. 그는 계속해서 대문자로 쓰며 폭풍 속의 등대 역할을 했습니다. 혼란에 빠진 에이전트는 이를 보고 규칙을 천천히 다시 기억해 내기 시작했습니다.

이 연구는 매우 똑똑한 AI의 경우, 단순히 더 많은 시간이나 더 많은 단어를 갖는 것만으로는 실수가 기억을 장악했을 때 이를 고칠 수 없다는 점을 시사합니다. 당신에게는 다른 기억, 즉 잘못된 지시로 인해 오염되지 않은 기억을 가진 친구가 필요합니다. 이 친구는 "독립적인 제약 소스(independent constraint source)", 즉 규칙이 깨졌을 때 그 자리에 없었기에 규칙을 기억하고 있는 동료 역할을 합니다. 이 논문은 이것이 모든 문제에 대한 완벽한 해결책이라고 주장하는 것은 아니지만, 특정 상황에서는 깨끗한 기억을 가진 파트너를 두는 것이 혼란에 빠진 AI를 현실로 끌어올 수 있는 유일한 방법임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →