COCORELI: Enforcing Execution Preconditions for Reliable Collaborative Instruction Following
본 논문은 누락된 정보의 탐지와 행동의 예방을 구조적으로 결합하여 실행 신뢰성을 확보하는 모듈식 아키텍처인 COCORELI 를 소개하며, 이를 통해 자율 에이전트가 표적화된 명확화가 이루어질 때까지 미구현 사항이 해결될 때까지는 작업을 실행하지 못하도록 차단한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
친구와 함께 복잡한 레고 성을 짓고 있다고 상상해 보세요. 당신은 건축가이고, 친구는 시공자입니다. 당신은 "파란 벽돌 위에 빨간 벽돌을 올려놓아"와 같은 지시를 내립니다.
실제 세계에서는 친구가 어떤 빨간 벽돌을 의미하는지, 혹은 "위에"가 정확히 어디를 뜻하는지 알고 있다고 가정할 수 있습니다. 하지만 AI 에이전트의 디지털 세계에서는 모든 세부 사항을 명시하지 않으면, AI 는 종종 누락된 부분을 추측하려 합니다. 잘못된 벽돌을 선택하거나 잘못된 위치에 놓을 수 있으며, 자신의 추측에 매우 확신하기 때문에 비뚤어진 탑을 짓게 됩니다. 일단 실수가 발생하면 수정하기 어렵습니다.
이 논문은 이러한 문제를 해결하기 위해 COCORELI(Cooperative, Reconstitution & Execution of Language Instructions, 협력적 언어 지시 재구성 및 실행) 라는 새로운 시스템을 소개합니다.
핵심 문제: "추측"의 함정
현재 AI 시스템은 지나치게 열성적인 인턴과 같습니다. "회의를 예약해 달라"고 요청하고 누구를 초대할지 말하지 않으면, 그들은 단순히 이름을 만들어내거나 목록에서 무작위 인물을 선택할 수 있습니다. 정보가 부족하다는 것을 감지하지만 멈추지 않고, 빈칸을 추측으로 채운 후 진행합니다. 이로 인해 "환각"(사실 없는 내용 생성) 과 위험한 행동이 발생합니다.
저자들은 정보의 누락을 감지하는 것만으로는 부족하다고 주장합니다. 누락된 정보가 발견될 때까지 행동을 물리적으로 차단하는 시스템이 필요합니다.
해결책: "안전 잠금" 비유
COCORELI 를 엄격한 안전 잠금이 있는 건설 현장이라고 생각해 보세요.
- 설계도 (구조화된 표현): COCORELI 는 당신의 말을 단순히 읽는 대신, 엄격한 디지털 설계도 (JSON 파일) 로 변환합니다. 설계도의 모든 부분에는 색상, 위치, 유형과 같은 슬롯이 할당되어 있습니다.
- 누락된 슬롯: "벽돌을 놓아라"라고 말하면, 설계도의 "색상" 슬롯은 비어 있습니다.
- 안전 잠금: COCORELI 에서 기계는 "어떤 슬롯이 비어 있으면 기계는 이동할 수 없다"는 안전 잠금을 가지고 있습니다. 이는 문자 그대로 짓는 것을 거부합니다.
- 명확화: 추측하는 대신 시스템은 즉시 멈추고 "벽돌의 색상은 무엇이어야 합니까?"라고 묻습니다.
- 해제: 당신이 답하고 슬롯이 채워진 후에야 안전 잠금이 해제되어 행동이 실행됩니다.
실제 작동 방식
이 논문은 실수가 영구적인 통제된 3D 빌딩 게임 (ENVIRONMENT) 에서 이를 테스트했습니다. 블록을 잘못된 위치에 놓으면 구조물이 무너지며 되돌릴 수 없습니다.
그들은 COCORELI 를 다른 인기 있는 AI 방법론들과 비교했습니다.
- Chain-of-Thought (CoT): 열심히 생각하지만 확신이 없으면 여전히 답을 추측하는 똑똑한 학생과 같습니다.
- Agentic Frameworks: 서로 대화하지만 충분한 정보가 있다고 생각하면 여전히 진행하는 작업자 팀과 같습니다.
- COCORELI: 모든 세부 사항이 확인될 때까지 단 한 개의 벽돌도 놓지 않는 엄격한 현장 감독과 같습니다.
결과:
- 지시가 완벽했을 때는 모든 시스템이 잘 수행했습니다.
- 지시에 세부 사항이 누락되었을 때 (미세정확하지 않았을 때), 다른 시스템들은 추측을 계속하며 잘못된 구조물을 지었습니다.
- COCORELI는 추측하지 않았습니다. 멈추고 명확화를 요청한 후 정확한 올바른 구조물을 지었습니다. 이러한 테스트에서 "환각"된 행동을 완전히 제거했습니다.
"복사 - 붙여넣기" 슈퍼파워 (추상화)
이 논문은 COCORELI 가 패턴을 학습하여 재사용할 수 있음을 보여줍니다.
- 상황: 62 개의 조각을 사용하여 복잡한 "해골" 모양을 만듭니다.
- 요청: 나중에 "다른 해골을 만들어 주되, 파란색으로 하고 저기에 놓아 달라"고 말합니다.
- 결과: COCORELI 는 62 단계를 다시 나열할 필요가 없습니다. 해골의 구조(설계도) 를 기억하고 색상과 위치만 교체합니다. 다른 시스템들은 모든 단계를 다시 나열하지 않고 복잡한 패턴을 기억하는 데 어려움을 겪었습니다.
결론
이 논문은 AI 가 인간과 함께 일할 때 진정한 신뢰성을 갖추려면 AI 를 더 "똑똑하게" 만들거나 추측을 잘하도록 하는 것만으로는 부족하다고 주장합니다. AI 가 불완전한 정보로 행동하는 것이 불가능하도록 아키텍처(시스템 설계) 를 변경해야 합니다.
COCORELI 는 누락된 정보를 "추측하라는 힌트"가 아닌 "정지 신호"로 취급함으로써 안전하고 신뢰할 수 있으며 진정한 협력을 이루는 에이전트를 구축할 수 있음을 증명합니다. 이는 AI 가 더 똑똑해지는 것이 아니라 시스템이 더 엄격해지는 것에 관한 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.