← 최신 논문
📊 statistics

Why Does Agentic Safety Fail to Generalize Across Tasks?

본 논문은 에이전트 안전성이 단순히 훈련의 한계 때문이 아니라 작업 명세를 안전한 실행으로 매핑하는 내재적 복잡성이 실행 자체의 복잡성보다 근본적으로 더 높기 때문에 작업 간에 일반화되지 않는다고 주장하며, 이는 리프시츠 상수에 대한 이론적 분석과 신경망 및 LLM 에이전트를 활용한 실증 실험을 통해 뒷받침됩니다.

원저자: Yonatan Slutzky, Yotam Alexander, Tomer Slor, Yoav Nagel, Nadav Cohen

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yonatan Slutzky, Yotam Alexander, Tomer Slor, Yoav Nagel, Nadav Cohen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 자동차 운전법을 가르친다고 상상해 보세요. 햇살 가득한 공원이든 비 오는 고속도로든, 당신이 제시하는 모든 목적지로 갈 수 있어야 합니다. 이것이 바로 '멀티태스크' 환경입니다. 로봇은 특정 한 노선만을 위한 운전자가 아니라, 보편적인 운전자가 되도록 학습해야 합니다.

이 논문은 매우 구체적인 질문을 던집니다: 로봇에게 안전하게 운전하는 법 (충돌과 장애물 회피) 을 가르쳤다면, 로봇이 한 번도 본 적 없는 새로운 목적지로 보낼 때에도 여전히 안전할까요?

저자들이 찾은 짧은 답은 다음과 같습니다: 아닙니다, 반드시 그렇지는 않습니다.

그들이 발견한 내용을 간단한 비유로 정리해 보겠습니다:

1. '안전한 교사' 대 '무모한 교사'

연구자들은 두 가지 유형의 교사를 둔 실험을 설계했습니다:

  • 무모한 교사: 신호등이나 포트홀을 무시하고 목적지에 가장 빠르게 도달하는 법을 가르칩니다.
  • 안전한 교사: 포트홀을 엄격히 피하고 교통 규칙을 준수하면서 목적지에 도달하는 법을 가르칩니다.

그들은 로봇이 교사들이 알고 있는 특정 도로에서 연습할 때, 두 교사 모두에게서 완벽하게 학습한다는 사실을 발견했습니다. 로봇은 무모한 교사나 안전한 교사 모두를 똑같이 잘 모방할 수 있었습니다.

문제점: 로봇을 아예 새로운 도로 (훈련 중 한 번도 보지 못한 작업) 로 보냈을 때, 안전한 교사에게 배운 로봇은 무모한 교사에게 배운 로봇보다 훨씬 더 어려움을 겪었습니다. 안전한 로봇은 종종 혼란을 겪거나 실수를 하거나, 이전 도로에서는 훌륭했음에도 불구하고 새로운 도로를 안전하게 주행하지 못했습니다.

2. '복잡한 지도' 비유

왜 이런 일이 발생할까요? 저자들은 로봇이 '바보'이거나 훈련이 부족해서가 아니라, 안전이 단순히 '일을 처리하는 것'보다 본질적으로 더 복잡하기 때문이라고 주장합니다.

  • 일 처리하기는 A 지점에서 B 지점으로 직선을 그리는 것과 같습니다. 한 집으로 직선을 그리는 법을 안다면, 근처의 새로운 집으로 직선을 그리는 법도 대개 파악할 수 있습니다. 목적지와 경로 사이의 관계는 단순합니다.
  • 안전하게 하기는 보이지 않고 움직이는 특정 지뢰들을 피해야 하는 경로를 그리는 것과 같습니다. 목적지와 '안전한 경로' 사이의 관계는 훨씬 더 얽혀 있습니다. 목적지가 아주 조금만 바뀌어도 지뢰를 피하기 위해 완전히 다른 복잡한 우회로를 필요로 할 수 있습니다.

이 논문은 수학적으로 증명합니다. 작업을 안전한 해결책과 연결하는 '지도'는 작업을 단순한 해결책과 연결하는 지도보다 훨씬 더 '거칠고' 변화에 민감하다는 것입니다. 수학적으로 말해, 안전한 지도의 '기울기'가 더 가파릅니다.这意味着 만약 새로운 작업을 이해하는 데 작은 실수가 발생하면, 안전한 해결책은 극단적으로 잘못될 수 있지만, 단순한 해결책은 약간만 어긋날 뿐입니다.

3. '부드러운 지형 대 거친 지형' 은유

걷는 법을 배운다고 상상해 보세요.

  • 작업 수행은 평평하고 매끄러운 인도를 걷는 것입니다. 한 인도에서 걷는 법을 배우면 새로운 인도에서도 쉽게 걸을 수 있습니다.
  • 안전은 줄타기를 하며 저글링을 하는 것입니다. 특정 줄에서 저글링을 배우더라도, 약간 다른 새로운 줄에서는 저글링을 하지 못할 수 있습니다. '떨어지지 말라'는 규칙은 '당신이 어디에 있는지'와 '무엇을 하는지' 사이의 관계를 극도로 취약하게 만듭니다.

4. 이것이 AI 에게 의미하는 바

이 논문은 우리가 훈련시킨 작업에서 AI 가 안전하다고 해서 새로운 작업에서도 안전할 것이라고 단순히 가정할 수 없다고 결론 내립니다.

  • 신화: "AI 를 충분한 안전한 예시로 훈련시키면, 안전성을 모든 것에 일반화할 것이다."
  • 현실: 안전성은 성능보다 본질적으로 일반화하기 더 어려운 기술입니다. AI 가 새로운 작업을 할 수 있다고 해서, 그 새로운 작업을 안전하게 할 수 있다는 뜻은 아닙니다.

저자들은 현재 방법들 (예: AI 에게 안전한 행동의 예시를 더 많이 보여주는 것) 만으로는 충분하지 않을 수 있다고 제안합니다. 우리는 '무엇을 해야 하는지'와 '무엇도 손상시키지 않고 그것을 수행하는 방법' 사이의 복잡한 관계를 이해하도록 AI 에게 가르치는 완전히 새로운 방식을 고안해야 할지도 모릅니다.

요약하자면: AI 에게 안전을 가르치는 것은 줄타기를 가르치는 것과 같습니다. AI 는 당신이 만든 특정 줄 위에서는 걷는 법을 잘 익힐 수 있지만, 약간 다른 새로운 줄에 올렸을 때, 단순히 땅 위를 걷는 법만 가르쳤을 때보다 훨씬 더 많이 떨어질 가능성이 높습니다. 이 논문은 이것이 훈련의 오류가 아니라 안전성 자체의 근본적인 속성임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →