← 최신 논문
🤖 machine learning

Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models

본 논문은 일반 능력을 유지하면서 공리주의나 의무론과 같은 특정 윤리 체계로 방향을 설정함으로써 대규모 언어 모델의 도덕적 추론에 대한 세밀하고 해석 가능한 제어를 달성하기 위해 수렴-발산 라우팅과 이중 로그이트 보정을 결합한 방법을 소개한다.

원저자: Chenchen Yuan, Zheyu Zhang, Gjergji Kasneci

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenchen Yuan, Zheyu Zhang, Gjergji Kasneci

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대형 언어 모델 (LLM) 을 거대하고 붐비는 기차역으로 상상해 보세요. 이 역 안에는 수천 개의 열차 (데이터 경로) 가 끊임없이 움직이며 AI 가 다음에 무엇을 말할지 결정하기 위해 정보를 운반합니다. 보통 이 열차들은 복잡하게 합쳐지거나 분리되는데, AI 의 '도덕적 나침반'은 그저 과거에 읽었던 다양한 의견들이 흐릿하게 섞인 결과일 뿐입니다.

때로는 AI 가 엄격한 규칙 준수자 (의무론) 처럼 행동하기를 원하고, 다른 때는 '최대 다수의 최대 행복'을 계산하는 사람 (공리주의) 처럼 행동하기를 원합니다. 문제는 AI 의 사고방식을 바꾸기 위한 기존 방법들이 확성기로 지시를 외치거나 거대하고 둔한 레버로 기차역 전체를 조종하려는 것과 같다는 점입니다. 이는 부정확하며, 종종 다른 것들을 망가뜨리고, AI 가 정확히 얼마나 지시를 따르는지 알 수 없습니다.

이 논문은 **수렴 - 발산 라우팅 (Convergent-Divergent Routing, CDR)**이라고 불리는 AI 의 도덕적 추론을 조종하는 새로운 외과적 방법을 소개합니다. 작동 원리는 다음과 같이 간단한 단계로 나뉩니다.

1. '분기점 (Switching Points)' 찾기

연구자들은 AI 의 뇌 내부에 '규칙 준수자' 열차 선로와 '계산기' 열차 선로가 잠시 나란히 달렸다가 갈라지는 특정 지점이 있음을 발견했습니다.

  • 비유: 뉴욕으로 가는 차와 보스턴으로 가는 차가 잠시 같은 차선을 공유하다가, 특정 진출입로에서 길이 갈라지는 고속도로를 상상해 보세요.
  • 혁신: 연구자들은 전체 고속도로를 조종하는 대신, AI 의 계층 내부에 있는 정확한 분기점들을 찾아냈습니다. 이들은 이를 '분기점 (branch points)'이라고 부릅니다.

2. '문지기' 전략 (이진 제어)

분기점을 찾은 후, 그들은 간단한 문을 설치했습니다.

  • 비유: AI 가 '규칙 준수자'가 되기를 원한다면, 분기점에서 '계산기' 도로로 가는 문을 닫습니다. '규칙 준수자' 열차는 계속 진행하지만, '계산기' 열차는 해당 선로 구간으로 진입하는 것이 차단됩니다.
  • 결과: 이 자체로 놀라울 정도로 효과적이었습니다. 원하지 않는 경로를 차단하기만 해도, AI 는 전체 모델을 재학습시킬 필요 없이 자연스럽게 원하는 도덕적 틀처럼 사고하기 시작했습니다.

3. '미세 조정 다이얼' (이중 로그 보정)

길을 차단하는 것은 간단한 '예/아니오' 선택에는 좋지만, AI 를 70% 규칙 준수자와 30% 계산기로 만들고 싶다면 어떨까요?

  • 비유: AI 의 생각은 규칙 (Blue) 과 결과 (Yellow) 라는 두 가지 색의 페인트가 섞인 것이라고 상상해 보세요.
    • 기존 방법들은 거대한 양의 파란색 페인트를 추가하려 했는데, 이는 종종 전체 혼합물을 muddy 하고 예측 불가능한 색으로 만들어 버렸습니다.
    • 이 논문은 정밀한 혼합 다이얼을 사용합니다. 그들은 AI 의 뇌 내부에 파란색과 노란색 양을 조절하는 두 가지 특정 '방향' (두 개의 뚜렷한 노브와 같음) 을 식별했습니다.
    • 그들은 **이중 로그 보정 (Dual Logit Calibration)**이라는 수학적 공식을 사용하여 이 노브들을 정확히 필요한 만큼 돌려, 최종 색상이 사용자가 요청한 것과 정확히 일치하도록 합니다 (예: 70% 파란색, 30% 노란색).

4. 이것이 더 나은 이유

  • 정밀성: 망치 대신 메스를 사용하는 것과 같습니다. 그들은 도덕적 결정이 내려지는 특정 선로만 건드리고, AI 의 뇌 나머지 부분 (수학 계산, 시 짓기, 일반 상식 질문 답변 능력 등) 은 완전히 건드리지 않습니다.
  • 예측 가능성: 기존 방법에서는 '다이얼'을 돌리면 AI 가 미쳐버리거나 작동이 멈출 수 있었습니다. 이 방법에서는 50% 의 스타일을 요청하면 정확히 50% 를 얻을 수 있습니다. 이는 신뢰할 수 있고 보정된 제어 방식입니다.
  • 재학습 불필요: 그들은 AI 에게 새로운 것을 가르칠 필요가 없습니다. AI 가 실행되는 동안 내부 기어만 조정하면 됩니다.

결론

연구자들은 실제 생활의 도덕적 딜레마 (유명한 '트롤리 문제'나 일상적인 윤리적 선택 등) 에 이 방법을 테스트했습니다. 그들은 이 방법이 AI 가 엄격한 규칙 기반 관점이나 결과 기반 관점에서 논쟁하도록 신뢰성 있게 만들 수 있으며, 사용자가 원하는 어떤 비율로든 이를 혼합할 수 있음을 발견했습니다. 결정적으로 AI 는 다른 작업을 수행하는 능력을 잃지 않았습니다. 단지 명령에 따라 도덕적 '페르소나'를 전환하는 데 능숙해졌을 뿐입니다.

요약하자면: 그들은 AI 의 뇌에서 도덕적 철학들이 갈라지는 정확한 스위치를 찾아냈고, 다른 어떤 것도 망가뜨리지 않고 AI 를 원하는 특정 윤리적 관점으로 조종할 수 있는 정밀한 리모컨을 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →