Operationalizing Ethics for AI Agents: How Developers Encode Values into Repository Context Files
이 비전 논문은 개발자가 AI 에이전트를 안내하기 위해 행동 규칙을 저장소 컨텍스트 파일(예: AGENTS.md)에 인코딩하여 윤리적 원칙을 어떻게 운영화하는지 조사하고, 이러한 신흥 개발자 작성 지침의 변이, 거버넌스 및 준수를 연구하기 위한 연구 의제를 제시합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 매우 빠른 로봇 조수를 고용하여 집을 짓는다고 상상해 보세요. 당신은 이 로봇이 단순히 효율적일 뿐만 아니라 친절하고, 공정하며, 안전하기를 원합니다. 과거에는 인간 노동자들을 위해 길고 진지한 규칙책을 작성하여 그들이 그것을 읽고 착하게 행동할 것을 기억하기를 바랐을 것입니다. 하지만 로봇은 인간과 같은 방식으로 규칙책을 읽지 않습니다.
이 논문은 개발자들이 이제 새로운, 교묘한 수단을 시도하고 있다고 주장합니다. 그들은 로봇의 작업 공간 안에 직접 구체적인 지침서를 작성하고 있습니다.
다음은 이 논문이 전달하는 내용을 간단한 비유로 풀어낸 것입니다:
1. 문제: "착하게 행동하라"는 너무 모호함
로봇 조수에게 "윤리적으로 행동해 주세요"라고 말하는 것을 상상해 보세요. 이는 아이에게 "착하게 행동해"라고 말하는 것과 같습니다. 좋은 아이디어이지만, 로봇이 어떻게 착하게 행동해야 하는지 알려주지는 않습니다. 실수를 목격하면 멈춰야 할까요? 공손하게 말해야 할까요? 다른 사람들에게 불공정하지 않은지 확인해야 할까요? 논문은 우리가 큰 회의에서 "AI 윤리"에 대해 많이 논의하지만, 이러한 거대한 아이디어를 기계가 실제로 따를 수 있는 구체적인 지침으로 바꾸기는 어렵다고 말합니다.
2. 해결책: "AGENTS.md" 파일
저자들은 개발자들이 코드 프로젝트 안에 AGENTS.md(또는 이와 유사한 컨텍스트 파일) 라는 특별한 파일들을 만들기 시작했다는 사실을 발견했습니다. 이 파일들을 로봇이 일하는 **주방 조리대 바로 위에 붙여놓은 "집 규칙"**으로 생각하세요.
"공정하게 행동하라"고만 말하는 대신, 개발자들은 다음과 같이 구체적이고 실행 가능한 명령을 작성합니다:
- 공정성을 위해: "이름을 테스트할 때 'John Smith', 'José García', '李明'과 같이 다양한 이름을 섞어 사용하여 시스템이 이름에 따라 사람들을 다르게 대우하지 않도록 하세요."
- 어조를 위해: "도덕적 강론이나 원치 않는 의견을 제시하지 마세요. 그저 일을 하세요."
- 포용성을 위해: "비원어민도 이해할 수 있도록 간단한 영어로 작성하세요."
- 지속가능성을 위해: "환경 보호를 위해 데이터와 배터리 전력을 적게 사용하세요."
3. 그들이 발견한 것 (예비 조사)
연구자들은 이러한 파일들 중 몇 가지를 살펴봤습니다 (여러 집 안을 살짝 들여다본 것과 같습니다). 그 결과 개발자들이 이미 이를 수행하고 있음을 발견했습니다. 그들은 추상적인 철학을 작성하는 것이 아니라, 가치를 기계가 읽을 수 있는 규칙으로 번역하고 있습니다.
- 공정성은 구체적인 테스트 스크립트가 됩니다.
- 책임성은 변경 사항을 관리할 때 인간이 통제권을 유지하도록 하는 규칙이 됩니다.
- 포용성은 어떤 단어를 사용해야 하는지에 대한 규칙이 됩니다.
이는 마치 개발자가 "나는 단순히 내 로봇이 공정하기를 원하는 것이 아니라, 로봇이 작업을 끝내기 전에 공정성 검사를 수행하도록 프로그래밍하고 있다"고 말하는 것과 같습니다.
4. 큰 질문들 (연구 로드맵)
이 논문은 아직 모든 답을 가지고 있다고 주장하지 않습니다. 대신 다음과 같은 질문을 던지며 새로운 연구 경로를 제안합니다:
- 로봇들은 실제로 듣는가? 우리가 이러한 규칙을 작성한다면, 로봇들은 그것을 따를까요, 아니면 그냥 무시할까요?
- 누가 규칙을 결정하는가? 두 명의 개발자가 '공정함'의 의미에 대해 이견을 보인다면, 그들은 파일 안에서 어떻게 논쟁할까요?
- 규칙은 변하는가? 로봇이 실수를 저지르면, 개발자들은 다시는 그런 일이 발생하지 않도록 "집 규칙"을 업데이트할까요?
결론
이 논문은 하나의 "비전" 문서입니다. 이는 다음과 같이 말합니다: "보세요, 개발자들은 이미 코드 파일 안에 구체적인 지침을 작성함으로써 AI 윤리를 가르치려 하고 있습니다."
저자들은 우리가 이 관행을 연구하기를 원합니다. 그들은 우리가 현실 세계에서 AI 가 어떻게 지배받는지 이해하려 한다면, 거대한 법률이나 추상적인 이론만 살펴봐서는 안 된다고 믿습니다. 대신, 개발자들이 실제로 "착하게 되는 것"을 로봇을 위한 "착하게 행동하는 것"으로 전환하려 노력하는 이러한 작고 일상적인 지침 파일들을 살펴봐야 합니다.
간단히 말해: 우리는 AI 에게 "착한 사람이 되라"고 말하는 것에서, AI 가 작업하는 동안 체크해야 할 "착한 사람" 업무의 구체적인 체크리스트를 제공하는 것으로 이동하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.