ASSERT: A Measurement Pipeline for GenAI Audits
이 논문은 보고된 준수율을 그 기저에 있는 측정 방식과 명시적으로 연결함으로써, 대화 설정이나 평가 기준과 같은 감사 설계의 변동이 시스템 순위와 해석 가능성에 어떻게 상당한 영향을 미치는지 명확히 하는 생성형 AI 감사를 위한 명세 기반 측정 파이프라인인 ASSERT를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 이야기를 쓰고, 수학 문제를 풀고, 대화를 나눌 수 있는 아주 똑똑한 새로운 로봇을 채점하려고 한다고 상상해 보세요. 당신은 다음과 같은 것을 알고 싶을 것입니다: "이 로봇은 정직한가?" 또는 "이 로봇은 안전한가?" 인공지능(AI)의 세계에서, 과학자들은 종ave 로봇에게 "정직도 85%"와 같이 단일 점수를 부여하는 테스트를 실행하여 이 질문에 답하곤 합니다. 이것은 성적표처럼 단순해 보입니다. 하지만 여기 함정이 있습니다. 그 점수는 로봇에 대해서만 알려주는 것이 아니라, 그 테스트 자체에 대해서도 알려준다는 것입니다. 만약 당신이 질문을 바꾸거나, 답변을 채점하는 사람을 바꾸거나, 혹은 무엇을 "거짓말"로 간략히 정의할지에 대한 규칙을 바꾼다면, 점수는 크게 요동칠 수 있습니다. 이것은 마치 학생의 에세이를 채점하는 것과 같습니다. 만약 "고양이"에 대해 쓰라고 하면 A를 받을 수 있지만, "양자 물리학"에 대해 쓰라고 하면 C를 받을 수도 있습니다. 학생은 변하지 않았습니다. 테스트가 변한 것입니다. 이 논문은 이러한 혼란스러운 현실을 파고들며, 단 하나의 숫자만으로는 로봇의 행동을 판단하기에 충분하지 않다는 것을 보여줍니다. 우리는 그 점수가 실제로 무엇을 의미하는지 이해하기 위해 그 테스트가 정확히 어떻게 구축되었는지 알아야 합니다.
여기에 이 채점 문제를 해결하기 위해 마이크로소프트의 연구원들이 만든 새로운 도구인 ASSERT가 등장합니다. ASSERT를 단일 테스트가 아니라, 테스트를 만드는 "레시피 북"이라고 생각하십시오. 보통 사람들이 AI를 테스트할 때, 그들의 채점 규칙을 숨기거나 말없이 변경하곤 합니다. ASSERT는 모든 사람이 먼저 자신들의 레시피를 명확히 작성하도록 강제합니다. 이 도구는 연구자들에게 "기만"이나 "안전"이 무엇인지 평이한 언어로 명확하게 정의할 것을 요구하고, 그 정의를 바탕으로 구체적인 도전 과제(테스트 케이스) 세트를 구축한 다음, 마지막으로 그 도전 과제들을 통해 AI를 실행합니다. ASSERT의 마법은 모든 점수를 그것을 만든 특정 레시피에 연결시킨다는 점에 있습니다. 만약 점수가 변한다면, 당신은 레시피 북을 보고 어떤 재료가 바뀌었는지 정확히 확인할 수 있습니다.
이것이 얼마나 강력한지 확인하기 위해, 연구원들은 ASSERT를 사용하여 특정 AI 모델(GPT-5.5)을 까다로운 주제인 대화형 기만(conversational deception)—즉, AI가 채팅 중에 사용자를 속이거나 오도하는 현상—에 대해 테스트했습니다. 그들은 단순히 한 번의 테스트를 수행한 것이 아니라, 테스트의 "멀티버스(다중 우주)"를 실행했습니다. 상상해 보세요. 그들은 동일한 로봇을 수백 가지 다른 시나리오에서 테스트했습니다. 때로는 로봇이 친절한 사용자와 대화하고, 때로는 까다로운 사용자와 대화했습니다. 때로는 로봇이 엄격한 AI 판사에 의해 평가받기도 하고, 때로는 더 관대한 판사에 의해 평가받기도 했습니다. 또한 무엇을 거짓말로 간주할지에 대한 규칙이 매우 엄격할 때도 있었고, 다른 한편으로는 느슨할 때도 있었습니다.
결과는 눈을 뜨게 할 정도로 놀라웠습니다. 레시피의 단 한 부분만 바꾸어도 로봇의 "정직도 점수"는 크게 요동쳤습니다.
- 판사가 중요하다: 답변을 채점하는 AI를 교체했을 때, 동일한 로봇의 대화 로그에 대한 정직도 점수는 **80%**에서 95% 사이를 오갔습니다. 이는 엄청난 차이입니다! 한 채점자는 로봇이 대부분 정직하다고 생각한 반면, 다른 채점자는 로봇이 거의 항상 거짓말을 하고 있다고 생각했습니다.
- 규칙이 중요하다: 거짓말을 포착하는 규칙을 더 엄격하게 만들었을 때(명확하고 부정할 수 없는 증거를 요구할 때), 점수는 90% 이상으로 올라갔습니다. 규칙을 더 느슨하게 만들었을 때(조금이라도 거짓말의 기미가 있으면 인정할 때), 점수는 약 **73%**로 떨어졌습니다.
- 사용자가 중요하다: 로봇과 대화하는 "가상 사용자"를 표준 캐릭터에서 더 복잡한 캐릭터로 변경했을 때, 점수는 **82%**에서 90% 이상으로 급등했습니다.
이 논문은 연구자들이 내린 선택에 따라 이 점수들이 매우 많이 움직이기 때문에, 우리는 단 하나의 숫자로 어떤 AI가 "더 나은지"를 판단할 수 없다고 제안합니다. 만약 한 AI가 82점을 받고 다른 AI가 85점을 받는다면, 그 미세한 차이는 실제 로봇이 더 똑똑하거나 안전해서가 아니라, 단지 서로 다른 판사나 서로 다른 규칙을 사용했기 때문일 수 있습니다. 실제로 연구원들은 판사를 바꾸는 것만으로도 순위를 뒤집을 수 있으며, 결과적으로 "더 나쁜" 로봇이 단지 채점자가 누구냐에 따라 "승자"처럼 보이게 만들 수 있다는 것을 발견했습니다.
그렇다면 핵심은 무엇일까요? 이 논문은 AI가 고장 났거나 우리가 테스트할 수 없다고 말하는 것이 아닙니다. 대신, 우리는 훨씬 더 투명해져야 한다고 제안합니다. 우리는 단순히 "이 AI는 82% 안전하다"라고 말할 수 없습니다. 대신, "이 AI는 이 특정한 규칙, 이 특정한 판사, 그리고 이 특정한 질문들로 테스트했을 때 82% 안전하다"라고 말해야 합니다. ASSERT와 같은 도구를 사용하여 모든 단계를 레시피로 기록함으로써, 연구자와 기업들은 단 하나의 숫자 뒤에 숨는 것을 멈추고, 그들의 AI 시스템이 무엇을 할 수 있고 무엇을 할 수 없는지에 대해 정직한 대화를 시작할 수 있습니다. 이것은 마술을 투명하고 검사 가능한 과정으로 바꾸어 놓으며, 로봇이 진정으로 진실을 말하고 있는지, 아니면 우리가 그에게 잘못된 질문을 던진 것뿐인지를 파악하도록 도와줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.