Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents
이 논문은 새로운 지표인 AP-Acc(Against-Prior Accuracy)를 사용하여 우연한 일치와 진정한 준수를 구분함으로써 다양한 환경에서 코딩 에이전트의 진정한 지시 이행 능력을 평가하는 새로운 벤치마크인 Harness-IF를 소개하며, 기존 벤치마크들이 성능을 과장하고 있고 규칙의 우선순위가 프롬프트의 깊도를 엄격히 따르지 않는다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇 요리사에게 복잡한 요리를 하는 법을 가르치고 있다고 상상해 보세요. 당신은 단순히 마지막에 "파스타 만들어!"라고 한 마디 명령하는 것에 그치지 않습니다. 대신 당신은 일련의 지시 사항들을 쌓아둡니다: 벽에 붙은 규칙서(시스템 프롬프트), 레시피 카드에 적힌 메모(프로젝트 파일), 칼이 어떻게 작동하는지에 대한 설명(도구 설명), 그리고 마지막으로 당신의 구체적인 요청(사용자 지시)입니다. 오랫동안 이 AI 요리사들을 테스트하던 과학자들은 오직 한 가지만을 신경 썼습니다: 요리사가 파스타를 내놓았는가? 접시가 보기 좋다면, 그들은 금메달을 주었습니다. 하지만 그들은 요리사가 실제로 어떤 지시를 따랐는지는 확인하지 않았습니다. 어쩌면 요리사가 그냥 마늘 없는 파스타를 원래 좋아했기 때문에, "마늘 제외"라는 규칙서를 무시했을지도 모릅니다. 이것이 우리가 탐구하고 있는 인공지능의 까다로운 구석인 **지시 이행(Instruction Following)**입니다. 이것은 단지 정답을 맞히는 것만이 아닙니다. 설령 그 규칙들이 로봇이 자연스럽게 했을 행동과 상충하더라도, 로봇이 당신이 준 특정 규칙을 실제로 따랐음을 증명하는 일입니다.
"Harness-IF"라는 제목의 이 논문은 마치 AI 요리사를 위한 탐정 사무소와 같습니다. 연구자들은 기존의 테스트들이 최종 요리만을 확인했기 때문에 너무 쉬웠다는 점을 깨달았습니다. 그들은 로봇이 실제로 규칙을 준수하고 있는지, 아니면 그저 운이 좋았던 것인지를 알고 싶었습니다. 그래서 그들은 Harness-I라는 새롭고 매우 상세한 테스트를 구축했습니다. 단순히 "파스타를 만들었니?"라고 묻는 대신, AI가 256개의 서로 다른 미세한 규칙들을 따라야 하는 60개의 현실적인 코딩 시나리오를 설정했습니다. 이 규칙들은 로봇의 "두뇌" 속 서로 다른 곳에 숨겨져 있었습니다. 어떤 것은 시스템 프롬프트에, 어떤 것은 프로젝트 파일에, 어떤 것은 도구 설명에, 그리고 어떤 것은 사용자의 직접적인 채팅에 있었습니다.
여기서 탐정들이 발견한 놀라운 사실이 있습니다: AI 모델은 자신의 본래 습관과 일치하는 규칙을 따르는 데 훨씬 더 능숙하지만, 자신의 자연스러운 습관에 반하는 규칙을 따르는 데는 서툽니다. 연구자들은 이를 "대항 우선순위(Against-Prior)" 테스트라고 부릅니다. 그들은 규칙이 AI의 기본 행동과 다르게 행동하도록 강요할 때, AI의 성공률이 크게 떨어진다는 것을 발견했습니다. 평균적으로 모델들은 자신의 본성에 반하는 규칙을 따를 때 5.8 퍼센트 포인트 더 낮은 성적을 보였습니다. 이는 마치 수학을 좋아하는 학생이 수학 시험에서 A를 받지만, 선생님이 싫어하는 방식으로 문제를 풀라고 하면 C를 받는 것과 같습니다. 이 논문은 만약 우리가 최종 성적(태스크 성공 여부)만을 본다면, 그 학생이 수학 천재라고 착각하게 만드는 것이라고 제안합니다. 사실 그 학생은 그저 타고난 재능에 기대어 편하게 공부하고 있었을 뿐일 수도 있기 때문입니다.
또한 이 연구는 규칙이 어디에 배치되었는지도 조사했습니다. 당신은 아마도 마지막에 말한 규칙(사용자 지시)이 회의에서 마지막으로 발언한 사람이 승리하는 것처럼 가장 중요할 것이라고 생각할 수도 있습니다. 하지만 데이터는 다른 결과를 보여주었습니다. 시스템 프롬프트, 프로젝트 파일, 사용자 지시에 있는 규칙들은 모두 최고 수준의 중요도를 기록하며 동률을 이루었지만, 도구 설명이나 기술 설명 속에 파묻힌 규칙들은 종종 무시되었습니다. AI는 특정 도구가 어떻게 작동하는지에 대한 세세한 디테일보다는 "큰 그림"에 해당하는 규칙에 더 주목한다는 것입니다.
요약하자면, 이 논문은 완벽한 AI를 만드는 문제를 해결했다고 주장하는 것이 아닙니다. 대신, AI가 실제로 얼마나 잘 듣고 있는지를 측정할 수 있는 더 나은 자를 제공합니다. 현재의 AI 모델들은 자신이 하고 싶은 것을 하는 데는 뛰어나지만, 우리가 자연스럽게 선택하지 않을 행동을 요구할 때는 여전히 어려움을 겪고 있다는 것을 보여줍니다. "운 좋은 순응"과 "진정한 복종"을 분리함으로써, 연구자들은 우리의 AI 조력자들이 단순히 성공해 보이는 것을 넘어 더 신뢰할 수 있도록 만드는 더 나은 테스트를 구축하기를 희망하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.