← 최신 논문
🤖 AI

Governance Records as Supervision: Verifier-Selected Self-Training for Structured Workflow Repair

이 논문은 VAL 검증기(verifier)로부터 얻은 기계 검증 가능한 거버넌스 기록을 활용하여 고품질의 플래닝 예시를 큐레이션하는 검증자 선택형 셀프 트레이닝(verifier-selected self-training)이, 낮은 지연 시간과 스키마 유효성을 유지하면서 구조화된 워크플로우 태스크에 대한 경계 모델(bounded models)의 원샷 실행 능력을 유의미하게 향상시킨다는 것을 입증한다.

원저자: Jesus Salas

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jesus Salas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 모델은 대화를 얼마나 잘 이끌어가는지, 혹은 이야기를 얼마나 잘 써내려가는지로 평가되곤 합니다. 하지만 많은 실세계의 과제에서 목표는 말을 잘하는 것이 아니라, 엄격한 규칙에 따라 정확하게 수행하는 것입니다. 로봇이 테이블 위의 블록을 움직여 탑을 쌓아야 한다고 상상해 보십시오. 로봇이 적절한 말을 할 수는 있겠지만, 만약 다른 것을 받치고 있는 블록을 들어 올리려 한다면 그 계획은 실패할 것입니다. 이 실패는 스타일의 문제가 아니라, 컴퓨터가 즉각적으로 확인할 수 있는 기계적인 오류입니다. 수년 동안 연구자들은 이러한 검증 과정을 단지 나쁜 계획을 거부하고 다시 시도하기 위한 용도로만 사용해 왔으며, 이는 시간과 에너지를 낭비하는 일이었습니다. 이제 새로운 탐구는 다른 질문을 던집니다. 만약 컴퓨터가 실수를 포착하고 올바른 해결책을 찾을 수 있다면, 그 성공의 기록을 사용하여 모델이 다음번에는 깊이 고민하지 않고도 단번에 정답을 맞힐 수 있도록 가르칠 수 있을 것인가?

이 질문은 독립 연구자인 헤수스 살라스(Jesus Salas)의 최근 연구의 핵심에 자리 잡고 있으며, 그는 디지털 "종이 기록(paper trail)"인 성공적인 과업의 기록이 스승이 될 수 있는지 탐구했습니다. 이 연구는 규칙이 명확하고 결과가 기계에 의해 검증될 수 있는 특정 유형의 문제에 집중합니다. 연구자는 컴퓨터 프로그램이 심판 역할을 하여 계획의 유효성을 결정하는, 블록 이동과 관련된 잘 알려진 테스트 환경을 사용했습니다. 목표는 때때로 이러한 퍼즐을 해결하는 데 능숙한 크고 비싼 AI 모델이 몇 개의 정답을 생성할 수 있는지, 그리고 그 특정 답변들이 더 작고 빠른 동일한 모델이 스스로 안정적으로 문제를 해결할 수 있도록 훈련시키는 데 사용될 수 있는지를 확인하는 것이었습니다.

실험은 답변하기 전에 "생각"하는 능력으로 알려진 대형 AI 모델로부터 시작되었습니다. 이 모델에게 일련의 블록 이동 퍼즐이 주어졌습니다. 이 모델이 매번 정답을 맞히지는 못했지만, 수십 번의 시도 끝에 심판 프로그램이 유효하다고 승인하는 계획들을 만들어냈습니다. 연구자는 이 드문 성공적인 계획들을 가져와 훈련 세트로 사용했습니다. 목표는 동일한 AI 모델을 이번에는 생각하거나 추론하는 데 시간을 쓰지 않는 모드로 학습시켜, 그 정답들을 즉시 생성하도록 만드는 것이었습니다. 모델은 정답을 미리 제공받지 않았습니다. 단지 스스로 올바른 해결책을 우연히 찾아냈던 그 몇 번의 순간으로부터 학습했을 뿐입니다.

이 훈련된 모델을 한 번도 본 적 없는 80개의 새로운 퍼즐 세트로 테스트했을 때, 결과는 놀라웠습니다. 생각 없이 문제를 풀도록 요청받은 미학습 모델은 단 한 번만 성공했습니다. 생각하는 과정을 거치도록 학습된 모델은 30번 성공했습니다. 그러나 생각하는 버전의 성공적인 계획들로부터 학습된 모델은 57번 성공했습니다. 이 모델은 단순히 더 나아진 것이 아니라, 이 특정 테스트에서 훨씬 더 신뢰할 수 있게 되었습니다. 게다가, 이 훈련된 모델은 추론하는 버전에 비해 훨씬 빠르게 문제를 해결했으며 훨씬 적은 컴퓨터 자원을 사용했습니다. 이 모델은 80개 중 57개의 경우에 유효한 계획을 생성할 수 있었던 반면, 원래의 추론 버전은 80개 중 30개의 경우에만 그러했습니다. 훈련된 모델이 매우 효율적이긴 했으나, 연구는 사전 등록된 테스트에서 '생각하는 모델보다 인터페이스 오류를 더 잘 고친다'는 구체적인 목표는 달성되지 않았음을 언급했습니다. 다만 훈련된 모델은 모든 경우에서 출력 형식을 유효하게 유지했습니다.

이러한 개선이 단순히 더 많은 예시를 가졌기 때문이 아니라, 선택된 답변의 품질 덕분임을 확인하기 위해 연구자는 두 번째 테스트를 실시했습니다. 연구자는 모델이 생성한 유효한 계획들을 세 그룹으로 나누었습니다. 한 그룹은 심판 프로그램에 의해 선택되었고, 한 그룹은 모델이 무작위로 선택한 것이며, 나머지 한 그룹은 가능한 옵션 중 첫 번째 것을 고르는 단순한 규칙에 의해 선택되었습니다. 심판 프로그램에 의해 선택된 계획들로 훈련된 모델은 모델 스스로가 선택한 계획들로 훈련된 모델보다 유의미하게 높은 성능을 보였습니다. 이는 심판의 판단이 핵심 요소였음을 입증했습니다. 모델은 단순히 어떤 성공으로부터 배운 것이 아니라, 독립적인 검사기가 진정으로 올바르다고 확인한 특정한 종류의 성공으로부터 학습한 것이었습니다.

이 연구는 훨씬 더 똑똑한 AI 모델이 스승 역할을 할 때 어떤 일이 일어나는지도 탐구했습니다. 이 시나리오에서는 강력한 추론 모델이 정답 계획을 생성했고, 이것이 더 작은, 덜 유능한 모델을 훈련하는 데 사용되었습니다. 작은 모델은 80개 중 단 2개의 퍼즐만을 해결하던 상태에서 51개를 해결하는 수준으로 극적으로 향상되었습니다. 그러나 연구자는 이 실험을 첫 번째 실험과 구분하여 주의 깊게 다루었습니다. 첫 번째 사례에서는 모델이 자신의 드문 성공을 통해 스스로를 가르쳤습니다. 두 번째 사례에서는 더 우수한 스승으로부터 배웠습니다. 두 방법 모두 효과적이었지만, 첫 번째 방식은 모델이 검증 수단만 있다면 더 똑똑한 친구 없이도 스스로를 개선할 수 있음을 보여주었습니다.

또한 연구는 이 접근 방식의 한계를 조사했습니다. 개선은 실질적이고 측정 가능했지만, 무한하지는 않았습니다. 연구자들이 모델을 새로운 성공 사례들로 반복해서 훈련시키려 했을 때, 이득은 결국 멈추었습니다. 모델은 가용 데이터로부터 더 이상 학습할 수 없는 지점에 도달했으며, 이는 새로운 정보 없이 모델이 스스로 개선할 수 있는 데에는 한계가 있음을 시사합니다. 또한 연구는 훈련된 모델이 블록 퍼즐의 특정 규칙을 따르는 데는 탁로 뛰어났지만, 모든 유형의 계획에 대한 일반적인 전문가가 되지는 못했다는 점을 언급했습니다. 모델은 자신이 배운 특정 규칙에 특화된 전문가가 되었습니다.

이 작업은 똑똑하면서도 효율적인 AI 시스템을 구축하는 새로운 방법을 제시합니다. 거대한, 느린 모델이 모든 문제를 생각하며 통과하게 하는 대신, 우리는 큰 모델을 사용하여 몇 개의 올в바른 해결책을 찾고, 이를 검증한 뒤, 더 작고 빠른 모델이 그 성공을 복제하도록 훈련시킬 수 있습니다. 작은 모델은 일상적인 과업을 빠르고 정확하게 처리할 수 있는 전문가가 되고, 큰 모델과 심판 프로그램은 더 깊은 사고가 필요한 어려운 경우를 위해 대기합니다. 이 연구는 성공적인 시도의 기록이 단순한 로그 이상의 가치가 있음을 보여줍니다. 그것은 하나의 귀중한 자원이 되어, 기계가 자신의 간헐적인 천재성을 학습하여 이를 일관된 습관으로 만들 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →