← 최신 논문
💬 NLP

STATe-of-Thoughts: Structured Action Templates for Tree-of-Thoughts

이 논문은 토큰 수준의 템퍼러처 샘플링에 의존하는 대신 이산적이고 고수준인 텍스트 행동 패턴을 탐색함으로써 출력 다양성과 추론 제어 능력을 향상시키는 해석 가능한 추론 시간 연산 방법인 STATe-of-Thoughts (STATe)를 소개한다.

원저자: Zachary Bamberger, Till R. Saenger, Gilad Morad, Ofra Amir, Brandon M. Stewart, Amir Feder

게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zachary Bamberger, Till R. Saenger, Gilad Morad, Ofra Amir, Brandon M. Stewart, Amir Feder

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 이야기를 쓰거나 설득력 있는 논증을 만드는 법을 가르치고 있다고 상상해 보세요. 당신이 프롬프트를 주면 로봇은 타이핑을 시작합니다. 하지만 때때로 로봇은 루프에 빠져 똑같은 지루한 아이디어를 반복하거나, 횡설수설하며 길을 잃기도 합니다. 이를 해결하기 위해 과학자들은 "추론 시간 연산(Inference-Time Compute, ITC)"을 개발했습니다. ITC를 로봇에게 주는 "생각하는 모자"와 말을 하기 전 브레인스토밍을 할 수 있는 추가적인 시간이라고 생각해 보세요. 단순히 다음 단어를 추측하는 대신, 로봇은 문장 전체, 또는 문단 전체를 미리 계획하려고 노력합니다.

가장 유명한 방식은 "생각의 나무(Tree of Thoughts)"라고 불리는 것입니다. 로봇이 숲속의 갈림길에 서 있는 등산객이라고 상상해 보세요. 로bot은 그냥 하나의 길을 골라 운에 맡기는 대신, 세 가지 서로 다른 경로를 따라 걸어가는 것을 상상합니다. 로봇은 각 경로를 점검하고, 어떤 경로가 유망해 보이는지 확인한 뒤, 어떤 길을 따라갈지 결정합니다. 이는 로봇이 더 나은 답을 찾는 데 도움을 줍니다. 하지만 함정이 하나 있습니다. 보통 로봇은 디지털 주사위를 굴려(이를 "고온 샘플링(high-temperature sampling)"이라고 합니다) 이 경로들을 선택합니다. 이것은 마치 등산객에게 눈을 감고 빙글빙글 돌아서 길을 고르라고 하는 것과 같습니다. 가끔은 아주 좋은 길을 선택하기도 하지만, 자주 서로 매우 비슷해 보이는 경로를 고르거나 숲에서 길을 잃곤 합니다. 로봇은 단어만 약간 다를 뿐 본질적으로 모두 똑같은 답변들을 내놓게 됩니다.

여기서 STATe-of-Thoughts(또는 STATe)라는 새로운 방법이 등장합니다. 이 논문의 연구자들은 로봇에게 더 나은 지도를 주고 싶었습니다. 경로를 고르기 위해 제자리에서 회전하는 대신, STATe는 로봇에게 명확하게 라벨이 붙은 표지판 세트를 제공합니다. 로봇이 걷기 시작하기 전에, "슬픈 이야기로 시작하기", "과학적 사실 사용하기", 또는 "두 나라를 비교하기"와 같은 특정 전략을 선택하는 "컨트롤러"가 작동합니다. 그러면 로봇은 그 특정 지시를 따릅니다. 이는 등산객에게 " '경치 좋은 전망'이라고 적힌 빨간 표지판이 있는 길로 가세요"라고 말하는 것과 같습니다. 이렇게 함으로써 로봇은 단순히 약간씩 다른 버전의 이야기가 아니라, 완전히 다른 종류의 논증이나 이야기를 탐색할 수 있습니다.

COLM 2026 컨퍼런스 논문으로 발표된 이 논문은 이 "표지판" 방식이 기존의 "바퀴 돌리기" 방식보다 훨씬 더 효과적임을 보여줍니다. 연구진이 창의적 글쓰기 과제에 대해 STATe를 테스트했을 때, 로봇은 더 다양할 뿐만 아니라(서로 더 다름) 품질도 더 높은 이야기를 만들어냈습니다. 논증 생성 테스트에서는 로봇이 선택한 표지판의 순서만 보고도 그 논증이 얼마나 훌륭할지 예측할 수 있다는 것을 발견했습니다. 예를 들어, 특정 유형의 예시로 시작하여 특정 종류의 증거로 이어가는 것이 승리하는 조합이라는 것을 알아냈습니다.

가장 중요한 점은, STATe가 인간으로 하여금 로봇이 좋은 논증을 만들었는지 이해할 수 있게 해준다는 것입니다. 모든 단계가 명확하고 인간이 읽을 수 있는 지시(예: "예시 들기" 또는 "양보하기")에 의해 안내되기 때문에, 연구자들은 로봇의 경로를 보고 "아, 로봇이 초기에 실세계의 예시를 사용하기로 선택했기 때문에 성공했구나"라고 말할 수 있습니다. 이는 로봇의 사고 과정을 블랙박스에서 우리가 읽고, 배우고, 심지어 개선할 수 있는 무언가로 바꾸어 놓았다는 점에서 매우 큰 의미가 있습니다. 이 논문은 이러한 구조화된 행동 템플릿을 사용함으로써, 우리가 더 똑똑하고 창의적일 뿐만 아니라 이해하기 쉽고 제어하기 쉬운 AI를 구축할 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →