← 최신 논문
🤖 machine learning

Multi-Perspective Transformers in ARC-AGI-2 Challenge

본 논문은 Test-Time-Training 및 Products of Experts 와 같은 테스트 시간 미세 조정 기법을 강화한 TinyLM 기반 접근법을 제시하여 ARC-AGI-2 시각 퍼즐을 해결하고 평가 세트에서 21.7% 의 정확도를 달성했습니다.

원저자: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

게시일 2026-05-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 일련의 시각적 퍼즐을 handed 받는 상황입니다. 각 퍼즐은 다채로운 그리드의 '이전'과 '이후' 이미지를 몇 장 보여주고, 당신의 임무는 '이전'을 '이후'로 바꾸는 규칙을 추측하는 것입니다. 그런 다음, 그 규칙을 새로운, 본 적 없는 이미지에 적용해야 합니다. 이것이 바로 ARC-AGI-2 도전 과제입니다. 이는 컴퓨터가 인간처럼 생각할 수 있는지, 즉 매우 적은 예시에서 학습하고 새로운 상황에 즉시 적응할 수 있는지 테스트하도록 설계된 시험입니다.

다음은 팀 (Caleb, Seun, Weiwen, Fariha, Vedant, Xinyu) 이 이 도전 과제에 접근한 방식을 간략히 설명한 것입니다.

팀의 전략: "많은 눈" 접근법

퍼즐을 한 번만 보는 대신, 팀은 퍼즐을 다양한 각도에서 바라보는 시스템을 구축했습니다. 마치 같은 범죄 현장을 다섯 명의 다른 사람에게 묘사하게 하는 것과 같지만, 각 사람은 서로 다른 창문에서 바라보거나 거울을 비추어 보는 식입니다.

  1. 번역기 (토큰화): 먼저 컴퓨터는 다채로운 그리드를 레시피 같은 간단한 텍스트 문자열로 변환합니다. "여기서 시작, 너비 5, 높이 5, 색상은 빨강"과 같은 내용을 말합니다.
  2. 변신술사 (데이터 증강): 시스템은 그 퍼즐을 가져와 수십 개의 '시각'을 생성합니다. 그리드를 회전시키고, 팬케이크처럼 뒤집고, 색상을 바꾸고 (예: 모든 빨강을 파랑으로), 전치합니다. 목표는 숨겨진 규칙이 컴퓨터에게 명확해지도록 퍼즐의 버전을 찾는 것입니다.
  3. 작은 뇌 (TinyLM): 그들은 TinyLM이라는 매우 작고 효율적인 AI 모델을 사용했습니다. 이는 세상의 모든 퍼즐을 외운 적은 없지만 패턴을 빠르게 포착하는 데 매우 뛰어난 똑똑하지만 컴팩트한 학생과 같습니다.
  4. 전문가들의 산물 (PoE): 이것이 그들의 투표 시스템입니다. 모델은 퍼즐의 모든 다른 '시각'을 살펴봅니다. 모델이 모든 다른 시각 (회전된, 뒤집힌, 색상 바뀐) 에서 자신의 답변에 확신을 가진다면, 그 답변은 높은 점수를 받습니다. 배심원들이 모두 동의할 때만 유죄 평결이 받아들여지는 것과 같습니다.
  5. 빠른 학습자 (테스트 시간 학습): 특정 퍼즐을 풀기 전에 모델은 해당 퍼즐에 제공된 소수의 예시를 이용해 아주 짧고 빠른 '단기 집중 과정'을 받습니다. 마치 셰프가 특정 요리에 맞춰 일반 레시피에 의존하는 대신, 서빙 직전에 소스를 맛보고 소금 한 꼬집을 추가하는 것과 같습니다.

결과: 두 가지 세트의 이야기

팀은 두 그룹의 퍼즐에 대해 시스템을 테스트했습니다.

  • 연습 세트 (학습): 모델이 '단기 집중 과정' 동안 본 퍼즐들입니다.
  • 최종 시험 (평가): 모델이 본 적 없는 완전히 새로운 퍼즐들입니다.

성적표:

  • 연습 세트에서: 모델은 스타였습니다. **96.1%**의 정확도를 기록했습니다. 보여준 규칙을 완전히 습득했습니다.
  • 최종 시험에서: 점수는 **21.7%**로 떨어졌습니다.

무엇이 잘못되었을까? (과적합 문제)

논문은 '빠른 학습자' 방법 (테스트 시간 학습) 이 실제로는 최종 시험에서 상황을 더 악화시켰다고 설명합니다.

수학 시험을 준비할 때 숙제의 특정 숫자들을 외우는 상황을 상상해 보세요. 시험이 오면 숫자는 다르지만 논리는 동일합니다. 모델이 특정 숙제 숫자에 너무 열심히 공부했기 때문에, 시험 숫자가 바뀌었을 때 혼란을 겪었습니다. 그것은 '과적합'되었습니다. 즉, 연습 예시를 너무 완벽하게 외워 새로운 예시에 적응하지 못했습니다.

마찬가지로, '많은 눈' (PoE) 전략은 기대만큼 잘 작동하지 않았습니다. 모델이 주로 행 단위 (row-by-row) 로 퍼즐을 읽도록 훈련되었기 때문입니다. 시스템이 열 단위 (column-by-column) 와 같이 퍼즐을 다른 각도에서 보려고 시도했을 때, 모델은 새로운 관점을 이해하지 못해 그 추가적인 시각들이 무용지물이 되었습니다.

결론

팀은 다중 관점과 빠른 학습을 활용하여 시각적 퍼즐을 해결하는 교묘한 시스템을 구축했습니다. 이는 연습한 퍼즐의 규칙을 거의 완벽하게 학습할 수 있음을 입증했습니다. 그러나 완전히 새로운, 본 적 없는 퍼즐에 그 규칙을 적용하는 데는 어려움을 겪었습니다.

논문은 '빠른 학습자'와 '많은 눈' 트릭이 흥미롭지만, 모델은 더 커지고 더 다양한 예시로 훈련되며, 특정 연습 예시를 외우는 것이 아니라 퍼즐의 논리를 학습하도록 가르쳐져야 한다고 결론지었습니다. 그들은 아직 도전 과제의 가장 어려운 부분을 해결하지는 못했지만, 작은 AI 모델이 어떻게 추론을 시도할 수 있는지 이해하는 데 견고한 기초를 마련했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →