MaD Physics: Evaluating information seeking under constraints in physical environments
본 논문은 물리 법칙이 변경된 환경에서 AI 에이전트의 물리 법칙 추론 능력과 자원 제약 하의 측정 계획 능력을 평가하기 위해 고안된 새로운 벤치마크인 MaD Physics 를 소개함으로써, 현재 제미니 모델의 과학적 추론 및 구조화된 탐색 능력의 한계를 드러냅니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미스터리를 해결하려는 형사라고 상상해 보세요. 하지만 아주 엄격한 규칙이 하나 있습니다: 단서 확보에 쓸 수 있는 돈이 제한되어 있습니다.
이것이 MaD Physics(측정 및 물리 발견)라는 새로운 연구 프로젝트의 핵심 아이디어입니다. 구글 딥마인드와 밀라의 연구원들은 AI '과학자'들이 교과서에서 답을 찾아볼 수도, 모든 것을 확인해 볼 여유도 없을 때 세계가 어떻게 작동하는지 얼마나 잘 파악할 수 있는지 테스트하기 위해 비디오 게임과 같은 실험을 고안했습니다.
다음은 이 실험이 어떻게 작동하는지 그리고 그들이 무엇을 발견했는지에 대한 간단한 설명입니다:
1. 게임: "미스터리 상자"
이 실험에서 AI는 물체들이 움직이는 가상 세계에 던져집니다. 하지만 함정이 하나 있습니다: 이 세계의 물리 법칙은 약간 깨져 있거나 '변형'되어 있습니다.
- 중력이 평소처럼 물체를 아래로 끌어당기지 않을 수도 있습니다.
- 물이 정상적인 유체 역학을 거스르는 패턴으로 소용돌이칠 수도 있습니다.
- 입자들이 우리 현실 세계에는 존재하지 않는 보이지 않는 실로 연결된 것처럼 행동할 수도 있습니다.
AI 는 이러한 규칙을 알지 못합니다. 물체의 움직임을 관찰함으로써 규칙을 파악해야 합니다.
2. 도전 과제: "단서 예산"
여기서 'MaD' 부분이 등장합니다. AI 에게는 예산(고정된 수의 동전이 들어 있는 지갑과 같은 것)이 있습니다.
- 물체를 보는 데는 비용이 듭니다.
- 가까이서 자세히 보는 것 (고정밀도) 은 많은 비용이 듭니다.
- 멀리서 보는 것 (저정밀도) 은 적은 비용이 듭니다.
- 더 오래 기다리며 보는 것은 더 많은 시간이 듭니다.
AI 는 현명한 선택을 해야 합니다: "전체 예산을 한 물체를 매우 자세히 확인하는 데 써야 할까, 아니면 대략적인 아이디어를 얻기 위해 열 개의 다른 물체를 조금씩 확인하는 데 써야 할까?"
AI 가 나쁜 추측에 돈을 낭비하면 미스터리를 해결하기 전에 동전이 바닥납니다. 돈이 떨어지면 게임은 종료되며, AI 는 구매한 단서만을 바탕으로 물체가 미래에 어디에 있을지 예측해야 합니다.
3. 세 가지 세계
AI 가 단순히 현실 세계의 사실을 암기하는 것이 아닌지 확인하기 위해, 연구원들은 세 가지 다른 '우주'에서 이를 테스트했습니다:
- 통통 튀는 공 세계 (고전 역학): 물체들이 튀고 충돌하지만, 특정 방향으로 밀기 어렵게 만드는 이상하고 보이지 않는 '기억'이 있습니다.
- 소용돌이치는 물 세계 (유체 역학): 액체가 흐르지만, 이상하고 회전하는 패턴으로 밀어붙이는 보이지 않는 '외계 힘'이 있습니다.
- 유령 입자 세계 (양자 역학): 파동처럼 행동하는 작은 입자들이지만, 한 가지 변주가 있습니다: 관찰했을 때 나타나는 방식에 대한 규칙이 현실 세계와 다릅니다.
4. 실험 대상
연구원들은 이 게임에서 AI 가 얼마나 뛰어난지 확인하기 위해 구글의 제미니 (Gemini) AI 모델 네 가지 버전 (더 작고 빠른 모델부터 더 크고 똑똑한 모델까지) 을 테스트했습니다.
5. 결과: AI 가 틀린 점
결과는 AI 에게 다소 겸손함을 안겨주었습니다:
- 전략적 사고에 어려움을 겪음: AI 는 종종 예산을 비효율적으로 사용했습니다. 잘못된 것을 보거나 중요하지 않은 것을 지나치게 자세히 확인하다가 패턴을 이해하기 전에 돈을 다 써버렸습니다.
- 새로운 법칙을 '발명'하지 못함: 물리 법칙이 변형되었을 때, AI 는 종종 현실 세계의 규칙을 새로운 세계에 강제로 적용하려 했습니다. 체스 규칙을 사용하여 스도쿠 퍼즐을 해결하려는 것과 같았습니다.
- 더 똑똑한 모델이 더 잘했지만 완벽하지는 않음: 더 똑똑한 AI 모델 (제미니 3 등) 은 실수가 적었고 미래를 예측하는 데 더 뛰어났지만, 여전히 변형된 물리의 '비밀 코드'를 완벽하게 파악하지는 못했습니다.
- 시각적 요소가 더 어렵게 만듦: AI 가 숫자 대신 움직이는 물체의 사진을 봐야 할 때, 더 혼란스러워졌습니다.
결론
이 논문은 AI 가 이미 정답을 알고 있는 질문에 답하는 데는 매우 능숙해졌지만, 진정한 과학적 발견에는 여전히 어려움을 겪고 있다고 결론 내립니다. 즉, 제한된 자원을 현명하게 사용하여 새로운 데이터를 수집하고, 아직 존재하지 않는 규칙을 파악해내는 능력입니다.
이렇게 생각해보세요: AI 는 도서관 사서(기존 책을 찾는 것)는 훌륭하지만, 아직 아무도 보지 않은 지역의 지도를 그리는 탐험가가 되는 법은 아직 배우고 있습니다. MaD Physics 는 연구원들이 AI 가 어디서 길을 잃는지 정확히 파악하여 더 잘 탐험할 수 있도록 도와주기 위한 새로운 지도입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.