← 최신 논문
🔬 physics

Scaling Laws and Symmetry, Evidence from Neural Force Fields

본 논문은 고차 표현을 가진 등변 아키텍처를 통해 작업 대칭성을 통합하는 것이 원자간 전위에 대한 스케일링 법칙을 크게 개선함을 보여주며, 이는 근본적인 귀납적 편향을 모델이 확장함에 따라 발견하도록 맡기는 대신 명시적으로 설계해야 함을 시사한다.

원저자: Khang Ngo, Siamak Ravanbakhsh

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Khang Ngo, Siamak Ravanbakhsh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

분자 내 원자들이 어떻게 움직이고 상호작용할지 예측하는 방법을 로봇에게 가르친다고 상상해 보세요. 이는 복잡한 레고 구조물이 어떻게 결합되어 있는지 아이에게 가르치는 것과 조금 비슷합니다. 로봇에게 두 가지 유형의 설명서를 제공할 수 있습니다:

  1. "맹목적인" 설명서: 로봇에게 레고 구조물의 수백만 장의 사진만 보여주고 "규칙을 스스로 찾아내라"고 말합니다. 로봇은 전체 구조를 회전시켜도 물리 법칙이 변하지 않는다는 사실 포함, 모든 것을 처음부터 학습해야 합니다.
  2. "대칭성" 설명서: 로봇에게 "이 구조를 회전시켜도 여전히 같은 구조야. 뒤집어도 규칙은 그대로야"라고 명시적으로 알려주는 설명서를 줍니다. 즉, 물리 법칙 (대칭성) 을 로봇의 뇌에 직접 주입하는 것입니다.

오랫동안 많은 연구자들은 "맹목적인" 접근법을 믿었습니다. 로봇에게 충분한 데이터와 충분한 연산 능력 (더 큰 뇌) 만 제공한다면, 결국 스스로 대칭성 규칙을 찾아낼 것이라고 생각했습니다. 규칙을 명시적으로 가르치는 것은 불필요하며, 단순하고 유연한 모델이 결국 따라잡을 것이라고 믿었습니다.

이 논문은 다음과 같이 말합니다: "사실은 아닙니다. '대칭성' 설명서가 훨씬 더 좋으며, 규모가 커질수록 그 격차는 더 벌어집니다."

간단한 비유를 통해 그들의 발견 사항을 살펴보면 다음과 같습니다:

1. 레이스: 속도 대 효율성

연구자들은 원자 힘을 예측하는 학습 속도를 비교하기 위해 다양한 유형의 로봇 뇌 (아키텍처) 간 레이스를 진행했습니다.

  • "맹목적인" 로봇 (제약 없음): 유연하지만 비효율적입니다. 회전된 분자가 동일한 분자라는 사실을 매번 볼 때마다 다시 학습해야 합니다.
  • "대칭성" 로봇 (공변성): 회전 및 병진 이동 규칙이 내장되어 있습니다. 기본 물리 법칙을 다시 학습하는 데 에너지를 낭비하지 않습니다.

발견: 로봇이 작을 때는 차이가 크지 않았습니다. 하지만 연구자들이 로봇을 거대하게 만들면서 (데이터와 연산 능력을 확장) "대칭성" 로봇은 단순히 앞서 나가는 것을 넘어 압도적으로 앞서게 되었습니다. "맹목적인" 로봇은 더 많은 데이터를 추가해도 큰 도움이 되지 않는 벽에 부딪힌 반면, "대칭성" 로봇은 계속해서 더 똑똑해졌습니다.

2. 대칭성의 "차수"가 중요합니다

모든 "대칭성" 로봇이 동일한 것은 아닙니다. 어떤 로봇은 평평한 동전처럼 단순한 회전만 이해하고, 다른 로봇은 회전하는 지구본처럼 복잡한 3 차원 회전을 이해합니다.

  • 저차 대칭성: 기본 규칙을 이해합니다.
  • 고차 대칭성: 3 차원 공간에서 형태가 상호작용하는 방식에 대한 매우 복잡하고 상세한 규칙을 이해합니다.

발견: 로봇에 주입된 대칭성 규칙이 복잡할수록 학습 속도가 빨랐습니다. "고차" 대칭성을 가진 로봇은 "맹목적인" 로봇과의 격차가 협곡처럼 벌어질 정도로 훨씬 빠르게 학습했습니다. 이는 알파벳만 아는 학생과 이미 해당 언어의 문법과 어휘를 아는 학생을 비교하는 것과 같습니다. 책이 두꺼워질수록 두 번째 학생은 첫 번째 학생을 먼지처럼 뒤로 남겨둡니다.

3. "쓴맛 나는 교훈" 대 현실

인공지능 분야에서 "쓴맛 나는 교훈 (The Bitter Lesson)"이라는 유명한 개념이 있습니다. 이는 인공지능에 대칭성과 같은 인간의 지식을 하드코딩하는 노력을 멈추고, 더 저렴하고 확장성이 뛰어나다는 이유로 인공지능이 원시 데이터에서 스스로 학습하게 해야 한다는 주장입니다.

  • 이 논문의 주장: 원자와 분자의 세계에서는 "쓴맛 나는 교훈"이 틀렸습니다. 모델이 스스로 대칭성을 발견하게 하려 한다면, 학생에게 중력을 다시 발견하도록 요구하는 것과 같습니다. 불가능한 것은 아니지만, 비효율적이기 짝이 없습니다. 학생이 그 사실을 알아낼 때까지, 중력을 가르침받은 학생은 이미 날아다니고 있을 것입니다.

4. "골디락스" 균형

이 논문은 또한 어떻게 하면 돈 (연산 능력) 을 가장 효율적으로 쓸 수 있는지 고려했습니다.

  • 옛 방식: 더 큰 뇌 (더 많은 매개변수) 를 사거나 더 많은 교과서 (더 많은 데이터) 를 구하는 것일 수 있습니다.
  • 새로운 발견: 사실은 둘 다 동시에 구매해야 합니다. 데이터를 두 배로 늘린다면 모델 크기 역시 두 배로 늘려야 합니다. 이 "연동 확장 (tandem scaling)"은 모든 유형의 로봇에게 가장 잘 작동하지만, "대칭성" 로봇이 결합된 힘을 훨씬 더 효율적으로 활용합니다.

5. 손실 함수로 "속임수"를 쓸 수는 있을까요?

일부 연구자들은 "맹목적인" 로봇을 속이기 위해 대칭성 오류에 대해 패널티 점수를 부과하는 방식을 시도했습니다 (예: "회전된 분자가 다르다고 말하면 나쁜 점수를 받는다").

  • 발견: 이는 잘 작동하지 않았습니다. 이는 학생에게 "규칙을 잊지 마라"고 말하지만, 실제로 규칙을 가르치지 않는 것과 같습니다. 로봇은 여전히 패턴을 학습하는 데 고군분투해야 했습니다. 처음부터 규칙을 로봇의 뇌에 직접 구축하는 것이 훨씬 더 나았습니다.

결론

분자를 이해할 수 있는 초지능 AI 를 구축하고 싶다면, 단순하고 유연한 모델에 더 많은 데이터를 던져 물리 법칙을 스스로 찾아내기를 기대해서는 안 됩니다. 물리 법칙을 모델의 설계에 직접 구축하세요.

규모를 거대하게 확장할수록 우주의 근본적인 대칭성 (회전, 병진 이동) 을 존중하는 모델들은 단순히 조금 더 나은 수준을 넘어, 이러한 규칙을 처음부터 학습하려는 모델들보다 기하급수적으로 강력해질 것입니다. "대칭성" 접근법은 학습 곡선 자체의 성격을 바꾸어 작업을 더 쉽게 만들고 결과를 더 좋게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →