기존의 세포 자동자 (Cellular Automata): 마치 레고 블록이나 체스를 생각해보세요.
각 칸 (세포) 에는 '1'이나 '0', '불', '나무' 같은 아주 단순한 숫자나 기호만 들어갑니다.
규칙도 "불이 붙은 나무 옆에 나무가 있으면 그 나무도 불이 붙는다"처럼 엄격하고 기계적인 코드로 정해져 있습니다.
컴퓨터는 이 규칙을 맹목적으로 따릅니다.
새로운 방식 (LOGOS-CA): 이제 이 레고 블록 대신 **작은 이야기 (자연어)**를 넣는다고 상상해보세요.
각 칸에는 "나는 지금 불이 붙어 있어, 내 옆에 불이 붙은 나무가 있으면 나도 타버릴 거야"라는 문장이 적혀 있습니다.
그리고 이 문장을 읽고 다음 상태를 결정하는 것은 **초지능 AI (LLM, 대형 언어 모델)**입니다.
마치 수천 명의 배우들이 무대 위에서 즉흥극을 하는 것 같습니다. 각 배우 (세포) 가 자신의 상황과 옆 배우의 상황을 보고 "다음엔 내가 어떻게 해야 할지"를 AI 가 대신 생각하게 하는 거죠.
2. 실험 1: 산불 시뮬레이션 (규칙을 얼마나 잘 따를까?)
연구진은 먼저 아주 단순한 산불 시뮬레이션을 해봤습니다.
목표: "나무가 불에 타면 재가 되고, 불이 붙은 나무 옆에 나무가 있으면 그 나무도 불이 붙는다."라는 규칙을 AI 가 정확히 지키는지 확인하는 것입니다.
결과:
고성능 AI (GPT-4o, GPT-5 등): 마치 엄격한 교사처럼 규칙을 완벽하게 따랐습니다. 불이 퍼지는 모습이 기존 컴퓨터 시뮬레이션과 똑같았습니다.
중저가 AI (GPT-4o-mini 등):산만하고 주의가 산만한 학생처럼 행동했습니다. 규칙을 잊어버리거나, "불이 붙었는데도 나무로 남는다" 같은 엉뚱한 실수를 하며 시뮬레이션이 무너졌습니다.
교훈: AI 가 얼마나 똑똑하냐에 따라, 규칙이 명확한 시뮬레이션의 결과가 완전히 달라질 수 있습니다.
3. 실험 2: 인공 생명 (ALife) - 자유로운 상상력
이번에는 규칙을 딱딱 정하지 않고, **"중앙의 세포는 주변에 무작위 문자를 만들어내고, 나머지는 빈 공간"**이라는 아주 자유로운 설정으로 실험했습니다.
결과 (두 가지 AI 의 차이):
GPT-5-nano (작은 모델):
비유:아동용 낙서나 간단한 암호를 만드는 아이 같습니다.
"A", "*", "Q" 같은 기호를 만들어내며, "A 는 아래쪽에서 왔어"처럼 짧고 간단한 문장으로 상태를 정의했습니다. 마치 **기호 (Symbol)**를 만들어내는 놀이를 하는 것 같았습니다.
GPT-5-mini (큰 모델):
비유:법률가나 정교한 건축가 같습니다.
"overwrite-resistant (덮어쓰기 방지)", "self-sustaining (자가 유지)" 같은 복잡한 단어와 긴 문장을 사용했습니다.
단순히 "불이 붙었다"가 아니라, "불꽃의 질감, 밀도, 장식적인 요소"까지 묘사하며 매우 세밀하고 형식적인 설명을 해냈습니다. 마치 법적 계약서를 쓰듯이 "이 조건이 충족되지 않으면 절대 변하지 않는다"라고 강조했습니다.
4. 이 연구가 우리에게 주는 메시지
이 실험은 우리에게 두 가지 중요한 점을 알려줍니다.
AI 는 단순한 계산기가 아니다: 같은 규칙을 줘도, AI 모델에 따라 결과가 완전히 다르게 나옵니다. 작은 모델은 규칙을 잊어버리고, 큰 모델은 규칙을 넘어서서 창의적이지만 복잡한 설명을 만들어냅니다.
새로운 시뮬레이션의 가능성: 앞으로 우리는 화학 반응, 교통 체증, 경제 활동 같은 복잡한 현상을 시뮬레이션할 때, 단순한 숫자 대신 **자연어 (사람이 쓰는 말)**를 사용할 수 있습니다.
예를 들어, "이 분자는 옆 분자와 만나면 기분이 좋아져서 반응한다"처럼 유연하고 풍부한 설명으로 세상을 모델링할 수 있게 되는 것입니다.
요약
이 논문은 **"사람의 언어를 세포의 상태와 규칙으로 바꾸고, AI 가 그 언어를 읽어 다음 행동을 결정하게 하는 새로운 시뮬레이션 방법"**을 제안했습니다.
단순한 규칙 (산불) 에서는: 똑똑한 AI 일수록 기존 컴퓨터처럼 정확했습니다.
자유로운 규칙 (인공 생명) 에서는: AI 모델마다 각자 다른 개성 (간단한 기호 vs 복잡한 법률 용어) 을 보여주며, AI 가 시뮬레이션 결과에 큰 영향을 미친다는 것을 증명했습니다.
결론적으로, AI 를 이용한 시뮬레이션은 '어떤 AI 를 쓰느냐'에 따라 완전히 다른 세계가 펼쳐질 수 있다는 것을 보여준 흥미로운 연구입니다.
1. 연구 배경 및 문제 제기 (Problem)
기존 CA 의 한계: 전통적인 셀룰러 오토마타 (Cellular Automata, CA) 는 셀의 상태를 정수나 실수와 같은 수치로 표현하고, 업데이트 규칙을 고정된 프로그램 코드로 정의합니다. 이는 물리 현상 (유체 역학, 산불 등) 이나 교통 흐름과 같은 특정 시뮬레이션에는 효과적이지만, 인간의 언어가 가진 높은 표현력 (expressive power) 과 뉘앙스를 반영하기 어렵습니다.
LLM 의 가능성: 최근 대규모 언어 모델 (LLM) 은 방대한 텍스트 데이터를 학습하여 상식 추론 (Winograd Schema Challenge 등) 에서 높은 성과를 보였습니다. 이는 인간이 생성한 언어가 세계의 상당 부분을 정교하게 묘사하고 있음을 시사합니다.
핵심 질문: 셀의 상태와 업데이트 규칙을 모두 **자연어 (Natural Language)**로 표현하고, 그 업데이트를 LLM 에게 위임한다면 어떻게 될까요? 이를 통해 수치적 제약과 고정된 규칙을 넘어선 더 풍부하고 유연한 시뮬레이션 플랫폼을 구축할 수 있을까요?
2. 방법론 (Methodology)
저자는 **LOGOS-CA (Language Oriented Grid Of Statements – Cellular Automaton)**라는 새로운 프레임워크를 제안했습니다.
기본 구조:
2 차원 격자 (Grid) 형태의 셀로 구성됩니다.
각 셀은 수치 대신 **자연어 설명 (Description)**을 상태 (State) 로 가집니다.
각 셀의 업데이트 규칙 또한 자연어로 기술됩니다.
작동 원리:
입력: 타겟 셀의 현재 상태 설명과 그 주변 8 개 셀 (Moore Neighborhood) 의 상태 설명을 LLM 에게 프롬프트로 제공합니다.
처리: LLM 은 주어진 문맥과 규칙을 바탕으로 타겟 셀의 다음 상태에 대한 자연어 설명을 생성합니다.
출력: 생성된 JSON 형식의 다음 상태 설명이 셀에 저장되어 다음 단계로 넘어갑니다.
실험 설계:
산불 시뮬레이션 (Forest Fire): 전통적인 산불 CA 규칙 (불타는 셀은 재가 됨, 나무는 주변에 불이 있으면 타는 등) 을 자연어로 정의하여 LOGOS-CA 가 명시적 규칙을 얼마나 정확하게 따르는지 검증했습니다.
인공생명 (Artificial Life, ALife): 규칙을 더 자유롭게 설정하여 (예: 주변 셀에 무작위 문자 생성, 빈 공간 유지 등) 다양한 LLM 이 어떻게 창의적이고 복잡한 상태를 진화시키는지 관찰했습니다.
사용 모델: OpenAI 의 GPT-4o-mini, GPT-4o, GPT-5-nano, GPT-5-mini, GPT-5 등 다양한 모델 비교.
3. 주요 결과 (Results)
A. 산불 시뮬레이션 (규칙 준수 능력)
성공: GPT-4o 와 GPT-5 는 표준 시뮬레이션과 완전히 일치하는 결과를 보여주며, 명시적 규칙을 정확하게 따르는 능력을 입증했습니다.
실패: GPT-4o-mini 와 GPT-5-nano 는 초기 단계 (t=1) 에서 시뮬레이션이 붕괴되었습니다. 규칙을 따르지 않거나 포맷 (JSON 등) 을 위반하는 오류가 발생했습니다.
원인: 모델의 추론 능력 차이와 온도 (Temperature) 설정 (모든 모델을 1 로 고정) 이 영향을 미쳤을 것으로 분석됩니다.
B. 인공생명 시뮬레이션 (유연성과 모델 특성)
모델별 특징의 극명한 차이:
GPT-5-nano: 짧은 문장을 사용하며, 스스로 **상징적 상태 정의 (Symbolic State Definitions)*를 발명했습니다. (예: 'A', 'Q', '' 등의 문자를 상태 코드로 정의하고 이를 전파). 상태 변화가 역동적이고 불안정했습니다.
GPT-5-mini: 매우 길고 복잡한 문장을 사용하며, 법적/기술적 문서 스타일 (인과관계, 배제 조건, 필요 조건 등) 을 사용했습니다. 시각적 특징 (고주파 스펙클, 장식품 등) 을 묘사하는 표현을 사용했으며, 시스템이 빠르게 안정화되는 경향을 보였습니다.
동역학: GPT-5-nano 는 시뮬레이션 내내 높은 변화율 (Cosine distance) 을 유지한 반면, GPT-5-mini 는 초기에 급격히 안정화되었습니다. 이는 모델 선택이 시뮬레이션 결과의 성격을 결정짓는 핵심 요소임을 보여줍니다.
4. 주요 기여 (Key Contributions)
LOGOS-CA 프레임워크 제안: 셀룰러 오토마타의 상태와 규칙을 자연어로 정의하고 LLM 으로 구동하는 새로운 패러다임을 제시했습니다.
시뮬레이션의 표현력 확장: 수치적 한계를 넘어, 화학 반응, 재료 파괴, 사회 현상 (교통, 경제) 등 인간의 의도와 뉘앙스가 포함된 복잡한 상호작용을 시뮬레이션할 수 있는 가능성을 열었습니다.
LLM 기반 시뮬레이션의 특성 규명:
명시적 규칙이 있는 경우 (산불) 는 고성능 LLM 이 정확한 추론이 가능함을 보였습니다.
유연한 규칙 (ALife) 의 경우, 모델마다 고유한 '언어적 성향'과 '규칙 해석 방식'이 시뮬레이션 결과에 직접적으로 반영됨을 발견했습니다. 즉, 결과는 모델의 선택에 따라 달라질 수 있음을 경고했습니다.
5. 의의 및 한계 (Significance & Challenges)
의의:
새로운 ALife 연구 도구: 자연어 기반의 진화와 상호작용을 연구할 수 있는 풍부한 플랫폼을 제공합니다.
복잡계 모델링: 인간의 의사결정, 사회적 상호작용 등 정량화하기 어려운 요소를 언어를 통해 모델링할 수 있는 길을 열었습니다.
LLM 의 세계 모델 검증: LLM 이 내부적으로 구축한 세계 모델이 어떻게 시뮬레이션 규칙을 해석하고 적용하는지 관찰할 수 있는 창구가 됩니다.
한계 및 과제:
모델 의존성 (LLM Dependency): 결과가 모델의 성향에 크게 좌우되므로, 특히 유연한 규칙이 적용된 시뮬레이션에서는 결과 해석 시 모델 선택의 영향을 고려해야 합니다.
비용 및 확장성 (Cost & Scalability): 각 셀마다 LLM 추론이 필요하므로 시간과 비용 (토큰 사용량) 이 매우 큽니다. (실험 기준 최대 약 $91 소요). 병렬 처리와 KV 캐시 공유 등의 기술적 최적화가 필요합니다.
일관성 문제: 일부 모델은 규칙을 따르지 않거나 포맷 오류를 일으켜 시뮬레이션이 붕괴될 수 있습니다.
결론
이 논문은 자연어와 LLM 을 셀룰러 오토마타에 접목하여 LOGOS-CA를 성공적으로 구현하고 검증했습니다. 이는 단순한 수치 시뮬레이션을 넘어, 언어의 표현력을 통해 더 복잡하고 인간적인 현상을 모델링할 수 있는 가능성을 보여주었으나, 동시에 LLM 의 특성으로 인한 결과의 변동성과 높은 계산 비용을 해결해야 할 과제를 제시합니다.