Control-aware training of physical neural networks for closed-loop regulation
이 논문은 정적 회귀 정확도보다 후보 행동 순위 보존을 우선시하는 제어 인지 목적 함수를 사용하여 물리적 신경망을 최적화하는 것이 항상성 조절 및 카트-폴 안정화와 같은 작업에서 폐루프 제어 성능과 섭동에 대한 강건성을 유의미하게 향상시킨다는 것을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 컴퓨팅의 세계에는 실리콘 칩뿐만 아니라 우주의 가공되지 않은 물리 법칙 자체로 사고하는 기계를 구축하려는 움직임이 커지고 있습니다. 이것들은 물리적 신경망(physical neural networks)이라 불립니다. 표준 컴퓨터에서 뇌를 시뮬레이션하는 대신, 이 시스템들은 빛이 유리를 통과하거나 작은 기계적 진동자가 흔들리는 것과 같은 실제의 제어 가능한 물리적 과정을 사용하여 계산을 수행합니다. 이들은 빠르고 효율적이지만, 동시에 무질서합니다. 물리적 세계는 온도 변화, 미세한 제조 차이, 무작위 노이즈와 같은 작고 피할 수 없는 결함들로 가득 차 있습니다. 표준 프로세서에서 컴퓨터 프로그램이 실행될 때는 이러한 미세한 오류들이 대개 큰 문제가 되지 않습니다. 하지만 기계가 막대기의 균형을 잡거나 화학 반응을 조절하는 것처럼 실시간으로 무언가를 제어하는 데 사용될 때, 계산에서의 아주 작은 실수조차 잘못된 결정으로 이어질 수 있습니다. 만약 제어기가 최선의 움직임을 결정할 때 아주 미세한 차이로 판단을 그르친다면, 그것은 약간 더 나쁜 행동을 선택하게 될 수 있습니다. 피드백 루프 내에서 그 작은 오류는 누적되어 결국 실패로 이어지는 경로로 시스템을 몰아넣을 수 있습니다. 과학자들의 핵심 질문은, 이 물리적 기계들이 자신의 결함을 무시하고, 계산된 숫자가 약간 틀리더라도 올바른 선택을 하도록 훈련될 수 있는가 하는 것입니다.
유잔 장(Yuzhan Zhang)이라는 연구자는 이 기계들을 어떻게 가르쳐야 하는지에 대한 다른 질문을 던짐으로써 이 문제에 접근했습니다. 전통적으로 엔지니어들은 수학 시험의 모든 정답을 정확히 맞히려는 학생처럼, 물리적 시스템의 출력값이 완벽한 목표치와 최대한 가깝게 일치하도록 노력함으로써 이 시스템들을 훈련시킵니다. 장의 연구는 물리적 시스템을 제어하는 기계의 경우, 숫자를 정확하게 맞추는 것이 가장 중요한 목표가 아님을 시사합니다. 대신, 가장 중요한 목표는 기계가 올 обознача (denoting) 올바른 '순서'의 행동을 선택하도록 보장하는 것입니다. 만약 제어기가 왼쪽으로 움직일지 오른쪽으로 움직일지를 결정해야 한다면, "왼쪽"과 "오른쪽"의 정확한 값을 마지막 소수점 자리까지 알 필요는 없습니다. 단지 "왼쪽"이 "오른쪽"보다 충분한 차이로 더 낫다는 것을 알면 됩니다. 이 연구는 물리적 네트워크를 단순히 수치적 오류를 최소화하는 것이 아니라 이러한 선택의 순위를 보호하도록 훈련함으로써, 현실 세계에서 문제가 발생했을 때 시스템이 훨씬 더 견고해진다는 것을 보여줍니다.
이 아이디어를 테스트하기 위해, 연구자는 시뮬레이션 상에서 두 가지 다른 유형의 물리 컴퓨팅 시스템을 구축했습니다. 한 시스템은 연못의 파도가 겹치는 것과 유사하게 빛이 스스로 간섭하는 모델을 사용했고, 다른 하나는 진자처럼 앞뒤로 흔들리는 24개의 연결된 작은 진동자 네트워크를 사용했습니다. 이 시스템들은 항상성 조절(homeostatic regulation)이라는 작업을 수행하도록 부여받았습니다. 이는 에너지나 온도와 같은 내부 변수들을 안전하고 건강한 범위 내에 유지하는 작업입니다. 시스템은 위험한 상태를 피하기 위해 에너지를 충전할지, 온도를 낮출지, 혹은 스스로를 수리할지를 끊임없이 결정해야 했습니다. 연구자는 각 시스템에 대해 두 가지 버전의 제어기를 훈련시켰습니다. 첫 번째 버전은 전통적인 방식으로, 완벽한 숫자에 최대한 가깝게 일치시키도록 훈련되었습니다. 두 번째 버전은 숫자가 다소 흐릿하더라도 최선의 행동에 대한 순위를 유지하는 데 집중하는 새로운 방식으로 훈련되었습니다.
결과는 놀라웠습니다. 정상적이고 완벽한 조건에서 테스트했을 때, 두 제어기는 거의 동일하게 작동했습니다. 그들은 동일한 결정을 내렸고 거의 비슷한 효율로 내부 변수들을 안전 지대 내에 유지했습니다. 그러나 진정한 시험은 연구자가 센서의 무작위 노이즈나 기계의 물리적 특성의 미세한 변화와 같은 현실적인 교란을 도입했을 때 찾아왔습니다. 전통적인 제어기는 흔들리기 시작했습니다. 그것은 더 높은 비용과 더 큰 실패 위험을 초래하는 선택을 하기 시작했습니다. 반면, 순위에 초점을 맞춘 새로운 방식으로 훈련된 제어기는 자리를 지켰습니다. 빛 기반 시스템에서, 이 새로운 접근 방식은 중간 정도에서 강한 교란에 직면했을 때 생존을 유지하는 비용을 거의 18% 감소시켰습니다. 진동자 시스템에서는 그 개선 폭이 더욱 극적이었으며, 비용을 거의 29% 절감했습니다. 결정적으로, 이 개선은 새로운 제어기가 정확한 숫자를 예측하는 능력이 더 뛰어나서 나타난 것이 아니었습니다. 사실, 일부 테스트에서 이 모델의 가공된 수치적 예측은 전통적인 모델보다 약간 더 나빴습니다. 이 이점은 전적으로 무질서한 환경에서도 선택의 올 и (and) 올바른 순서를 유지하는 능력에서 비롯되었습니다.
이 발견이 특정 작업에 국한된 우연이 아님을 확인하기 위해, 연구자는 기계가 움직이는 카트 위에서 막대의 균형을 잡아야 하는 카트-폴(Cart-Pole)이라는 고전적인 제어 문제에 이 방법을 테스트했습니다. 이는 제어 시스템의 표준 테스트로, 항상성 작업과는 무관합니다. 여기서도 두 제어기는 숫자를 예측하는 능력이 거의 동일하도록 맞춰졌습니다. 시스템이 강한 교란을 받았을 때, 행동의 순위를 보호하도록 훈련된 제어기는 전통적인 제어기에 비해 실패율을 절반 이상 줄였습니다. 그것은 폴의 균형을 훨씬 더 오래 유지하며, 다른 모델이 빠르게 실패한 수백 단계를 버텨냈습니다. 연구는 또한 새로운 제어기가 단순히 더 신중해져서, 즉 위험을 피하기 위해 일을 덜 하는 것인지 확인하기 위해 조사했습니다. 두 시스템이 동일한 양의 일을 하도록 강제했을 때 두 시스템을 면밀히 비교함으로써, 연구자는 개선된 성능이 노력의 감소나 게으름 때문이 아님을 확인했습니다. 새로운 제어기는 진정으로 순간에 올바른 결정을 내리는 데 더 뛰어났으며, 이를 통해 시스템이 위험한 상태로 표류하는 것을 방지했습니다.
연구에는 또한 시뮬레이션에서 사용된 난이도가 현실적인지를 확인하기 위해 다른 실험의 실제 데이터와 대조하는 과정도 포함되었습니다. 연구 결과, 테스트에 사용된 교란은 다른 과학 논문에서 보고된 실제 물리 컴퓨팅 하드웨어에서 나타나는 오류와 유사한 수준이었습니다. 이는 시뮬레이션에서 발견된 개선 사항이 향로 구축될 수 있는 실제 기계에도 유효함을 시사합니다. 이 연구는 물리 컴퓨팅의 모든 문제를 해결했다고 주장하는 것이 아니며, 진동자 시스템에 대한 한 가지 특정 테스트에서 개선 효과가 엄격한 성공 임계치에 도달하지 못했음을 인정합니다. 그러나 전체적인 패턴은 명확합니다: 물리적 기계가 피드백 루프에 포함되어 있을 때, 선택의 결과에 신경 쓰도록 훈련하는 것이 완벽한 계산기가 되도록 훈련하는 것보다 더 효과적입니다. 연구는 폐쇄 루프 제어(closed-loop control)를 위해서는 숫자의 정밀도보다 결정의 구조가 더 중요하다고 결론짓습니다. 이러한 물리적 네트워크가 선택의 올바른 순서를 가치 있게 여기도록 가르침으로써, 엔지니어들은 피할 수 없는 물리적 세계의 무질서함에 훨씬 더 탄력적으로 대응할 수 있는 시스템을 구축할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.