← 최신 논문
💻 computer science

Robust Score-Based Generative Modelling withTsallis–Gaussian Perturbations

본 논문은 헤비테일(heavy-tailed) 데이터와 오염의 영향을 효과적으로 완화하면서도 경쟁력 있는 생성 성능을 유지하기 위해, 탈리스-가우시안(Tsallis–Gaussian) 섭동과 듀얼 헤드 신경망 구조를 사용하는 강건한 스코어 기반 생성 모델링 프레임워크를 제안한다.

원저자: Shenghan Gao, Spiridon Penev, Libo Li

게시일 2026-07-15
📖 5 분 읽기🧠 심층 분석

원저자: Shenghan Gao, Spiridon Penev, Libo Li

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 그림을 그리거나, 주식 시장의 폭락을 예측하거나, 새로운 화학 화합물을 발명하도록 가르치려 한다고 상상해 보십시오. 로봇은 실제 사례를 관찰하며 학습하지만, 한 가지 까다로운 습관이 있습니다. 바로 "노이즈(noise)"나 이상한 "아웃라이어(outliers, 이상치)"에 쉽게 혼란을 느낀다는 점입니다. 만약 당신이 로봇에게 가운데에 거대하고 빛나는 보라색 사각형이 있는 고양이 사진을 보여준다면, 일반적인 로봇은 그 이상한 사각형에 너무 정신이 팔려 고양이를 그리는 법 자체를 잊어버릴 수도 있습니다.

이 논문은 이러한 로봇을 가르치는 새로운 방법인 TSMLD(Tsallis Score-Based Generative Modelling with Langevin Dynamics)를 소개합니다. 이것은 로봇에게 "스마트 노이즈 캔슬링 헤드폰"과 "유연한 자"를 쥐여주어, 지저지고 복잡한 현실 세계의 데이터로부터 휘둘리지 않고 학습할 수 있게 해주는 것과 같습니다.

문제점: "가우시안(Gaussian)"의 함정

대부분의 현재 로봇 화가들은 가우시안(또는 "종 모양 곡선") 노이즈를 기반으로 한 방법을 사용합니다. 이 노이즈를 부드럽고 예측 가능한 비라고 상상해 보십시오. 빗방울이 로봇의 코에 떨어지면 그것은 작고 관리할 수 있는 톡 치는 정도입니다. 하지만 현실 세계의 데이터는 항상 부드러운 비와 같지는 않습니다. 때로는 우박 폭풍이 몰아치거나, 갑자기 거대한 바위가 언덕 아래로 굴러떨어지기도 합니다.

금융 데이터(주식 가격 등)나 복잡한 현실 세계의 데이터셋에서 이러한 "바위"들은 **헤비 테일(heavy tails, 두꺼운 꼬리)**이라고 불립니다. 이는 드물지만 극단적인 사건들입니다. 예를 들어, 하루 만에 시장이 20% 폭락하는 것과 같습니다. 표준 가우시안 로봇은 이 거대한 바위들을 그저 "매우 큰 빗방울"로 취급합니다. 이들의 수학적 구조는 선형적이기 때문에, 거대한 바위가 나타나면 로봇의 두뇌는 통제 불능 상태에 빠져 잘못된 교훈을 얻게 됩니다. 이는 마치 누군가 당신에게 앤빌(무거운 철제 추)을 계속 던지는 와중에 자전거 타기를 배우려는 것과 같습니다. 당신은 앤빌를 피하는 법은 배울지 모르지만, 자전거를 타는 법은 결코 배우지 못할 것입니다.

해결책: "탈리스(Tsallis)" 업그레이드

저자들은 부드러운 비 대신 **Tsallis–Gaussian 섭동(perturbations)**을 사용하는 것을 제안합니다.

1. 유계된 "재하강(Redescending)" 스코어 (스마트 헤드폰)
기존 방식에서는 로봇이 거대한 오류(바위)를 발견하면, "에러! 에러!"라고 무한대의 볼륨으로 비명을 질렀습니다. 새로운 방식은 유계된(bounded) Tsallis 스코어를 사용합니다.

  • 비유: 로봇의 에러 신호가 볼륨 조절기라고 상상해 보십시오. 기존 시스템에서는 큰 실수가 발생하면 볼륨 조절기가 "최대"로 돌아가고 계속해서 더 높였습니다. 새로운 시스템에는 볼륨 조절기에 **하드 스톱(hard stop, 제한 지점)**이 있습니다. 설령 바위가 로봇을 들이받더라도, 로봇이 듣는 노이즈는 안전한 수준에서 캡(cap)이 씌워집니다.
  • 결과: 로봇은 극단적인 아웃라이어의 비명 소리를 무시합니다. 즉, 거대한 금융 위기나 이미지의 손상된 픽셀을 "시끄럽긴 하지만 무한대는 아닌 것"으로 취급합니다. 이를 통해 로봇이 극단적인 사건에 과잉 반응하는 것을 방지합니다로.

2. 적응형 가중치 (스마트 필터)
두 번째 기술은 **밀도 비율 가중치(density-ratio weight)**입니다.

  • 비유: 로봇이 교실에 있다고 상상해 보십시오. 만약 어떤 학생(데이터 포인트)이 선생님(모델)이 예상하는 위치에 앉아 있다면, 선생님은 주의 깊게 경청합니다. 하지만 만약 아무도 있을 법하지 않은 곳(이상하고 가능성이 낮은 아웃라이어)에 학생이 나타난다면, 선생님은 부드럽게 말합니다. "알겠어, 너를 보고는 있지만, 너 때문에 내 수업 계획 전체를 바꾸지는 않을 거야."
  • 결과: 로봇은 패턴에 부합하는 데이터에는 볼륨을 높게 유지하면서, 어울리지 않는 것처럼 보이는 데이터(아웃라이어)에 대해서는 자동으로 볼륨을 낮춥니다. 이것을 **샘플 수준의 강건성(sample-level robustness)**이라고 합니다.

실험 결과

저자들은 이 새로운 로봇을 세 가지 다른 놀이터에서 테스트했습니다.

1. 합성 데이터 (훈련 체육관)
그들은 "오염(corruptions)"(예: 무작위 특징을 순수 노이즈로 교체)이 포함된 가짜 데이터를 사용했습니다.

  • 발견: 데이터가 깨끗할 때는 새로운 로봇도 기존 로봇만큼 뛰어났습니다. 하지만 "노이즈"를 던지기 시작했을 때(데이터의 20%, 30%, 심지어 50%를 오염시켰을 때), 새로운 로봇은 침착함을 유지했습니다.
  • 수치: HAR(인간 활동 인식) 데이터셋에서 데이터의 50%가 오염되었을 때, 기존 로봇의 정확도는 약 20.60% 하락했습니다. 반면, 특정 설정(q=1.35q=1.35)을 가진 새 로봇은 단 **16.15%**만 하락했습니다. 훨씬 더 잘 버텨낸 것입니다.

2. 이미지 (미술 수업)
그들은 로봇에게 얼굴과 옷을 그리는 법을 가르쳤습니다(MNIST, Fashion-MNIST, CIFAR-10).

  • 발견: 만약 훈련 이미지를 무작위로 검은색이나 흰색 픽셀로 오염시킨다면, 새로운 로봇은 훨씬 더 깨끗한 그림을 만들어냈습니다.
  • 수치: Fashion-MNIST에서 훈련 이미지의 40%를 오염시켰을 때, 기존 로봇의 품질 점수(FID)는 9.69(악화됨)로 치솟았습니다. 하지만 새 로봇은 이를 6.77로 유지했습니다. 그림들이 덜 "글리치(glitchy)"하고 더 실제 옷처럼 보였습니다.

3. 금융 데이터 (주식 시장)
이곳은 헤비 테일이 가장 중요한 곳입니다. 그들은 1990~2018년의 주식 시장 데이터로 로봇을 훈련시키고, 2020~2024년의 위기 기간 동안 어떤 일이 일어날지 예측하게 했습니다.

  • 발견: 표준 로봇(그리고 일부 특화된 금융 AI인 GAN까지도)은 시장이 얼마나 나빠질 수 있는지 과소평가하는 경향이 있었습니다. 그들은 시장이 실제보다 더 차분할 것이라고 생각했습니다. 새로운 로봇은 적절한 설정을 통해 "바위"가 올 것을 예상하도록 학습되었습니다.
  • 수치: FF48 포트폴리오의 경우, 실제 시장의 "첨도(Kurtosis, 꼬리가 얼마나 두꺼운지를 나타내는 척도)"는 12.6109였습니다.
    • 기존 가우시안 로봇은 5.0742라고 예측했습니다(너무 차분함).
    • q=1.5q=1.5를 적용한 새 로봇은 11.3833이라고 예측했습니다(현실에 훨씬 가까움).
    • 또한, 최악의 손실을 측정하는 CVaR에 대해서도, 기존 로봇의 -3.0053에 비해 새 로봇은 실제 위기 값인 -4.2470에 훨씬 근접한 -4.4913을 예측했습니다.

이 논문이 배제하는 것들 (주의사항)

저자들은 무엇이 효과가 없는지에 대해 매우 명확하게 밝히고 있습니다.

  • 노이즈만 바꾸는 것으로는 부족합니다: 만약 헤비 테일 노이즈를 사용하되, 기존의 "가우시안" 방식(로봇이 어떻게 학습할지 결정하는 손실 함수 계산법)을 그대로 유지한다면 실패합니다. 로봇은 꼬리 부분은 배울지 모르나, 일반적인 데이터 부분에서 망가질 것입니다.
  • 가중치만 바꾸는 것으로도 부족합니다: 만약 기존의 가우시안 노이즈를 유지하면서 "스마트 가중치"만 추가하려고 한다면, 이 역시 실패합니다. 로봇은 여전히 노이즈 자체가 너무 부드럽기 때문에 극단적인 "바위"들을 생성해낼 수 없습니다.
  • 크다고 항상 좋은 것은 아닙니다: 저자들은 "꼬리의 두꺼움"을 결정하는 파라미터(qq)를 너무 높게(예: q=1.6q=1.6) 설정하면, 로봇이 하지 않아도 될 극단적인 사건을 너무 많이 만들어내기 시작한다는 것을 발견했습니다. 이는 매일이 시장 폭락이라고 생각하는 로봇과 같습니다. 적절한 지점(sweet spot)은 보통 q=1.2q=1.2에서 $1.5$ 사이였습니다.

얼마나 확실한가요?

저자들은 자신들이 생성형 AI를 "해결했다"고 주장하지 않습니다. 대신 이 방법이 강건한(robust) 개선책임을 시사합니다.

  • 그들은 HAR, CIFAR-10, FF48과 같은 실제 데이터셋을 통해 결과를 측정했고, 한계를 테스트하기 위해 오염을 시뮬레이션했습니다.
  • 그들은 이 방법이 극단적인 사건을 다루는 것과 일반적인 데이터를 정확하게 유지하는 것 사이에서 더 나은 균형을 제시한다는 것을 발견했습니다.
  • 그들은 분산이 무한대인 매우 극단적인 경우에 현재의 수학적 모델이 더 많은 수정이 필요할 수 있음을 인정하지만, 수행된 테스트에서는 효과가 있었다고 밝혔습니다.

핵심 요약

이 논문은 AI에게 에러를 듣는 "유계된(bounded)" 방식과 이상한 아웃라이어를 무시하는 "스마트 필터"를 제공함으로써, 세상이 엉망이 되어도 무너지지 않는 모델을 구축할 수 있음을 시사합니다. 그것이 손상된 이미지 파일이든 갑작스러운 주식 시장의 폭락이든, 새로운 TSMLD 로봇은 침착함을 유지하고, 올바른 교훈을 배우며, 노이즈에 의해 주의가 분산되지 않습니다. 모든 것에 대한 마법의 탄환은 아니지만, 지저지고 헤비 테일이 존재하는 현실 세계를 위해서는 기존의 도구들보다 훨씬 더 튼튼한 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →