← 최신 논문
💬 NLP

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

AURORA-LM은 고용량의 디코딩 가능한 텍스트 표현 구축을 그 분포 모델링으로부터 분리하고, 쿼리 기반 인코더-디코더와 Ascend NPU 상에서 플로우 매칭(flow matching)으로 학습된 블록 인과적 확산 트랜스포머를 활용함으로써 최첨단 성능을 달성하는 연속 잠재 확산 언어 모델이다.

원저자: Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마치 인간 작가처럼 새로운 이야기를 꿈꿀 수 있는 기계를 만들려고 한다고 상상해 보세요. 오랫동안 과학자들은 기계에게 그림, 음악, 영상을 꿈꾸도록 가르치는 데 매우 능숙했습니다. 그들은 이러한 것들을 데이터의 매끄럽고 흐르는 강물처럼 다루었습니다. 예를 들어 파란색에서 보라색으로 변하는 색의 그라데이션이나, 한 음표에서 다른 음표로 미끄러지는 멜로디 같은 것 말이죠. 이 "연속적인" 방식은 이미지와 소리에는 아름답게 작동합니다. 하지만 언어에 있어서, 기계는 전혀 다른 세상에 갇혀 있었습니다. 바로 '레고 블록'의 세계입니다. 문장을 쓰기 위해 컴퓨터는 단어 혹은 단어의 일부인 '토큰'이라는 개별적이고 딱딱한 블록들을 하나씩 조립해야만 합니다. 이는 마치 단 하나의 딱딱한 도장만을 사용하여 걸작을 그리려는 것과 같습니다.

과학자들이 던져온 핵심적인 질문은 이것입니다. "우리가 그림을 만드는 데 사용하는 그 매끄럽고 흐르는 강물 같은 방식을 사용하여 기계에게 글쓰기를 가르칠 수 있을까?" 이 도전은 까다롭습니다. 언어는 정밀하기 때문입니다. 단어를 조금이라도 흐릿하게 만들면, 그것은 완전히 다른 단어가 되거나 의미 없는 낙서가 될 수 있습니다. 이 두 세계를 섞으려는 이전의 시도들은 종-종 타협을 해야 했습니다. 그들은 언어를 생성하기 쉽게 만들기 위해 아주 작고 흐릿한 형태로 찌그러뜨려야 했지만, 그러면 기계가 이를 다시 명확하게 읽어낼 수 없었습니다. 그것은 마치 투명 잉크로 소설을 쓴 다음, 독자가 단어를 알아맞히기를 바라는 것과 같았습니다.

여기에, "언어를 찌그러뜨리는 것을 멈추자"라고 말하는 새로운 접근 방식인 AURORA-LM이 등장했습니다. 연구진은 언어를 작은, 생성하기 쉬운 모양으로 강요하는 대신, 언어를 풍부하고 상세하게 유지하는 특별한 번역기를 구축하고, 생성기가 그 복잡성을 다룰 수 있도록 가르쳤습니다. 이렇게 생각해 보세요. 당신이 복잡한 조각상을 재현하고 싶다고 가정해 봅시다. 기존의 방법들은 "그냥 아주 작고 흐릿한 진흙 덩어리를 만든 다음, 나중에 그것이 조각상처럼 보이기를 바라자"라고 말할 것입니다. 하지만 AURORA-LM은 "아니, 진흙을 상세하고 고품질로 유지하고, 그 상세한 진흙을 망가뜨리지 않고 정확하게 빚어낼 줄 아는 더 똑똑한 조각가를 만들자"라고 말합니다.

연구진은 "언어를 상세하게 만드는 일"과 "이야지를 생성하는 일"을 분리함으로써 최선의 결과를 얻을 수 있다는 것을 발견했습니다. 그들은 (텍-트의 압축된 숨겨진 버전이라는 뜻의 전문 용어인) '잠재(latent)' 데이터를 매끄럽고 연속적인 흐름으로 생성하면서도, 이것이 다시 완벽한 단어로 바뀔 수 있을 만큼 충분히 상세하게 유지되는 시스템을 만들었습니다. 그들은 이 시스템을 두 가지 큰 과제, 즉 무작위 이야기 쓰기와 긴 뉴스 기사 요약에 테스트했습니다. 이 테스트에서 AURORA-LM은 동일한 방식을 시도하는 다른 방법들, 심지어 이미 존재하던 매우 큰 모델들보다 더 유창하고 정확하게 글을 쓸 수 있음을 시사했습니다.

또한 연구팀은 이 방식이 기계를 더 크게 만들수록 더욱 좋아진다는 것을 보여주었습니다. 그들은 이 모델을 약 10억 개의 파라미터(AI의 뇌가 얼마나 크고 복잡한지를 나타내는 척도) 규모로 확장했으며, 유사한 기술을 사용하는 공개된 더 큰 모델을 상대로도 여전히 강력한 성능을 발휘함을 확인했습니다. 핵심적인 교훈은, 기계가 생성하기 쉽게 만들기 위해 언어의 명료함을 희생할 필요가 없다는 것입니다. 생성의 매끄러운 세계와 단어의 정밀한 세계 사이에 더 똑똑한 다리를 건설함으로써, AURORA-LM은 기계가 곧 그림을 그리거나 노래를 부를 때 사용하는 것과 같은 유동적이고 연속적인 우아함으로 글을 쓸 수 있을 것임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →