← 최신 논문
💬 NLP

IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages

이 논문은 소외된 지역을 위한 다국어 대화형 AI를 발전시키기 위해 설계된, 9개 인도 계열 언어의 18개 변종에 걸친 130만 개 이상의 페르소나 기반, 이벤트 근거 코드 혼합 대화로 구성된 대규모 자동 생성 코퍼스인 IndicTalk을 소개한다.

원저자: Sahil Deepak Gawande, Mayank Singh

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sahil Deepak Gawande, Mayank Singh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대하고 북적이는 전 세계적인 마을 광장이라고 상상해 보세요. 오랫동안 영어 사용자들은 가장 큰 확성기를 가졌고 가장 편안한 벤치에 앉아 있었던 반면, 다른 언어 사용자들은 종종 소음 속에서 소리를 지르거나 주변부에 머물러야 했습니다. 인공지능의 세계에서 이 "마을 광장"은 컴퓨터가 대화하는 법을 배우는 곳입니다. 최근 이 컴퓨터들, 즉 거대 언어 모델(LLLLM)은 대화를 나누는 데 놀라울 정도로 능숙해졌지만, 주로 영어 사용자들의 말을 들으며 학습했습니다.

하지만 세계의 많은 지역에서 사람들은 단 하나의 언어만 사용하지 않습니다. 그들은 언어를 섞어서 사용합니다. 이것을 "코드 믹싱(code-mixing)"이라고 부릅니다. 친구가 이야기를 하다가 문장 중간에 갑자기 모국어에서 영어로 전환하거나, 심지어 자신의 모국어를 영어 알파벳으로 표기하는 것(예를 들어 "नमस्ते" 대신 "hello"라고 타이핑하는 것)을 상상해 보세요. 이것이 수십억 명의 사람들이 온라인에서 실제로 대화하는 방식입니다. 문제는 대부분의 AI 챗봇이 한 번에 한 가지 언어만 이해하는 엄격한 선생님과 같다는 점입니다. 언어를 섞어서 사용하면 혼란을 느끼기 때문에, 이렇게 혼합된 방식으로 말하는 수십억 명의 사람들과 자연스럽게 대화하는 데 어려움을 겪습니다. 이를 해결하기 위해서는 이 복잡하고 아름다운 언어의 혼합을 포착할 수 있는 방대한 연습 대화 라이브러리가 필요합니다.

바로 여기에 인도 언어들을 위한 정확히 그러한 종류의 라이브러리를 구축하는 거대한 새로운 프로젝트인 IndicTalk가 있습니다. 이 연구를 진행한 연구진들은 영어에 대한 데이터셋은 풍부하지만, 9개의 다양한 인도 언어 전반에서 일어나는 복잡한 혼합 언어 대화에 대해서는 거의 아무것도 없다는 사실을 깨달았습니다. 기존의 자원들은 규모가 너무 작거나, 하나의 언어 쌍(예: 힌디어와 영어)에만 집중되어 있거나, 완전한 흐름이 있는 대화가 아닌 단순한 문장 목록에 불과했습니다.

이를 해결하기 위해 팀은 완전히 자동화된 "대화 공장"을 만들었습니다. 수천 명의 사람을 고용하여 대화를 직접 쓰게 하는 대신, 그들은 실제 세상의 뉴스 기사에서 시작되는 파이프라인을 구축했습니다. 신문의 헤드라인을 가져와 주요 사실을 요약한 다음, 그 요약본을 매우 똑똑한 AI에게 전달하는 것을 상상해 보세요. 이 AI는 그 후 특정 "페르소나"—예를 들어 호기심 많은 친구, 엄격한 선생님, 또는 걱정 많은 가족—를 부여받고, 해당 뉴스 기사에 대해 대화를 나누도록 요청받습니다. 시스템은 이 과정을 반복하며 수백만 개의 채팅을 생성합니다.

그 결과, IndicTalk라는 거대한 데이터셋이 탄생했습니다. 여기에는 1,328,604개 이상의 다회차(multi-turn) 대화가 포함되어 있습니다. 이것들은 단순히 무작위적인 채팅이 아닙니다. 실제 사건에 근거하고 있으며, 벵골어, 힌디어, 타밀어, 텔루구어를 포함한 9개의 인도 언어에 걸친 18가지의 서로 다른 언어 변체를 다룹니다. 이 데이터셋이 특별한 이유는 두 가지 방식의 표기법을 모두 포착하고 있기 때문입니다: 전통적인 고유 스크립트(데바나가리 또는 타밀 스크립트 등)와 사람들이 휴대폰으로 메시지를 보낼 때 사용하는 방식인 로마자 표기(영어 알파벳으로 해당 언어를 타이핑하는 방식)입니다.

연구진은 단순히 데이터를 쏟아부은 것이 아니라, 엄격한 품질 검사를 거쳤습니다. 그들은 대화가 실제로 언어를 올바르게 섞었는지, 그리고 실수로 영어로만 넘어가거나 하나의 모국어로만 빠지지 않았는지 확인하기 위해 자동 필터를 사용했습니다. 또한 인간 전문가와 다른 강력한 AI 모델들이 심판 역할을 하여 채팅의 등급을 매겼습니다. 결과는 유망했습니다. 대화는 유창하고 일관되며, 실제 인간의 채팅처럼 자연스럽게 코드 믹싱이 되어 있다는 것이 밝혀졌습니다.

요컨대, 이 논문은 스마트하고 자동화된 파이프라인을 사용함으로써, 사람들이 말하는 실제의 혼합된 방식을 AI가 이해하도록 돕는 고품질의 대규모 자원을 만들 수 있음을 시사합니다. 저자들은 이것이 합성된(컴퓨터가 생성한) 대화이며 실제 인간의 대화가 가진 아주 작고 무질서한 결함들을 놓칠 수 있다고 언급했지만, 경직된 AI와 유동적인 다중 언어 생활 사이의 간극을 메울 수 있는 거대하고 다양한 데이터셋을 구축하는 것이 가능하다는 것을 성공적으로 입증했습니다. 이 데이터셋은 다른 사람들이 사용할 수 있도록 공개되어 있으며, 궁극적으로 글로벌 마을 광장에 마침내 소속감을 느낄 수 있는 챗봇과 음성 비서를 만드는 데 도움을 줄 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →