Grammar Engineering Meets LLMs: Development of Cantonese and Irish ParGram Treebanks
이 논문은 Parallel Grammar Project 내에서 광둥어와 아일랜드어 트리뱅크의 개발을 상세히 다루는 동시에, 문법 공학에서 다국어 거대언어모델(LLM)의 유용성을 평가하며, 이러한 모델들이 대안적 분석을 제안하는 데는 제한적인 가치를 제공하지만 현재로서는 전문가 주도의 언어적 검증을 대체하는 데 필요한 교차 언어적 추상화 능력이 부족하다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
단순히 단어를 넘어, 문장을 작동하게 만드는 깊고 보이지 않는 규칙들을 위한 보편적인 정신 번역기를 구축한다고 상상해 보십시오. 이것은 **문법 공학(grammar engineering)**의 세계입니다. 이것을 단순히 집을 그리는 건축가가 아니라, 로봇에게 벽돌을 한 장 한 장 어떻게 쌓아야 하는지, 지붕이 무너지지 않도록 명령하는 실제 코드를 작성하는 설계자가 되는 것에 비유해 보십시오. 이를 위해 언어학자들은 **트리뱅크(treebanks)**라고 불리는 특별한 지도를 사용합니다. 만약 문장이 하나의 건물이라면, 트리뱅크는 모든 단어가 서로 어떻게 연결되는지, 즉 누가 누구에게 무엇을 했는지를 포착하여 보여주는 설계도입니다. 하지만 까다로운 점은, 강물처럼 흐르는 언어와 개구리처럼 뛰어오르는 언어처럼 매우 다른 두 언어를 위해 이 설계도를 만들려고 할 때, 표면적인 세부 사항은 다르게 두면서도 핵심 구조는 동일하게 유지하는 마스터 플랜이 필요하다는 것입니다. 이것이 바로 **병렬 문법(parallel grammar)**의 과제입니다. 즉, 문장의 "옷"은 완전히 다르더라도 그 "영혼"은 언어 간에 동일하도록 만드는 것입니다.
이제 이 분야의 새로운 신성인 **대규모 언어 모델(LLM)**이 등장했습니다. 이들은 인터넷의 거의 모든 것을 읽은 매우 똑똑한 AI 챗봇들입니다. 이들은 문장에서 다음에 올 단어를 추측하는 데는 뛰어나지만, 문법의 깊은 구조적 규칙을 실제로 이해할 수 있을까요? 이들이 인간 설계자들이 이러한 설계도를 더 빠르게 구축하도록 도울 수 있을까요, 아니면 천장에 문을 달아버린 집을 실수로 짓게 될지도 모르는 화려한 추측가에 불과할까요? 이 논문은 바로 그 질문을 던지며, 매우 이질적인 두 언어인 광둥어(단어 어미가 거의 없는 중국 남부의 언어)와 아일랜드어(많은 단어 어미와 다른 어순을 가진 켈트어족 언어)를 사용합니다. 연구진은 AI가 이 두 언어 사이를 번역하고 올바른 문법적 설계도를 그려내어, 인간 전문가의 유능한 조수 역할을 할 수 있는지 확인하고자 했습니다.
실험: 문법 견습생으로서의 AI
연구진은 특정 AI 모델(OpenAI의 gpt-oss-120b)을 대상으로 테스트 드라이브를 설정하고 50개의 문장 뭉치를 주었습니다. 이 문장들은 단순한 진술부터 관계절과 까다로운 동사 구조를 포함한 복잡한 문장에 이르기까지 모든 것을 다루는 문법을 위한 "운전면허 시험"과 같았습니다. 그들은 AI에게 두 가지 주요 작업을 수행하도록 요청했습니다:
- 번역: 광둥어를 아일랜드어로, 또는 그 반대로 바꾸기.
- 설계도 그리기: 표면적인 순서는 무시하고 단어 사이의 깊은 관계를 보여주는 공식적인 문법 지도(f-구조)를 만들기.
그들은 세 가지 방식으로 이를 시도했습니다: 영어로 질문하기, 대상 언어로 질문하기, 그리고 번역과 설계도를 동시에 수행하도록 요청하기.
결과: 찬사와 혼란이 뒤섞인 성적표
결과는 마치 재능은 있지만 혼란스러워하는 견습생를 보는 것과 같았습니다. AI는 때때로 큰 그림을 볼 수 있음을 보여주었지만, 세부 사항에서는 자주 비틀거렸습니다.
번역의 어려움
번역에 있어서 AI는 몹시 고전했습니다. 이는 어휘는 알지만 방언을 계속 헷갈려 하는 학생과 같았습니다.
- "만다린" 혼동: 광둥어로 말하라는 요청을 받았을 때, AI는 자주 만다린(표준 중국어)으로 미끄러졌습니다. 예를 들어, 올바른 광둥어인 hóu lèk 대신 hǎo bàng(대단하다)이라는 단어를 사용했습니다. 이는 누군가에게 스코틀랜드 억양으로 말해달라고 요청했는데, 실수로 미국 속어를 사용하는 것과 같습니다.
- "지어낸" 단어들: 아일랜드어로 번역할 때, AI는 단순히 실수하는 것에 그치지 않고 단어를 만들어냈습니다. "트랙터"(tarracóir)라는 단어는 때때로 "방수포", "강도", "토끼", 심지어 "도둑"으로 변했습니다. 이는 실제 의미를 알기보다는 그 단어가 어떻게 들리는지나 문맥에 기반해 추측한 것으로 보였습니다.
- 성공률: 수치는 냉혹했습니다. 아일랜드어에서 광둥어로 번역할 때, 의미가 정확하고 자연스러운 번역은 약 **22%에서 24%**에 불과했습니다. 광둥어에서 아일랜드어로의 번역은 더 낮아, 목표를 달성한 비율이 **6%에서 8%**뿐이었습니다. 흥ari롭게도, 지시 사항(프롬프트)의 언어를 바꾸는 것은 전혀 도움이 되지 않았습니다. AI는 영어로 요청하든 대상 언어로 요청하든 똑같이 저조한 성적을 보였습니다.
설계도 그리기
문법적 설계도(f-구조)를 그리는 작업에서 AI는 약간 더 나은 모습을 보였지만, 여전히 갈 길이 멀었습니다.
- 영어는 쉬웠다: 영어 문장의 경우, AI는 약 **46%**의 확률로 정답을 맞혔습니다("우수" 또는 "좋음" 등급).
- 광둥어는 괜찮았다: 광둥어의 경우, 올바른 구조 분석을 약 **34%**의 확률로 해냈습니다.
- 아일랜드어는 어려웠다: 아일랜드어의 경우 성공률이 **20%**로 떨어졌습니다. 연구진은 이것이 아일랜드어가 더 복잡한 단어 어미와 다른 문장 순서(동사-주어-목적어)를 가지고 있어 AI가 익숙하지 않기 때문이라고 추측합니다.
- "공유된" 설계도의 과제: 가장 어려운 작업은 광둥어와 아일랜드어 사이의 공유된 깊은 구조를 찾도록 하는 것이었습니다. 여기서 AI는 대부분 실패했으며, 광둥어-아일랜드어 시도는 44%, 아일랜드어-광둥어 시도는 **38%**가 "나쁨" 등급을 받았습니다. AI는 표면적인 차이는 무시하면서 공통된 규칙을 추상화하는 데 어려움을 겪었습니다.
AI가 틀린 부분 (그리고 맞은 부분)
AI가 완전히 쓸모없는 것은 아니었습니다. AI는 세부 사항이 엉망일지라도 약 **70%**의 사례에서 기본적인 "누가 무엇을 했는지"에 대한 관계를 포착해 냈습니다. 또한 때때로 문장을 바라보는 흥미로운 대안적 관점을 제시하여 인간 언어학자에게 아이디어를 줄 수도 있었습니다.
그러나 오류는 시사하는 바가 컸습니다.
- 고정관념: AI는 "농부"와 "운전자"가 항상 남성이라고 가정하며, 광둥어나 아일랜드어 모두에서 이 단어들에 성별 구분이 필요 없음에도 불구하고 남성형 태그를 부여했습니다. 이는 언어의 규칙이 아니라 자신의 "세상 지식"에 의존한 것이었습니다.
- 개념 혼동: AI는 관계절(예: "내가 산" 자동차)을 직접 목적어처럼 취급하는 등 다양한 문장 구조의 유형을 자주 혼동했습니다. 이는 이론적 차이를 완전히 이해하지 못했음을 보여줍니다.
- 환각(Hallucinations): AI는 "강에서 목욕했다"를 "강에서 익사했다"로 번역하는 것처럼 단어와 의미를 지어내어 이야기를 완전히 바꿔버렸습니다.
결론
본 논문은 이러한 AI 모델들이 강력한 도구이기는 하지만, 복잡한 문법을 구축하는 데 있어 인간 전문가를 대체할 준비가 되어 있지 않다고 결론짓습니다. AI는 "초안"이나 아이디어의 힌트를 제공할 수는 있지만, 세부 사항을 정확하게 처리할 것이라고 믿을 수는 없습니다. AI는 아주 빠르고 자신만만한 학생과 같지만, 책을 많이 읽었을 뿐 실제로 견고한 집을 짓기 위한 기술을 충분히 연습하지 못한 상태입니다.
연구진은 인간의 전문성이 여전히 필수적임을 강조합니다. AI의 출력물은 해당 언어를 진정으로 이해하는 사람에 의한 세심한 검토와 검증이 필요합니다. 이 연구는 AI 모델이 이러한 "자원이 부족한" 언어들에 대해 훨씬 더 구체적이고 고품질인 데이터로 학습되기 전까지는, 신뢰할 수 있는 파트너라기보다 하나의 흥미로운 현상에 머물 것임을 시사합니다. 완전히 자동화된 문법 구축기의 꿈은 아직 멀리 있으며, 이번 실험은 현재의 기술이 정확히 어디에서 자신의 신발 끈에 걸려 넘어지는지를 밝혀내는 데 도움을 주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.