NEDOQwen: Diagnosing and Repairing a Turkish-Centric 0.824B Language Model
이 논문은 저비용의 감사 가능한 워크플로우를 통해 내부-외부 평가 불일치를 진단하고 미세 조정 및 수정을 통해 목표한 벤치마크 성능 향상을 달实现하는 과정을 보여주기 위해, 이러한 향상이 광범위한 역량과 동일한 것은 아니라는 경고와 함께 터키어 중심의 824M 파라미터 언어 모델인 NEDOQwen을 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
작은 뇌-봇들의 비밀스러운 삶
컴퓨터가 단순히 영어만 말하는 것이 아니라, 프랑스어부터 스와힐리어, 터키어에 이르기까지 수천 개의 다른 언어를 배우려고 노력하는 세상을 상상해 보세요. 이것이 바로 인공지능(AI), 구체적으로는 **자연어 처리(NLP)**라고 불리는 분야의 최전선입니다. 이 AI 모델들을 인터넷에 있는 거의 모든 것을 읽은 거대하고 디지털적인 뇌라고 생각해보세요. 이들은 패턴을 학습합니다. 예를 들어 여러분이 "고양이가 매트 위에..."라고 말하면, 다음에 올 단어가 "앉았다"일 가능성이 높다는 것을 알아내는 식입니다.
하지만 여기 까다로운 문제가 있습니다. 모든 뇌가 똑같이 만들어진 것은 아니라는 점입니다. 어떤 뇌는 세상에 쓰인 모든 책이 담긴 도서관을 가진 슈퍼컴퓨터처럼 거대합니다. 반면, **소형 언어 모델(SLM)**은 주머니 크기의 공책과 같습니다. 이들은 구축 비용이 저렴하고 실행 속도가 빨라서, 특정 작업이나 영어만큼 주목받지 못하는 언어에 적합합니다. 하지만 모델이 언어를 배우는 것처럼 보인다고 해서 실제로 이해하고 있다는 뜻은 아닙니다. 단어의 의미를 모른 채 단어의 형태만을 암기하고 있거나, 문제를 푸는 대신 가장 인기 있는 정답 알파벳을 찍어서 시험에서 부정행위를 하고 있는 것일 수도 있습니다.
연구자들은 특히 표준 컴퓨터 프로그램이 헷갈려 할 수 있는 독특한 블록 쌓기 방식의 문법을 가진 터키어와 같은 언어에 대해, 어떻게 하면 이 작고 저렴한 AI 뇌를 더 똑똑하고 정직하게 만들 수 있을지 끊임없이 고민하고 있습니다. 핵심 질문은 이것입니다: 우리는 작고 고군분투하는 AI 모델을 수정하여 진정으로 언어를 이해하게 만들 수 있을까요, 아니면 그저 속이는 법을 배우는 것뿐일까요?
NEDOQwen 이야기: 터키어 튜터의 변신
터키어를 말하도록 특별히 설계된 아주 작은 0.824-B(8억 2,400만) 파라미터 AI 모델인 NEDOQwen을 만나보세요. 이 모델을 터키어를 배우려고 노력 중이지만 기초 단계에서 어려움을 겪고 있는 학생이라고 생각해보세요. Ethosoft의 연구팀은 엄격하지만 도움이 되는 튜터 역할을 하기로 했습니다. 그들은 단순히 학생이 시험에 합격할 수 있는지 보고 싶었던 것이 아니라, 왜 학생이 실패하고 있는지 정확한 원인을 파악하고 근본적인 문제를 실제로 고칠 수 있는지 확인하기 위해 완전한 "진단 및 수리"를 수행하고자 했습니다.
진단: 단순히 정답의 문제가 아니다
먼저, 연구진은 NEDOQwen에게 일련의 테스트를 실시했습니다. 그들은 두 가지를 살펴보았습니다. 채팅에서 지시사항을 얼마나 잘 따르는지(내부 진단), 그리고 수학이나 역사 같은 학교 과목에 대한 객관식 질문에 얼마나 잘 답하는지(외부 벤치마크)였습니다.
놀라운 사실이 있었습니다. 모델은 채팅을 더 잘하게 되었습니다! 연구진이 학습을 위한 '깨끗한' 지시 세트를 제공하자, 대화 중에 어처구니없는 실수를 저지르는 일이 줄어들었습니다. 더 예의 바르게 들렸고 규칙도 더 잘 따랐습니다. 하지만, 어려운 객관식 테스트로 전환하자 모델은 여전히 형편없었습니다. 모델은 터키어 수학 및 과학 테스트(TurkishMMLU-sub)에서 약 18.11%, 일반 상식 테스트(TUMLU-mini)에서 **21.33%**를 기록했습니다. 참고로, 무작위로 찍었을 때 맞출 확률은 약 20% 또는 25% 정도입니다. 모델은 간신히 운을 이기고 있는 수준이었습니다.
연구진은 또한 AI의 "어휘 도구"라고 불리는 **토크나이저(tokenizer)**도 점검했습니다. 이것은 AI가 문장을 이해할 수 있는 덩어리로 나누는 부분입니다. 그들은 NEDOQwen이 터키어 전용으로 설계되었음에도 불구하고, 그 도구가 다른 범용 도구들보다 오히려 터키어 단어를 나누는 능력이 더 떨어진다는 것을 발견했습니다. 모델은 일부 단어를 "알 수 없는(UNK)" 상태로 남겨두었고, 같은 내용을 말하는 데 더 많은 덩어리를 사용했습니다. 이는 마치 학생에게 단어의 절반이 빠져 있고 정의가 혼란스러운 사전을 준 것과 같았습니다.
수리: 모델에게 속임수를 가르치고, 그 후 바로잡기
그래서 팀은 이를 고쳐보기로 했습니다. 그들은 모델에게 특별한 "수리" 과정을 제공했습니다. 이것은 단순히 더 많은 사실을 가르치는 것이 아니라, 시험을 치는 방법을 가르치는 것이었습니다. 그들은 모델에게 정답 알파벳(A, B, C, 또는 D)을 선택하는 방법과 응답 형식을 구성하는 방법을 보여주었습니다.
그들은 이 수리 과정을 600단계(짧은 학습 폭발) 동안 진행했습니다. 결과는 흥미로웠습니다:
- TurkishMMLU-sub 점수가 **18.11%**에서 **21.00%**로 올랐습니다.
- TUMLU-mini 점수는 **21.33%**에서 **32.22%**로 급증했습니다.
모델이 더 똑똑해지는 것처럼 보였습니다! 하지만 연구진은 더 깊이 파고들어 숨겨진 트릭을 발견했습니다. 그들은 모델이 반드시 더 많은 사실을 배우고 있는 것이 아니라, **교정(calibrate)**하는 법을 배우고 있다는 것을 깨달았습니다. 수리 전, 모델은 알파벳 C에 집착하고 있었습니다. 한 테스트에서 모델은 정답의 **85.9%**를 "C"라고 찍었습니다! 기본적으로 "C 찍기 기계"였던 셈입니다.
수리 후에는 "C"에 대한 집착이 줄어들었고, 모델은 "D"를 더 자주 선택하기 시작했습니다. 연구진은 새로운 사실을 전혀 가르치지 않고 오직 정답 알파벳을 고르는 법만 가르치는 특별한 테스트를 실행했습니다. 오직 그것만으로도 점수는 **19.56%**와 **27.00%**로 올라갔습니다. 이는 점수 향상의 큰 부분이 모델이 터키사나 수학을 갑자기 더 많이 알게 되어서가 아니라, 매번 똑같은 알파벳을 찍는 습관을 버루는 법을 배웠기 때문이라는 것을 증명했습니다.
판결: 더 나은 학생이 되었지만, 여전히 천재는 아니다
최종 판결은 희소식과 현실 자각이 섞여 있습니다. 수리는 효과가 있었지만, 부분적일 뿐이었습니다. 모델은 "C 찍기 기계"에서 벗어나 정답을 C와 D(각각 약 **47.6%**와 51.6%) 사이에서 분산하여 선택하기 시작했습니다. 또한 시험 형식을 따르는 능력이 좋아졌습니다.
그러나 이 모델은 터키어 천재가 아닙니다. 수학, 번역, 요약 작업에서는 여전히 실패합니다. 질문의 어조가 약간만 바뀌어도 여전히 실수를 저지릅니다. 연구진은 이 모델이 실전에 투입될 수 있는 "최첨단(state-of-the-art)" 모델이 아님을 강조합니다. 이것은 저비용의 투명한 실험입니다.
그들이 발견한 가장 중요한 점은 높은 시험 점수가 항상 AI가 더 똑똑하다는 것을 의미하지는 않는다는 것입니다. 때로는 그저 AI가 시험을 치는 법을 더 잘 배우게 된 것일 뿐입니다. 이러한 점을 밝혀냄으로써, 팀은 다른 연구자들을 위한 새로운 "워크플로우"를 만들었습니다: 내부 채팅을 확인하고, 외부 테스트를 확인하며, 토크나이저를 점검하고, 모델이 단순히 똑같은 알파벳을 반복해서 찍고 있는 것은 아닌지 확인하는 것입니다.
결국, NEDOQwen은 정직함에 대한 교훈을 줍니다. 이 모델은 영어가 아닌 소형 AI 모델의 경우, 작은 점수 상승을 큰 돌파구로 축하하기 전에 주의해야 함을 보여줍니다. 대신, 우리는 모델이 실제로 배우고 있는지, 아니면 그저 게임을 하는 법을 배우고 있는지를 확인하기 위해 내부를 들여다봐야 합니다. 연구진은 이 진실을 밝히기 위해 약 0.465 GPU-시간(대략 28분의 컴퓨터 시간)과 아주 적은 비용만을 사용했으며, 이는 고장 난 AI를 진단하는 데 슈퍼컴퓨터가 필요한 것이 아니라 좋은 현미경과 회의적인 시각이 필요하다는 것을 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.