Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task
플로리다 대학교 게이터스는 스페인어 중간 캡션 생성을 위한 Qwen2.5-VL 과 Gemini 2.5 Flash 를 활용한 검색 증강 다수 샷 프롬프팅을 결합한 2 단계 파이프라인을 도입하여 Bribri, Guaraní, Orizaba Nahuatl 언어의 문화적 이미지 캡션 생성에 관한 AmericasNLP 2026 공유 과제에서 우승했으며, 이는 베이스라인 대비 120% 이상의 성능 향상을 달성한 것입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
한 커뮤니티가 드물고 고대 언어를 사용한다고 가정해 보십시오. 당신은 그 커뮤니티를 위해 사진에 대한 짧고 문화적으로 완벽한 설명을 작성하려고 합니다. 문제는 당신이 그 언어를 잘 구사하지 못하며, 도움을 줄 수 있는 책이나 사전이 매우 드물다는 점입니다.
이 논문은 플로리다 대학교 (일명 "게이터스") 팀이 2026 년 아메리카스 NLP(AmericasNLP) 대회에서 이 문제를 어떻게 해결했는지 설명합니다. 그들의 목표는 사진을 받아 아메리카 대륙의 다섯 가지 원주민 언어 중 하나 (과라니어나 브리브리어 등) 로 캡션을 작성하는 것이었습니다.
다음은 그들이 단순한 단계와 비유로 풀어낸 방법입니다:
두 단계 레시피
"사진"에서 "드문 언어"로 바로 넘어가려는 대신, 팀은 두 단계 릴레이 경기를 사용했습니다:
- 1 단계: 번역가 (다리): 먼저, 그들은 Qwen 이라는 초지능 AI 를 이용해 사진을 보고 스페인어로 간단한 설명을 작성하게 했습니다. 스페인어는 AI 가 매우 능숙한 "다리 언어"로 생각하십시오.
- 2 단계: 문화 전문가 (결승자): 다음으로, 그들은 그 스페인어 설명을 가져와 더 똑똑한 또 다른 AI(Gemini) 에게 최종 원주민 언어로 번역하도록 요청했습니다.
비밀 소스: "말하기만 하지 말고 보여주기"
진정한 마법은 번역 자체에 있는 것이 아니라, AI 에게 어떤 "스타일"을 사용해야 하는지 가르치는 방법에 있었습니다.
보통 AI 에게 번역을 요청하면 문법적으로 정확하지만 로봇이나 교과서처럼 들리는 문장이 나옵니다. 팀은 캡션이 현지인이 자연스럽게 말하는 것처럼 들리기를 원했습니다.
이를 해결하기 위해 그들은 **검색 증강 생성 (Retrieval-Augmented Generation)**이라는 기법을 사용했습니다.
- 비유: 외국 마을의 친구에게 편지를 쓴다고 상상해 보십시오. 그들이 어떻게 말하는지 단순히 추측하는 대신, 다른 사람들이 그 같은 마을에 쓴 100 통의 편지 상자를 꺼내 봅니다. 당신은 그 편지들을 읽으며 은어, 어조, 문장 구조에 대한 감을 잡습니다. 그런 다음 그 스타일을 모방하여 편지를 씁니다.
- 논문에서: AI 가 스페인어 캡션을 번역하기 전에, 시스템은 기존 스페인어 - 원주민 언어 쌍의 거대한 도서관을 검색했습니다. 가장 유사한 예시들 (위에서 언급한 "100 통의 편지"와 같은) 을 찾아 AI 에게 가이드로 보여줬습니다. 이는 AI 가 대회에서 요구하는 특정 문화적 스타일인 "레지스터 (register)"를 맞추는 데 도움이 되었습니다.
결과: 큰 승리
팀이 이 시스템을 대회에 출전시켜 우승했습니다.
- 점수: 그들은 표준 기준선과 비교해 압도적인 차이로 점수를 향상시켰습니다. 예를 들어, 브리브리 언어에서는 점수가 164% 향상되었고, 과라니 언어에서는 131% 향상되었습니다.
- 인간 평가: 인간 심사위원들이 캡션을 평가했을 때, 팀의 작품은 5 개 최종 후보 중 2 위를 차지하여 캡션이 자연스럽고 문화적으로 적절함을 입증했습니다.
그들이 배운 것 ("아하!" 순간들)
팀은 무엇이 작동하고 무엇이 작동하지 않는지 확인하기 위해 많은 실험을 수행했고, 세 가지 주요 발견으로 이어졌습니다:
- 모든 도서관이 평등하지는 않다: 그들이 사용한 예시 "도서관"은 과라니 언어에 대해 기적 같은 효과를 발휘했는데, 그 이유는 53,000 개의 예시 (일부 컴퓨터 생성 "가짜" 예시 포함) 라는 거대한 컬렉션을 보유하고 있었기 때문입니다. 컴퓨터 생성 예시들이 매우 유용한 것으로 밝혀졌습니다. 반면, 유카텍 마야 언어의 경우 거의 예시가 없었습니다. 그런 경우, AI 의 내부 지식을 활용하는 것이 작고 잡음이 많은 도서관을 억지로 사용하는 것보다 더 나았습니다.
- "가짜" 데이터 부스트: 과라니 언어의 경우, 성공 요인의 약 28 점이 바로 그 컴퓨터 생성 예시들을 사용한 데서 비롯되었습니다. 마치 추가 연습 문제를 만들어 공부하게 해주는 연습 코치가 있는 것과 같습니다.
- 어조가 중요하다 (특히 브리브리 언어의 경우): 브리브리 언어는 단어의 의미를 바꾸는 복잡한 성조 (tones) 를 가지고 있습니다. 팀은 단순히 번역하는 것만으로는 부족하다는 것을 발견했습니다. AI 에게 이러한 소리 처리와 어순에 대한 특별한 지시를 제공해야 했습니다. 마치 AI 에게 "기억해, 이 언어에서는 동사가 끝에 오고, 악보 (성조) 를 잊지 마!"라고 말하는 것과 같습니다.
함정 (한계점)
팀은 그들의 시스템이 아직 완벽하지 않다고 인정합니다:
- 연쇄 반응: 첫 번째 AI(스페인어 번역기) 가 사진을 설명하는 데 실수를 하면, 두 번째 AI(번역기) 는 그 실수를 완벽하게 번역합니다. "되돌리기 (undo)" 버튼은 없습니다.
- 테스트 점수 함정: 그들은 AI 가 스타일을 배우도록 돕기 위해 "연습 시험"(개발 세트) 의 예시들을 사용했습니다. 이는 연습 점수에는 매우 잘 작동했지만, 실제 시험을 치르기 전에 연습 퀴즈의 정답을 그대로 외우는 것과 조금 비슷합니다. 점수가 과장될 수 있으므로 그들은 그 결과들을 해석하는 데 주의를 기울이고 있습니다.
요약
플로리다 대학교 팀은 사진을 먼저 스페인어로 설명한 후, 거대한 유사 예시 도서관을 활용하여 AI 가 그 설명을 올바른 문화적 맛을 지닌 원주민 언어로 번역하도록 가르치는 파이프라인을 구축함으로써 우승했습니다. 그들은 저자원 언어의 경우 전환과 스타일 가이드가 번역 자체만큼이나 중요하다는 것을 입증했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.