ONTO: A Token-Efficient Columnar Notation for LLM Input Optimization
이 논문은 JSON 의 구조적 오버헤드를 줄이고 LLM 입력 효율성을 극대화하기 위해 필드명을 한 번만 선언하고 파이프 구분 행으로 값을 배열하는 새로운 열 기반 표기법인 ONTO 를 제안하며, 이를 통해 토큰 수를 46~51% 감소시키고 지연 시간을 5~10% 단축하면서도 작업 정확도는 유지함을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
📦 1. 문제: "과도한 포장재" (JSON 의 비효율)
지금까지 AI 에게 데이터를 줄 때는 JSON이라는 포맷을 주로 썼습니다. JSON 은 사람이 읽기 쉽고, 컴퓨터가 이해하기 좋아서 좋지만, AI 에게는 **'불필요한 포장재'**가 너무 많습니다.
- 비유: 1,000 개의 사과를 택배로 보낼 때, 각 사과마다 "이것은 사과입니다. 빨간색입니다. 100g 입니다."라고 적힌 종이를 사과 하나하나에 붙여서 보낸다고 상상해 보세요.
- 사과 (데이터): 실제 필요한 정보.
- 종이 (키/이름): "이것은 사과입니다"라는 반복되는 설명.
- 상자 (괄호, 따옴표): 데이터를 감싸는 구조물.
AI 는 1,000 개의 사과를 볼 때, 실제 사과 내용보다 1,000 번 반복된 '설명 문구'와 '상자'를 읽는 데 에너지를 더 많이 씁니다. AI 는 문장 수 (토큰) 에 따라 돈을 받기 때문에, 이 불필요한 포장재 때문에 비용이 폭탄처럼 터지고, 처리 속도도 느려집니다.
💡 2. 해결책: "Onto(온토)" - 효율적인 포장법
저자들은 이 문제를 해결하기 위해 Onto라는 새로운 포맷을 만들었습니다. 이는 **"한 번만 설명하고, 나머지는 줄로 나열하는 방식"**입니다.
Onto 의 방식:
- 제목만 한 번: "아래에 사과 1,000 개가 있습니다. 각각 '색깔', '무게'를 적겠습니다."라고 맨 처음에 한 번만 적습니다.
- 간단한 줄바꿈: 그 아래로는 사과들의 정보를
|(파이프) 기호로만 구분해서 나열합니다. - 들여쓰기: 사과가 '상자' 안에 들어있다면, 줄을 살짝 들여서 (들여쓰기) 위치를 표시합니다.
비유: 이제 택배 박스에는 "색깔 | 무게"라고 한 번만 적고, 아래로는
빨강 | 100,초록 | 110,빨강 | 95... 처럼 줄줄이 적습니다.- 결과: 1,000 개의 사과를 보낼 때, 반복되는 '이것은 사과입니다'라는 문구가 사라집니다.
📊 3. 놀라운 효과: "절반의 비용, 더 빠른 속도"
논문의 실험 결과를 보면 이 방식이 얼마나 효과적인지 알 수 있습니다.
- 토큰 (문장 수) 감소: JSON 으로 보낼 때보다 약 46~51% 더 적은 분량으로 데이터를 보낼 수 있습니다.
- 비유: 100 장짜리 서류를 50 장으로 줄여서 보낸 셈입니다.
- 비용 절감: AI 서비스는 입력된 글자 수에 따라 돈을 받습니다. 글자가 절반으로 줄었으니 비용도 절반 가까이 절약됩니다.
- 속도 향상: AI 가 읽어야 할 글자가 줄어들었으니, 답변을 내는 속도도 5~10% 빨라집니다.
- 이해력 유지: 중요한 건, 이렇게 줄여도 AI 가 데이터를 이해하는 능력 (사과 개수 세기, 가장 무거운 사과 찾기 등) 은 떨어지지 않는다는 것입니다.
🧩 4. 왜 다른 방식들은 안 될까?
- CSV(엑셀 형식): 줄로 나열하는 건 좋지만, 복잡한 구조 (사과 안에 또 다른 작은 사과가 있는 경우) 를 표현하기 어렵습니다.
- YAML: 들여쓰기는 좋지만, 여전히 각 줄마다 "색깔:", "무게:"라는 반복되는 단어가 남아 있어 효과가 적습니다.
- Onto 의 장점: CSV 의 효율성 (반복 제거) 과 JSON/YAML 의 장점 (복잡한 구조 표현) 을 모두 잡았습니다.
🚀 5. 언제 쓸 수 있을까요?
이 방식은 모든 상황에 쓰이는 만능 열쇠는 아닙니다.
- 쓸 때: AI 에게 대량의 데이터 (예: 100 개 이상의 센서 데이터, 로그 파일) 를 분석하게 할 때.
- 안 쓸 때: 사람과 사람이 주고받는 대화나, 작은 설정 파일, 혹은 아주 복잡한 구조가 얽힌 데이터가 아닐 때는 기존 방식 (JSON) 이 더 나을 수 있습니다.
🌟 요약
이 논문은 **"AI 가 데이터를 읽을 때는 사람이 읽는 것과 기준이 다르다"**는 점을 깨달았습니다.
사람에게는 "이건 사과야, 이건 배야"라고 반복해서 설명하는 게 친절하지만, AI 에게는 그 반복이 시간과 돈의 낭비입니다. Onto는 AI 를 위해 불필요한 포장재를 걷어내고, 핵심 데이터만 깔끔하게 줄줄이 나열하는 새로운 방식을 제안했습니다.
이제 AI 는 더 적은 비용으로, 더 빠르게, 더 많은 데이터를 분석할 수 있게 되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.