← 최신 논문
💬 NLP

Telegraph English: Semantic Prompt Compression via Structured Symbolic Rewriting

전신 영어 (TE) 는 기존 LLMLingua-2 와 같은 토큰 삭제 방식보다 다양한 모델에서 더 뛰어난 정확도와 의미 색인 능력을 달성하기 위해 자연어를 원자적 사실 행의 기호 풍부하고 구조화된 방언으로 변환하는 새로운 프롬프트 압축 프로토콜입니다.

원저자: Mikhail L. Arbuzov, Sisong Bei, Ziwei Dong, Dmitri Kalaev, Alexey A. Shvets

게시일 2026-05-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mikhail L. Arbuzov, Sisong Bei, Ziwei Dong, Dmitri Kalaev, Alexey A. Shvets

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구에게서 매우 길고 장황한 편지를 받았다고 상상해 보세요. 이를 다른 사람에게 전달해야 하지만, 우편료 (토큰) 를 절약하고 수신자가 불필요한 내용 (fluff) 에 빠지지 않고 가장 중요한 부분들을 이해하도록 해야 합니다.

현재의 표준 방식 (LLMLingua-2 라고 함) 은 '삭제 (Redaction)' 게임과 같습니다. 빨간 펜으로 단어의 50% 를 지우고, 남은 문장들이 여전히 의미를 갖기를 바랍니다. 문제는 무엇일까요? 실수로 'because(왜냐하면)'나 'therefore(그러므로)'와 같은 단어를 지워버려, 독자가 아이디어들이 어떻게 연결되는지 추측하게 만들 수 있습니다. 또는 이야기에서 가장 중요한 부분으로 판명되는 특정 숫자를 잘라낼 수도 있습니다.

이 논문은 **Telegraph English(TE)**라는 새로운 방법을 소개합니다. TE 는 단순히 단어를 지우는 대신, 전체 편지를 초고효율적이고 코드 같은 언어로 다시 쓰는 마스터 번역가와 같습니다.

다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:

1. "삭제 (Redaction)" 대 "다시 쓰기 (Rewrite)"

  • 구식 방식 (토큰 삭제): 소설에서 매번 다른 단어를 잘라내며 편집한다고 상상해 보세요. 결과는 다음과 같을 수 있습니다: "The cat sat on the... rug." 길이는 짧아졌지만 흐름이 끊깁니다. 'not'을 잘라내면 의미가 완전히 반전됩니다.
  • 신식 방식 (Telegraph English): 같은 소설을 비밀 약어로 된 불릿 포인트 시리즈로 다시 쓴다고 상상해 보세요.
    • 원문: "According to research by Johnson and colleagues (2023), the application of machine learning techniques to medical diagnostics resulted in a 27.5% increase in early detection rates while simultaneously reducing false positives by approximately 12% compared to traditional methods."
    • Telegraph English: ML→MEDICAL-DIAGNOSTICS: EARLY-DETECTION+27.5% ∧FALSE-POSITIVE-12% [JOHNSON:2023]
    • 결과: 문장이 68 단어에서 14 개의 '토큰'으로 줄었지만, 모든 사실, 숫자, 관계가 명확하게 레이블링되어 여전히 존재합니다.

2. "레고 블록"의 장점

이 논문은 TE 가 특별한 초능력을 가지고 있다고 주장합니다: 압축과 조직화가 동시에 발생합니다.

  • 구식 방식: 텍스트를 삭제하면 작고 지저분한 단어 더미가 생깁니다. 나중에 특정 사실을 찾아야 한다면, 그 지저분한 더미를 다시 전체적으로 읽어야 합니다.
  • 신식 방식: TE 는 텍스트를 '원자적 사실 줄 (Atomic Fact Lines)'로 분해합니다. 이는 거대하고 지저분한 점토 덩어리를 개별적으로 레이블이 붙은 레고 블록으로 만드는 것과 같습니다.
    • 각 줄은 하나의 단일 사실입니다.
    • 각 줄은 태그가 지정됩니다 (예: PAST:, LIKELY:, CITATION:).
    • 모든 줄이 자체적으로 완결된 사실이기 때문에, 문서 전체를 다시 읽지 않고도 '날짜'나 '숫자'만 즉시 추출할 수 있습니다. 등지에 주제별로 이미 분류된 책들이 있는 도서관과 같습니다.

3. "더 똑똑한" 컴퓨터와 "덜 똑똑한" 컴퓨터 모두에게 더 잘 작동하는 이유

연구자들은 매우 똑똑한 모델부터 작고 저렴한 모델까지 다섯 가지 다른 AI 모델에서 이를 테스트했습니다.

  • 똑똑한 모델의 경우: TE 는 구식 방법만큼 잘 수행되지만 비용은 절반으로 줄였습니다.
  • 작은 모델의 경우: TE 가 빛을 발하는 곳입니다. 작은 AI 모델은 단어가 빠졌을 때 빈칸을 채우는 데 때때로 어려움을 겪습니다.
    • 비유: 작은 아이에게 조각이 절반이나 빠진 퍼즐 (토큰 삭제) 을 주면 그림을 잘못 추측할 수 있습니다. 하지만 모든 조각이 명확하게 레이블이 붙고 연결된 퍼즐 (Telegraph English) 을 주면 완벽하게 해결할 수 있습니다.
    • 논문은 까다롭고 세부 사항이 많은 질문에서 TE 가 작은 모델들이 구식 방법보다 최대 11% 더 자주 정답을 얻도록 도왔다고 발견했습니다.

4. "한 번만 다시 쓰고, 영구적으로 관리 가능" 규칙

이 논문은 **"한 번 압축하면, 지속적으로 관리 가능 (Compress Once, Manage Continuously)"**이라는 개념을 소개합니다.

  • 구식 방식: 전송을 위해 텍스트를 한 번 압축합니다. AI 가 긴 답변을 생성하면, 그 답변은 거대하고 압축되지 않은 텍스트 벽으로 돌아옵니다. 그 답변을 제삼자에게 전달해야 한다면, 다시 전체를 압축해야 합니다.
  • 신식 방식: TE 는 텍스트를 구조화된 '사실 블록'으로 변환하기 때문에, AI 의 답변도 TE 로 작성될 수 있습니다. 이는 전체 대화가 압축되고 조직화된 상태로 유지됨을 의미합니다. 다시 압축할 필요가 없습니다. 구조가 내장되어 있기 때문입니다.

단점 (한계점)

이 논문은 단점에 대해 솔직합니다:

  1. "번역가"가 필요합니다: 텍스트를 Telegraph English 로 변환하려면 먼저 AI 모델을 실행해야 합니다. 이는 시간과 비용이 upfront 으로 듭니다. 한 번만 읽고 다시는 사용되지 않는 메시지를 보내는 경우, 이 추가 단계가 가치가 없을 수 있습니다.
  2. 영어 전용: 이 특정 '약어'는 영어를 위해 설계되었습니다. 중국어나 아랍어와 같이 구조가 매우 다른 언어에는 대폭적인 재설계 없이는 즉시 작동하지 않습니다.
  3. 엄격한 규칙: 시스템은 매우 경직되어 있습니다. 사실을 특정 형식으로 강제합니다. 입력이 이미 매우 짧고 밀집되어 있는 경우, 시스템은 모든 정보를 삭제하지 않으므로 (신뢰성이 간결성보다 중요함) 실제로 내용을 더 길게 만들 수도 있습니다.

결론

Telegraph English 는 단순히 텍스트를 짧게 만드는 것이 아니라, 텍스트를 더 똑똑하게 만드는 것입니다. 이는 컴퓨터가 읽기, 저장, 기억하기 쉬운 깔끔하고 구조화된 기호 중심의 형식으로, 인간 언어의 지저분하고 자연스러운 흐름을 교환합니다. 이는 문서의 '열화된 복사본'을 사실의 '구조화된 데이터베이스'로 변환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →