문제점: 마치 눈이 안 좋은 사람이 복잡한 지도를 보며 길을 찾는 것처럼, 화면의 작은 변화 (버튼 위치 변경 등) 에도 쉽게 넘어갑니다. 또한, 화면 전체를 설명해야 하므로 데이터 비용 (토큰) 이 매우 비싸고 느립니다.
MCP (도구 호출 방식):
상황: 미리 정해진 도구 (스킬) 를 불러와서 사용합니다.
문제점:도구를 쓰려면 미리 창고에 다 가져다 놓아야 (설치) 합니다. 또한, 민감한 정보 (비밀번호 등) 를 AI 가 직접 눈으로 확인해야 하므로 보안 구멍이 생길 수 있습니다.
✨ ANX 의 등장: "명확한 설계도와 자동화 공장"
이 논문은 ANX라는 새로운 시스템을 제안합니다. 이를 세 가지 핵심 아이디어로 나누어 설명해 보겠습니다.
1. "압축된 설계도" (ANX Markup & Config)
비유: 기존 방식이 AI 에게 "저기 빨간색 버튼이 있는 화면을 보고, 그 아래에 있는 텍스트를 읽어서..."라고 긴 설명을 해주는 거라면, ANX 는 **"A 버튼을 누르고 B 값을 입력하라"**는 간결한 설계도를 줍니다.
효과: 불필요한 설명이 사라져서 데이터 비용 (토큰) 이 50% 이상 절약되고, AI 가 실수할 확률이 줄어듭니다.
2. "3EX 건축 구조" (Expression-Exchange-Execution)
비유: 기존 시스템이 '명령', '도구 찾기', '실행'을 한 사람이 다 해야 하는 혼합된 작업이었다면, ANX 는 이를 3 개의 전문 부서로 나눕니다.
Expression (명령실): 무엇을 할지 명확한 설계도를 그립니다.
Exchange (물류센터 - ANXHub): 필요한 도구를 실시간으로 검색해서 가져옵니다. (미리 설치할 필요 없음, '주문하고 바로 사용' 가능)
Execution (작업장): 설계도대로 일을 처리합니다.
효과: 각 부서마다 역할이 명확해서 AI 가 혼란을 겪지 않고, 도구를 미리 설치할 필요 없이 필요한 것만 바로 가져와서 쓸 수 있습니다.
3. "보안 금고" (UI-to-Core & Human-Only Confirmation)
비유: 가장 중요한 부분입니다. 기존 방식은 AI 가 비밀번호나 신용카드 번호를 직접 눈으로 보고 처리했습니다.
ANX 의 방식: 민감한 정보는 **AI 가 전혀 보지 못하는 '보안 금고'**로 바로 전송됩니다.
시나리오: 사용자가 비밀번호를 입력하면, 그 데이터는 AI 의 뇌 (LLM) 를 거치지 않고 직접 서버 (Core) 로 이동합니다. AI 는 "입력 완료"라는 신호만 받습니다.
인간 확인: 중요한 작업 (예: 돈 이체) 이 필요하면, AI 가 대신 할 수 없고 반드시 인간이 직접 확인 버튼을 눌러야 진행됩니다.
📊 실험 결과: "얼마나 더 빨라졌나요?"
연구진은 실제 업무 (구직자 계정 만들기) 를 시켰을 때의 결과를 비교했습니다.
비용 절감: 기존 방식 (MCP 나 화면 자동화) 보다 토큰 사용량이 약 47%~66% 줄었습니다. (돈을 아낀다는 뜻입니다.)
속도 향상: 작업 완료 시간이 약 58% 단축되었습니다.
정확도: 설계도 (구조화된 언어) 를 사용했기 때문에 AI 가 헷갈려서 실수하는 경우가 훨씬 적었습니다.
💡 결론: 왜 이것이 중요한가요?
지금까지 AI 는 비싸고, 느리고, 보안이 약한 방식으로 일해 왔습니다. 하지만 ANX는 다음과 같은 변화를 가져옵니다.
AI 전용 언어: 인간이 이해하기보다 AI 가 처리하기 좋은 구조로 만들어 비용과 시간을 아낍니다.
안전한 협업: 민감한 정보는 AI 가 보지 못하게 막고, 중요한 결정은 인간이 내리게 하여 보안을 강화합니다.
유연한 확장: 새로운 도구를 미리 설치할 필요 없이, 필요할 때 바로 찾아서 쓸 수 있습니다.
한 줄 요약:
"ANX 는 AI 가 인간과 함께 일할 때, 불필요한 말을 줄이고 (비용 절감), 중요한 비밀은 AI 에게 보이지 않게 하며 (보안 강화), 필요한 도구만 바로 가져와서 일하게 하는 (효율성) 새로운 규칙입니다."
이 기술이 보편화되면, 앞으로 AI 비서들은 더 저렴하고, 더 빠르고, 더 안전하게 우리의 일상을 도와줄 수 있게 될 것입니다.
논문 요약: ANX (AI Native eX) 프로토콜 및 3EX 아키텍처
1. 문제 정의 (Problem Statement)
기존 AI 에이전트 상호작용 방식은 인간 중심의 패러다임에 의존하여 다음과 같은 치명적인 한계를 겪고 있습니다.
GUI 자동화: 시각적 인식 (스크린 파싱) 에 의존하여 토큰 소모가 과도하고, DOM 구조 변화에 취약하며, 보안 결함이 있습니다.
MCP (Model Context Protocol) 및 기존 스킬 시스템: 사전 설치 (Pre-installation) 가 필요하며, 동적 옵션 처리 시 불필요한 토큰 오버헤드가 발생합니다. 또한, 민감한 데이터 (비밀번호, 금융 정보 등) 가 LLM 컨텍스트를 통과하여 보안 위험이 존재합니다.
자연어 모호성: 복잡한 표준 운영 절차 (SOP) 수행 시 자연어의 모호성으로 인해 에이전트의 실행 불안정성과 할루시네이션이 발생합니다.
보안 및 협업 부재: 민감 데이터 격리 메커니즘이 부족하고, 인간 - 에이전트 협업 및 다중 에이전트 협업을 위한 통일된 프레임워크가 없습니다.
2. 방법론 및 제안 시스템 (Methodology & Proposed System)
저자들은 ANX (AI Native eX) 라는 에이전트 네이티브 프로토콜과 이를 지원하는 3EX (Expression-Exchange-Execution) 분리 아키텍처를 제안합니다.
A. ANX 프로토콜 (Protocol Innovations)
ANX Markup & Config: 자연어나 일반 마크다운보다 정보 밀도가 높은 구조화된 인코딩 방식을 사용합니다. 이를 통해 토큰 소비를 줄이고 에이전트의 처리 효율성을 높입니다.
인간 - 에이전트 공유 상호작용: 동일한 ANX 정의가 에이전트 실행 지시문과 인간 가독성 UI(Embedded UI) 로 동시에 렌더링되어 "한 번 개발, 어디서나 사용"이 가능합니다.
On-Demand & Use-and-Go: 사전 설치 없이 ANXHub 를 통해 동적으로 애플리케이션을 발견하고 즉시 실행할 수 있습니다.
기계 실행 가능한 SOP: 구조화된 시맨틱 (Schema-based) 을 통해 SOP 의 모호성을 제거하고, 조건부 분기 및 상태 관리를 명확히 정의합니다.
B. 3EX 분리 아키텍처 (3EX Decoupled Architecture) 작업 지시, 도구 발견, 실행을 세 개의 독립된 레이어로 분리합니다.
Expression Layer: ANX Markup 을 사용하여 작업을 구조적으로 표현합니다.
Exchange Layer (ANXHub): 대규모 애플리케이션 마켓플레이스로, 시맨틱 벡터 검색을 통해 동적으로 도구를 발견하고 태스크를 라우팅합니다. 사전 설치 불필요.
Execution Layer (ANX Core, CLI, Node): 구조화된 명세를 플랫폼 독립적인 ANX CLI 명령어로 변환하여 실행합니다.
C. 보안 메커니즘 (Security Mechanisms)
UI-to-Core 직접 통신: 민감한 데이터 필드는 LLM 을 우회하여 UI 가 직접 ANX Core 와 암호화 통신합니다. LLM 은 민감 데이터를 절대 보지 못합니다.
인간 전용 확인 (Human-Only Confirmation): 중요한 작업은 에이전트가 우회할 수 없는 인간 확인 대화상자를 필수적으로 거치게 하여 자동화된 오용을 방지합니다.
3. 주요 기여 (Key Contributions)
에이전트 네이티브 설계: 토큰 효율성, 유연성, 적응성이 뛰어난 ANX Markup 과 CLI 를 통해 기존 인터페이스 불일치 문제를 해결했습니다.
3EX 아키텍처: 작업 명세, 도구 발견, 실행을 분리하여 에이전트의 인지 부하를 줄이고 효율성을 극대화했습니다.
본질적 보안 (Native Security): LLM 컨텍스트를 우회하는 데이터 격리 및 인간 확인 메커니즘을 프로토콜 레벨에 내장했습니다.
확장 가능한 협업: ANX SOP 를 통해 다중 에이전트와 인간의 협업, 장기간 (Long-horizon) 작업 수행을 가능하게 했습니다.
평가 프레임워크: 프로토콜/도구, 발견/검색, 보안, 협업 (SOP/다중 에이전트) 의 4 차원 평가 체계를 제시하여 기존 방법론의 한계를 명확히 했습니다.
4. 실험 결과 (Experimental Results)
Qwen3.5-plus 와 GPT-4o 모델을 사용하여 직무 계정 등록 폼 채우기 (Form Filling) 태스크를 기준으로 GUI 자동화 및 MCP 기반 스킬과 비교 실험했습니다.
토큰 효율성 (Token Efficiency):
MCP 대비: Qwen3.5-plus 기준 47.3%, GPT-4o 기준 55.6% 감소.
GUI 자동화 대비: Qwen3.5-plus 기준 57.1%, GPT-4o 기준 66.3% 감소.
이유: 동적 옵션 로딩을 LLM 이 처리하지 않고 ANX Core 가 실행 시 처리하여 토큰 오버헤드를 제거했기 때문입니다.
실행 시간 (Execution Time):
MCP 대비: Qwen3.5-plus 기준 58.1% 단축, GPT-4o 기준 57.7% 단축.
이유: DOM 파싱 및 시각적 렌더링 불필요, 직렬화 오버헤드 감소.
정확도 및 안정성: 구조화된 시맨틱으로 인해 자연어 모호성이 제거되어 작업 완료 정확도가 향상되었습니다.
5. 의의 및 결론 (Significance & Conclusion)
패러다임 전환: 인간 중심의 GUI 자동화나 도구 중심의 MCP 를 넘어, 에이전트 네이티브 (Agent-Native) 상호작용의 새로운 표준을 제시합니다.
실용적 가치: 토큰 비용 절감 (비용 효율성), 실행 속도 향상, 그리고 민감 데이터 보호를 통한 신뢰할 수 있는 AI 에이전트 배포의 기반을 마련했습니다.
미래 방향: 다중 에이전트 협업 최적화, 보안 강화 (적대적 공격 대응), 기업용 ANXHub 배포, 그리고 ANX 특화 경량 모델 학습 등을 통해 지속적인 발전이 예상됩니다.
이 논문은 AI 에이전트가 복잡한 디지털 작업을 안전하고 효율적으로 수행할 수 있도록 프로토콜, 아키텍처, 보안 메커니즘을 통합한 최초의 포괄적인 솔루션을 제시했다는 점에서 학술적, 산업적 의의가 큽니다.