← 최신 논문
🤖 machine learning

Agentic Skill Optimization over Lie Algebroids

이 논문은 편집 정책과 그들의 비가환적 합성을 표현하기 위해 리 대수로이드(Lie algebroids)를 사용하여 에이전트의 기술 최적화를 모델링하고, 비용이 많이 드는 LLM 검증 전에 저렴한 리 브래킷(Lie-bracket) 테스트를 통해 편집을 스크리닝함으로써 수십 배의 속도 향상을 가능하게 하는 새로운 프레임워크인 LASKO를 소개한다.

원저자: Sridhar Mahadevan

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sridhar Mahadevan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 레고 블록으로 만들어진 거대하고 복잡한 기계를 고치려 한다고 상상해 보십시오. 각 블록은 로봇을 위한 특정 지침, 규칙, 또는 체크리스트입니다. 이 기계는 똑똑한 일을 수행하도록 설계된 "에이전트 시스템(agentic system)"입니다. 문제는 로봇이 실수를 했을 때, 단순히 레고 블록 하나를 교체한다고 해서 해결되지 않는다는 점입니다. 때로는 블록을 교체하는 '순서'가 매우 중요합니다. 만약 "안전 규칙"을 고친 뒤에 "수학 규칙"을 고치면 기계가 작동하지만, 그 순서를 반대로 하면 전체가 무너져 버립니다.

이것이 바로 LASKO(Lie Algebroid SKill Optimization)라는 논문이 해결하려는 퍼즐입니다.

문제점: "순서가 중요하다"는 함정

로봇의 지침을 마크다운(Markdown)이라는 특수한 언어로 쓰인 긴 이야기라고 생각해 보십시오. 로봇을 더 낫게 만들기 위해, AI 옵티마이저(optimizer)는 이 이야기를 편집하려고 시도합니다. 그것은 "여기에 규칙을 추가하라", "저 예시를 삭제하라", 또는 "이 스키마를 수정하라"와 같은 미세한 변화들을 제안합니다.

기존의 방식(SKILLOPT)에서는 옵티마이저가 서툰 정원사처럼 행동합니다. 변화를 하나 시도해 보고 식물이 자라는지 확인한 다음, 또 다른 변화를 시도합니다. 이 방식은 모든 변화가 독립적이라고 가정합니다. 마치 정원에 꽃 한 송이를 추가하는 것과 같다고 보는 것이죠. 하지만 논문은 이것이 틀렸다고 주장합니다. 이러한 변화들은 시계의 톱니바퀴와 같습니다. 만약 연결된 톱니바퀴를 고치기 전에 스프링을 먼저 고치려 한다면, 시계는 움직이지 않을 것입니다. 논문은 두 가지 변화가 각각 단독으로는 완벽해 보일지라도, 만약 잘못된 순서로 수행된다면 처참하게 실패할 수 있다는 것을 보여줍니다.

이 논문은 모든 가능한 조합의 편집을 하나씩 다 시도해보는 방식(소위 "브루트 포스(brute-force)" 접근법)에 대해 명시적으로 반대합니다. 모든 순서를 다 시도하는 것은 매번 로봇을 거대한, 비용이 많이 드는 테스트에 통과시켜야 하므로 너무 비싸고 느리기 때문입니다. 또한, 어떤 변화에 대한 단일한 "점수"가 모든 것을 말해준다는 생각에도 반대합니다. 때로는 어떤 변화가 즉각적으로는 좋아 보일지 몰라도, 나중에 로봇이 학습하는 능력을 망쳐버릴 수도 있기 때문입니다.

해결책: "비밀 악수" 탐지기

저자들은 LASKO라고 불리는 새로운 프레임워크를 제안합니다. 이를 이해하기 위해, 로봇의 지침이 단순한 평면 목록이 아니라 숨겨진 층(layer)이 있는 3D 구조라고 상상해 보십시오.

  1. 가시적 층 (앵커, The Anchor): 화면에 보이는 것, 즉 문서에서 실제로 변하는 단어들입니다.
  2. 숨겨진 층 (커널, The Kernel): 눈에 보이지 않는 요소들입니다. 내부 라우팅, 템플릿 변수, 그리고 당장 눈에 보이지는 않지만 미래의 변화에 영향을 미치는 로봇의 "기분(mood)" 같은 것들입니다.
  3. 비밀 악수 (브래킷, The Bracket): 이 논문의 핵심 아이디어입니다. 이는 두 변화가 올바르게 "악수"를 나누는지 확인하는 수학적 테스트입니다. 만약 변화 A를 하고 나서 변화 B를 했을 때, 변화 B를 하고 나서 변화 A를 했을 때와 결과가 같다면 어떻게 될까요?

LASKO의 세계에서, 만약 두 변화가 "교환(commute)"되지 않는다면(즉, 순서에 따라 결과가 달라진다면), 시스템은 이를 "높은 브래킷(high-bracket)" 쌍으로 표시합니다. 이것은 마치 번잡한 교차로의 교통 경찰과 같습니다. 모든 차량(모든 가능한 편집 순서)이 충돌하는지 확인하기 위해 일일이 지나가게 하는 대신, 경찰은 빠르고 저렴한 센서를 사용하여 교통 흐름을 체크합니다.

마법: 15배 빠른 속도

여기서부터 숫자가 흥미로워집니다. 논문은 이 "교통 경찰" 아이디어가 실제로 작동하는지 확인하기 위해 일련의 테스트를 진행했습니다.

그들은 로봇이 10개의 특정 앵커(예: "스키마", "도구 계약", "검증기" 등)를 가진 워크플로우를 수정하는 도전 과제를 설정했습니다.

  • 기존 방식 (브ute Force): 완벽한 수정을 찾으려면 모든 가능한 편집 순서를 시도해야 합니다. 10개의 항목이 있다면, 90개의 순서가 있는 쌍이 생깁니다. 각 쌍을 거대 AI 모델(논문에 언급된 671B 파라미터의 DeepSeek V3.1 4-bit 모델)을 통해 실행하면 시간이 엄청나게 오래 걸립니다.
  • LASKO 방식: 시스템은 먼저 초고속 "브래킷 프로브(bracket probe)"를 실행합니다. 이는 매우 빠르고 저렴한 계산으로, 약 마이크로초(microseconds) 단위로 수행됩니다 (논문에서는 한 테스트에서 0.000127초가 걸렸다고 명시함). 이 프로브는 어떤 편집 쌍이 실제로 중요한 "높은 브래킷" 쌍이 될 가능성이 높은지 예측합니다.
  • 결과: 90개의 쌍을 모두 테스트하는 대신, LASKO는 90번의 브래킷 프로브를 실행하여 목록을 필터링한 후, 예측된 상위 10개의 쌍만을 검증합니다.

실험에서 이 방식은 브루트 포스 방식에 비해 거의 15배의 속도 향상을 달양했습니다. DeepSeek V3.1 모델을 사용한 한 특정 테스트에서, 브루트 포스 방식은 모든 옵션을 검증하는 데 538.1초가 걸린 반면, LASKO는 단 36.2초 만에 동일한 작업을 수행했습니다. 이는 14.85배의 속도 향상입니다.

더 놀랍게도, Nemotron 70B 모델을 사용한 테스트에서는 시간이 712.4초에서 86.0초로 줄어들었습니다 (8.28배 속도 향상). 테스트된 모든 모델을 통틀어 평균 속도 향상은 6.94배였습니다.

이것이 실제로 의미하는 바

논문은 이 방법이 모든 것을 즉시 해결하는 마법 지팡이는 아니라고 매우 신중하게 밝히고 있습니다. 이는 로봇이 실제로 수정 사항을 시도하는 값비싼 "검증(validation)" 단계를 없애는 것이 아닙니다. 대신, 이것은 필터 역할을 합니다.

클럽의 문지기를 생각해보십시오. "브래킷 프로브"는 입구에서 신분증을 확인하는 문지기입니다. 빠르고 저렴합니다. 들어올 수 없는 사람들(잘못된 편집 순서)을 미리 차단함으로써, 값비싼 "서비스 검증(실제 클럽 입장)"이 실제 가능성이 있는 사람들만을 상대하도록 합니다.

저자들은 이 방법이 완벽한 수리 순서(점수 1.000 획득)를 찾아내면서도 훨씬 적은 시간과 비용을 들일 수 있게 해준다고 제안합니다. 160개의 편집이 있는 테스트에서, 브루트 포스 방식은 25,441번의 값비싼 검증 호출이 필요했습니다. 반면, 브래킷 스크리닝을 사용한 LASKO는 단 168번의 프로브(브래킷 체크와 최종 검증 호출의 조합)만으로 동일한 완벽한 점수를 얻었습니다.

결론

이 논문은 기술 편집을 단순한 선택 목록이 아니라, 순서숨겨진 맥락이 중요한 구조화된 시스템으로 다룸으로써 AI 에이전트를 훨씬 더 빠르게 최적화할 수 있다고 시사합니다. 이것은 단순히 더 잘 추측하는 것이 아니라, 어떤 추측이 값비싼 테스트를 할 가치가 있는지를 아는 것에 관한 것입니다.

이 방식은 "리 브래킷(Lie bracket, 순서 민감도 테스트)"이 우리가 시간과 돈을 낭비하기 전에 나쁜 경로를 걸러내는 강력한 도구임을 보여줍니다. 이는 혼란스러운 미로 속에서의 검색을 안내된 투어로 바꾸어, 우리가 출구로 이어질 가능성이 가장 높은 길만을 걷도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →