← 최신 논문
🤖 AI

AquiLLM: An Architecture for Supporting Tacit Knowledge Capture in Research Groups

본 논문은 연구 그룹이 암묵적 지식을 포착하는 데 도움을 주는 동시에, 오픈 웨이트 모델의 사용을 통해 투명성, 재현성 및 개인정보 보호에 관한 과학적 우려를 해결하도록 설계된 오픈 소스 기반의 모듈형 RAG-LLM 프레임워크인 AquiLLM의 아키텍처 개선 사항과 기능 확장을 제시한다.

원저자: Jack Stark, Srinath Saikrishnan, Vikram Seenivasan, Bernie Boscoe, Andrew Lizarraga, Tuan Do

게시일 2026-08-11
📖 6 분 읽기🧠 심층 분석

원저자: Jack Stark, Srinath Saikrishnan, Vikram Seenivasan, Bernie Boscoe, Andrew Lizarraga, Tuan Do

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

과학자들이 실험실에서 함께 협력하는 모습을 상상해 보세요, 마치 차고에서 잼(jamming)을 하는 밴드처럼 말이죠. 그들에게는 악보(출판된 논문)와 악기(데이터)가 있지만, 진짜 마법은 기록되지 않은 무질서한 순간들, 즉 내부 농담, "그 노브는 건드리지 마"라는 경고, 그리고 즉석에서 만들어내는 영리한 지름길 같은 것들에서 일어납니다. 이것을 **암묵적 지식(tacit knowledge)**이라고 부릅니다. 이는 읽어서 아는 것이 아니라, 직접 해봤기 때문에 알게 되는 것들입니다. 보통 밴드 멤버가 떠나면, 이 비밀스러운 지식도 그와 함께 문밖으로 나가버립니다.

이를 해결하기 위해, 과학자들은 AI를 이 그룹의 '슈퍼 메모리'로 사용하려고 노력하고 있습니다. AI를 모든 책을 순식간에 읽을 수 있는 매우 빠르고 똑똑한 사서라고 생각해 보세요. 하지만 이러한 "사서" 대부분은 대기업이 소유하고 있습니다. 이는 문제를 일으킵니다. 만약 당신이 기업의 사서에게 질문을 던지면, 그들은 다음 사서를 훈련시키기 위해 당신의 질문을 복사본으로 남겨둘 수도 있고, 혹은 당신에게 답을 어떻게 찾아냈는지 정확히 보여주지 않을 수도 있습니다. 연구를 검증해야 하고 데이터를 비공개로 유지해야 하는 과학자들에게 이는 용납될 수 없는 일입니다. 그들은 스스로 구축하고, 자신의 지하실에 보관하며, 완전히 신뢰할 수 있는 사서를 필요로 합니다.

여기에서 AquiLLim이 등장합니다. 이것은 연구 그룹이 그들의 무질서하고 명시되지 않은 지식을 포착할 수 있도록 설계된 새로운 오픈 소스 도구입니다. 논문은 팀이 어떻게 AquiLLM을 그룹의 컴퓨터에서 직접 실행되는 유능한 로컬 연구 조수처럼 업그레이드했는지 설명합니다. 데이터를 클라우드로 보내는 대신, 이들은 **검색 증강 생성(RAG)**을 사용합니다. RAG를 AI가 자신의 뇌에서 답을 추측하는 것이 아니라, 먼저 특정 책장으로 달려가 필요한 정확한 페이지들을 집어 들고, 그것을 소리 내어 읽으며 질문에 답하는 시스템이라고 상상해 보세요. 이는 AI가 내용을 지어내는 대신, 그룹이 실제로 보유한 사실에 충실하도록 보장합니다.

저자들은 단순히 기본적인 버전을 만든 것이 아닙니다. 그들은 실제 과학자들(예: 천체물리학자)이 실제로 필요로 하는 것에 기반하여 시스템에 대대적인 메이크업을 했습니다. 그들은 시스템이 텍스트뿐만 아니라 이미지와 차트를 "볼" 수 있는 기능을 추가했고, 사용자가 누구인지, 이전에 어떤 대화를 나누었는지 기억하면서도 서로 다른 프로젝트를 혼동하지 않는 "기억력"을 부여했습니다. 또한 시스템을 모듈형으로 만들어, 전체 로봇을 다시 만들지 않고도 뇌나 눈 같은 부품을 교체할 수 있도록 만들었습니다.

논문은 이러한 업그레이드가 실제 과학의 복잡하고 시각적이며 협력적인 특성을 처리하는 데 있어 시스템을 훨씬 더 낫게 만든다고 제안합니다. 그러나 저자들은 이 시스템이 사실을 찾는 데는 잘 작동하지만, 여러 다른 출처의 정보를 비교하거나 "기억"이 너무 가득 찼을 때에는 여전히 다소 어려움을 겪는다는 점을 주의 깊게 언급했습니다. 그들은 아직 이 시스템이 완벽하다는 것을 증명하지 못했습니다. 단지 개인정보를 존중하고 팀의 집단 지혜를 안전하게 지키는 데 도움이 되는 유망한 단계임을 보여주었을 뿐입니다.

거대한 업그레이드: 투박한 로봇에서 스마트한 실험실 파트너로

그렇다면 팀은 정확히 AquiLLM에 무엇을 했나요? 원래의 시스템을 약간 서투른 로봇이라고 생각해 보세요. 말을 할 수는 있었지만, 느렸고, 사진을 볼 수 없었으며, 5분 전에 말한 내용도 가끔 잊어버리곤 했습니다. 새로운 버전은 그 로봇에게 뇌 이식, 새로운 눈, 그리고 개인용 노트를 준 것과 같습니다.

1. "로컬 뇌"와 "로컬 도서관"
가장 큰 변화는 모든 것이 그룹의 자체 컴퓨터에서 일어난다는 점입니다. 팀은 값비싼 외부 상업 서비스를 사용하는 대신 **오픈 웨이트 모델(open-weight models)**을 도입했습니다. 비싼 외부 컨설턴트를 불러 문제를 해결하는 대신, 집에 사는 유능한 로컬 튜터가 있다고 상상해 보세요. 이 튜터(AI 모델)는 무료로 사용할 수 있으며, 그들이 적는 모든 노트의 소유권은 당신에게 있습니다. 팀은 채팅을 위해 Qwen3.6-27B를, 이미지를 보기 위해 Qwen3-VL 같은 모델을 구체적으로 선택했습니다. 또한 외부 검색 도구를 로컬 도구로 교체하여, AI의 "검색 엔진" 부분 역시 클라우드가 아닌 그룹의 지하실에 머물게 했습니다. 이를 통해 미발표 연구나 개인적인 메모와 같은 민감한 데이터가 인터넷에 노출되는 것을 완전히 차단했습니다.

2. AI에게 "눈"을 달아주기 (멀티모달 기능)
과학은 단어에 관한 것만이 아닙니다. 그래프, 별의 사진, 다이어그램에 관한 것이기도 합니다. 기존 시스템은 이런 것들에 어려움을 겪었습니다. 새로운 AquiLLM은 이제 "볼" 수 있습니다. 이 시스템은 이미지 속의 그래프를 보고, 선들이 무엇을 의미하는지 이해하며, 인간처럼 그것에 대해 이야기할 수 있는 멀티모달 모델을 사용합니다. 이는 메뉴판만 읽을 수 있는 로봇에서, 접시 위의 음식을 보고 맛이 어떤지 말할 수 있는 로봇으로 업그레이드된 것과 같습니다. 이는 연구자들이 논문의 피규어를 설명하기 위해 모든 픽셀을 텍스트로 묘사할 필요 없이 직접 논의할 수 있게 해주므로 매우 중요합니다.

3. "개인적 기억" vs "공유된 노트"
가장 멋진 새로운 기능 중 하나는 메모리 레이어입니다. 친구와 대화를 나눈다고 상상해 보세요. 매번 "안녕"이라고 말할 때마다 인생 이야기를 처음부터 다시 설명하고 싶지는 않을 것입니다. 새로운 시스템은 두 가지 유형의 기억을 가집니다:

  • 안정적 사실 (Stable Facts): 이것은 영구적인 신분증과 같습니다. 당신의 이름, 좋아하는 연구 주제, 말투 등을 기억합니다.
  • 일화적 기억 (Epipodic Memory): 이것은 최근 대화의 일기장과 같습니다. 만약 당신이 어제 특정 성단에 대해 물었다면, AI는 오늘 그 맥락을 기억합니다.
    결정적으로, 이 기억은 사용자 및 프로젝트별로 비공개입니다. 다른 사람의 데이터와 섞이지 않습니다. 논문에서는 이 메모리가 선택 사항이며 반드시 켜져 있어야 한다고 명시했는데, 너무 많은 것을 저장하면 지저-적질 수 있기 때문입니다. 만약 메모리가 실패하더라도 시스템은 단순히 문서로 돌아가므로 대화 자체가 깨지지는 않습니다.

4. "기술"과 "기술 팩"
이것은 특정 팀이 어떻게 일하는지를 AI에게 가르치는 영리한 방법입니다. 실험실에 새로운 인턴이 들어왔다고 상상해 보세요. 그들은 특정 규칙을 알아야 합니다: "항상 데이터를 파란색으로 그려라" 또는 "실험을 실행하기 전에 이 체크리스트를 확인하라"와 같은 것들 말이죠. 새로운 시스템에서 이러한 규칙들은 **기술(Skills)**로 묶여 있습니다. 연구자가 특정 프로젝트에 대한 채팅을 시작하면, AI는 자동으로 해당 프로젝트의 "기술 팩(Skill Pack)"을 로드합니다. 이는 AI가 대화하는 팀에 따라 다른 모자를 쓰는 것과 같습니다. 분광학 팀은 하나의 지침 세트를, 광도 측정 팀은 다른 지침 세트를 받게 되며, AI가 혼동할 일은 없습니다.

5. "스마트한 사서" (컨텍스트 패킹)
AI는 한 번에 읽을 수 있는 양(컨텍스트 윈도우)에 제한이 있습니다. 만약 도서관 전체를 준다면 과부하가 걸릴 수 있습니다. 팀은 현저성 인지 컨텍스트 패킹(salience-aware context packing) 시스템을 추가했습니다. 이것은 당신이 묻는 질문에 가장 중요한 페이지가 무엇인지 정확히 아는 매우 효율적인 사서라고 생각하세요. 단순히 책의 끝부분을 무작위로 잘라내는 대신, 시스템은 정보를 순위 매깁니다: "이 문장은 결정적이다", "이 이미지는 관련이 있다", "이 오래된 채팅 메시지는 요약할 수 있다". 시스템은 LLMLingua-2라는 도구를 사용하여 의미를 잃지 않으면서 텍스트를 축소함으로써, AI가 시스템 오류 없이 더 많은 중요한 정보를 뇌에 담을 수 있도록 합니다.

현실적인 점검: 여전히 까다로운 부분은?

저자들은 이 시스템이 아직 무엇을 할 수 없는지에 대해 매우 솔직합니다. 그들은 이것이 마법 지팡이라고 주장하지 않습니다.

  • 하이브리드 구조: 시스템은 여전히 구형 코드와 신형 코드의 혼합체입니다. 일부 부분은 로컬 컴퓨터에서 완벽하게 작동하지만, 다른 부분은 여전히 클라우드를 위해 설정되어 있습니다. 이로 인해 시스템이 어떤 "모드"에 있는지에 따라 다르게 동작하는 것과 같은 기이한 결함이 발생할 수 있습니다.
  • 메모리 지연: 메모리 업데이트가 백그라운드에서 일어나기 때문에(빠른 채팅을 유지하기 위해), 약간의 지연이 발생합니다. 만약 당신이 새로운 것을 말하자마자 질문을 던진다면, AI가 아직 그것을 "듣지" 못했을 수도 있습니다.
  • "암묵적" 테스트: 팀은 공식적인 문서(천문학 논문 등)를 대상으로 시스템을 테스트했으며 좋은 성과를 거두었습니다. 하지만 그들은 이 시스템이 슬랙(Slack) 메시지, 회의록, 또는 코드 주석과 같은 더 무질서한 자료들에 대해서는 아직 충분히 테스트되지 않았음을 인정했습니다. 그들은 이러한 종류의 비공식적인 "암묵적" 지식을 포착하는 것이 다음 큰 과제라고 제안합니다.
  • 속도 vs 지능: 시스템은 빠르지만, 때때로 속도와 정확도 사이에서 선택을 해야 합니다. 컴퓨터의 메모리(VRAM)가 부족해지면, 시스템은 속도를 늦추거나 일부 정보를 버려야 합니다.

결론

AquiLLM은 과학 연구를 위한 중요한 진전입니다. 이는 AI가 기업이 소유한 블랙박스여야 한다는 관념에서 벗어나, 다시 연구자의 손으로 가져오는 작업입니다. 시스템을 로컬화하고, 멀티모달화하며, 메모리를 인지하게 함으로써, 연구의 프라이버시와 워크플로우를 존중합니다. 논문은 이 시스템이 완벽하지는 않을지라도, 연구 그룹의 구성원이 오고 가더라도 그들의 집단 지성을 온전히 유지하는 데 강력한 도구가 될 수 있음을 시사합니다. 이는 해결된 문제는 아니지만, 협력적 과학의 미래를 향한 매우 유망한 프로토타입입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →