← 최신 논문
💻 computer science

Retrieval-Augmented Visual Prompting: Guiding Foundation Models in Two-Photon Imaging

이 논문은 검색된 주석이 달린 예시들을 SAM 3와 같은 파운데이션 모델에 시각적 프롬프트로 주입함으로써 이광자 칼슘 이미징에서의 제로샷 뉴런 검출 및 인스턴스 분할을 향상시키는 프레임워크인 Retrieval-Augmented Visual Prompting (RAVP)를 소개하며, 이는 전통적인 미세 조정에 대한 효과적인 추론 시점의 대안을 제공한다.

원저자: Salvatore Calcagno, Marco Finocchiaro, Giovanni Bellitto, Daniela Giordano, Concetto Spampinato, Federica Proietto Salanitri

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Salvatore Calcagno, Marco Finocchiaro, Giovanni Bellitto, Daniela Giordano, Concetto Spampinato, Federica Proietto Salanitri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

살아있는 뇌 내부의 조용하고 어두운 세계에서, 과학자들은 강력한 현미경을 사용하여 뉴런이 발화하는 모습을 관찰합니다. 이 기술은 이광자 칼슘 이미징(two-photon calcium imaging)으로 알려져 있으며, 어두운 배경을 바탕으로 빛나는 밝은 점들로서 개별 뇌세포의 전기적 활동을 포착합니다. 이는 현대 신경과학의 초석으로, 연구자들이 세포 집단이 어떻게 협력하여 사고와 움직임을 만들어내는지 볼 수 있게 해줍니다. 그러나 이 빛나는 영상들을 유용한 데이터로 바꾸는 것은 매우 어렵습니다. 이미지는 지저서히며, 어떤 세포는 밝게 빛나는 반면 다른 세포는 희미하고, 세포의 모습은 실험 대상 동물, 촬영 중인 뇌의 깊이, 또는 특정 장비에 따라 급격하게 변합니다. 이 세포들을 연구하기 위해 과학자들은 먼저 각 세포 주위에 정밀한 윤곽을 그려야 하는데, 이는 느리고 비용이 많이 들며 인간의 실수에 취약한 작업입니다. 수년 동안 인공지능이 이를 자동으로 수행할 수 있기를 바라는 희망이 있었지만, 세포들이 보이는 모습의 엄청난 다양성 때문에 컴퓨터 프로그램이 한 실험에서 다른 실험으로 일반화하는 데 어려움이 있었습니다.

최 최근, 아주 적은 지시만으로도 이미지를 이해할 수 있는 새로운 세대의 인공지능 모델들이 등장했습니다. 이들은 파운데이션 모델(foundation models)이라 불리며, 방대한 일상 사진 모음을 통해 학습하여 모든 세부 사항을 배울 필요 없이 모양과 사물을 인식하는 법을 익힙니다. 무엇이든 분할(segmentation)할 수 있도록 설계된 하나의 모델은 의료 영상 분야에서 가능성을 보여주었습니다. 하지만 연구자들이 이 강력한 도구를 복잡하고 변화무쌍한 뇌세포 영상에 직접 적용하려 했을 때, 모델은 고전했습니다. 고양이, 자동차, 나무를 학습한 모델은 뉴런의 미묘하고 빛나는 덩어리를 자연스럽게 이해하지 못했습니다. 모델에게는 도움이 필요했지만, 인공지능을 돕는 전통적인 방식은 모델에게 새로운 규칙을 배우도록 수천 개의 새로운 사례를 입력하여 재학습시키는 것이었습니다. 이 과정은 느리고 방대한 양의 라벨링된 데이터를 필요로 하며, 종종 모델을 특정 방식으로 보는 방식에 고착시켜 미래의 실험에 대한 유연성을 떨어뜨립니다.

이탈리아 카타니아 대학교의 연구팀은 다른 질문을 던졌습니다. 인공지능의 '뇌'를 바꾸는 대신, 인공지능이 세상을 보는 '눈'을 바꿀 수 있을지 고민한 것입니다. 그들은 검색 증강 시각 프롬프팅(Retrieval-Augmented Visual Prompting)이라고 불리는 방법을 제안했습니다. 당신이 친구에게 특정 종류의 구름을 설명하려고 한다고 상상해 보십시오. 단어와 색상으로 설명할 수도 있지만, 단순히 그 구름의 사진을 보여줄 수도 있습니다. 연구자들은 인공지능을 안내하는 가장 좋은 방법은 사진을 보여주는 것이라는 점을 깨달았습니다. 그들은 모델이 새로운 뇌 영상을 보기 전에, 이전에 주석(annotation)이 달린 이미지 라이브러리에서 신중하게 선택된 뉴런의 작은 예시를 보여주는 시스템을 구축했습니다. 이 예시는 새로운 이미지 바로 옆에 배치되어 시각적 힌트 역할을 합니다. 그런 다음 모델은 그 예시와 닮은 다른 모든 뉴런을 찾아내라는 요청을 받습니다.

연구진은 마우스의 뇌 기록물로 구성된 거대한 공개 데이터셋을 통해 이 아이디어를 테스트했습니다. 그들은 단 하나의 잘 선택된 예시를 모델에게 보여주는 것만으로도, 모델이 해당 특정 유형의 뇌 기록을 본 적이 없음에도 불구하고 뉴런을 찾고 윤곽을 그리는 능력이 극적으로 향상된다는 것을 발견했습니다. 핵심은 아무 예시나 보여주는 것이 아니라, '올바른' 예시를 보여주는 것이었습니다. 그들은 예시의 밝기와 질감을 분석 중인 특정 이미지와 일치시켜 라이브러리에서 가장 적합한 예시를 찾는 스마트한 방법을 개발했습니다. 이 방법을 사용했을 때 모델의 성능은 크게 뛰어올랐으며, 광범위하게 재학습된 모델과 갓 학습된 모델 사이의 격차를 좁혔습니다. 실제로, 완벽하게 매칭된 단 하나의 예시를 사용하는 것이 여러 개의 서로 다른 예시를 동시에 보여주는 것보다 더 효과적이었습니다. 이 연구는 뇌 스캔과 같은 전문적인 작업의 경우, 앞으로 나아가는 가장 효율적인 길은 인공지능을 밑바닥부터 다시 만드는 것이 아니라, 결정이 필요한 순간에 올바른 시각적 맥락을 제공하는 것일 수 있음을 시사합니다.

결과는 다양한 유형의 뇌 기록에 걸쳐 명확하고 일관되었습니다. 모델이 스스로 추측하도록 내버려 두었을 때, 모델은 종종 희미한 세포를 놓치거나 지저lidir 윤곽을 그렸습니다. 하지만 연구자들이 라이브러리에서 관련 있는 단 하나의 예시를 제공하자, 모델은 갑자기 무엇을 찾아야 할지 이해했습니다. 모델은 평소에 간과되기 쉬운 희미하고 어두운 세포를 훨씬 더 잘 찾아냈으며, 서로 맞닿아 있는 세포들을 분리해 내는 능력도 향상되었습니다. 또한 연구진은 예시를 선택하는 구체적인 방식이 중요하다는 것을 발견했습니다. 무작위 예시는 도움이 되었지만, 새로운 이미지의 특정 조건에 맞춰 선택된 예시는 훨씬 더 큰 도움이 되었습니다. 그들은 이미지에 대해 가장 유용할 예시를 예측하는 법을 배우는 작고 가벼운 컴퓨터 프로그램을 선택기(selector)로 훈련시켰습니다. 이 선택기는 메인 인공지능 모델의 핵심 설정을 전혀 변경하지 않고도 새로운 조건에 즉각적으로 적응할 수 있게 해주었습니다.

이 접근 방식은 인공지능을 재학습시키는 표준 방식에 대한 설득력 있는 대안을 제시합니다. 재학습은 상당한 컴퓨팅 능력과 시간을 요구하며, 종종 특정 작업에는 뛰어나지만 다른 작업은 잊어버리는 모델을 만듭니다. 새로운 방법은 기존 모델을 수정 없이 그대로 유지함으로써 일반적인 지식을 보존하면서도, 단순한 시각적 단서를 통해 새로운 어려운 작업에 적응할 수 있게 합니다. 연구진은 이 방법이 전체 재학습을 통해 얻을 수 있는 성능 향상의 상당 부분을 회복하면서도, 비용은 훨씬 적게 든다는 것을 발견했습니다. 이는 데이터가 부족하고 조건이 극도로 다양하게 변하는 분야에서, 인공지능의 미래가 기계에게 새로운 사실을 가르치는 것보다 올 세상을 바라보는 올바른 렌즈를 통해 보는 법을 가르치는 데 달려 있을 수 있음을 시사합니다. 입력을 통해 시각적 기억을 직접 주입함으로써, 연구진은 파운데이션 모델이 매개변수 적응(parameter adaptation)이라는 무거운 부담 없이도 전문적인 생물 의학 영상 분야에서 전문가 수준의 작업을 수행하도록 유도할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →