← 최신 논문
🤖 machine learning

VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening

VetClaw는 시각 및 텍스트 입력을 결합하여 제로샷 분류를 개선하고 안전성, 신뢰성 및 구조화된 진단 지원을 보장함으로써 수의 질병 스크리닝을 강화하기 위해 에지 기반 인터랙션 매니저와 클라우드 호스팅 LangGraph 워크플로우를 통합한 에지-클라우드 멀티모달 에이전트 시스템입니다.

원저자: Syed Mhamudul Hasan, Anas AlSobeh, Hussein Zangoti, Abdur R. Shahid

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Syed Mhamudul Hasan, Anas AlSobeh, Hussein Zangoti, Abdur R. Shahid

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 반려동물이 말을 할 수 있는 세상을 상상해 보세요. 만약 당신의 강아지가 발바닥이 아프다면, 단순히 절뚝거리는 대신 "저기, 내 발바닥이 아파요, 그리고 빨갛게 부어올랐어요"라고 말할 것입니다. 현실에서 동물은 우리의 언어를 말할 수 없으며, 의료 서류를 작성할 수도 없습니다. 이러한 침묵은 수의사들이 질병을 조기에 발견하는 것을 어렵게 만듭니다. 특히 아픈 동물이 무엇이 문제인지 말할 수 없을 때 더욱 그렇습니다. 이 간극을 메우기 위해, 과학자들은 인공지능(AI)을 이용한 '스마트한 조력자'를 만들고 있습니다. AI를 아픈 동물의 사진을 보고 증상 설명을 읽어 무엇이 잘못되었는지 추측할 수 있는 초정밀 관찰력을 가진 탐정이라고 생각해 보세요. 하지만 단지 탐정을 갖는 것만으로는 충분하지 않습니다. 팀 전체가 필요합니다. 사진을 찍을 사람, 단서들을 정리할 사람, 탐정이 헛소리를 하고 있지는 않은지 확인할 사람, 그리고 사건이 너무 까다로울 때 도움을 요청할 사람이 필요합니다. 여기서 '엣지 컴퓨팅'(작은 카메라처럼 동물이 있는 바로 그곳에서 작업을 수행하는 것)과 '에이전틱 시스템'(단순한 계산기가 아니라 일꾼 팀처럼 작동하는 AI)의 개념이 등장합니다. 큰 질문은 이것입니다: 동물이 한 마디도 할 수 없더라도, 질병이 심각해지기 전에 병을 포착해낼 수 있는 디지털 팀을 구축할 수 있을까요?

여기에 그 팀이 되기 위해 설계된 새로운 디지털 시스템인 VetClaw가 등장합니다. VetClaw를 농장이나 축장의 스마트 카메라 역할을 하는 라즈베리 파이(Raspberry Pi)라는 작은 컴퓨터에 배치된 고성파 '반려동물 건강 탐정단'이라고 상상해 보세요. 이 시스템은 단순히 사진을 찍고 추측하는 것이 아니라, 두 가지 주요 부분과 함께 잘 짜인 기계처럼 작동합니다. 먼저, 카메라에 거주하며 현장에서 활동하는 '현장 요원'(OpenClaw라고 불림)이 있습니다. 이 요원은 깨어나서 소나 개의 사진을 찍고, 근처에 있는 사람에게 "이 동물이 아파 보이나요? 무엇이 보이나요?"라고 묻습니다. 이 요원은 사진과 사람이 작성한 메모를 수집합니다. 그런 다음 이 단서들을 '미션 컨트롤'(LangGraph라고 불림)로 전달합니다. 미션 컨트롤은 워크플로우를 조직하는 두뇌입니다. 이곳은 사진이 선명한지 확인하고, 단서들을 클라우드의 강력한 컴퓨터로 보내며, 답변을 기다립니다.

클라우드 컴퓨터는 시각-언어 모델(Vision-Language Model, VLM)이라는 특별한 유형의 AI를 사용합니다. 이 모델을 모든 의학 서적을 읽었지만 실제 동물은 한 번도 본 적 없는 아주 똑똑한 수의대생이라고 생각해 보세요. 이 모델은 사진과 메모를 보고 질병을 추측합니다. 하지만 반전은 있습니다. VetClaw는 이 학생을 맹목적으로 믿지 않습니다. '미션 컨트롤'에는 엄격한 안전 규칙이 있습니다. 만약 학생이 확신이 없거나, 사진이 흐릿하거나, 메모에 긴급한 상황이 적혀 있다면, 시스템은 단순히 진단을 내뱉지 않습니다. 대신, 이 사례를 표시하고 상세 내용을 기록한 뒤, 인간 수의사가 더 자세히 살펴볼 수 있도록 '안전 경보'를 보냅니다. 이는 마치 "무엇이 문제인지 알 것 같지만, 대장님께 확인을 받아야겠어요"라고 말할 줄 아는 주니어 탐정과 같습니다.

연구진은 두 가지 사진 세트를 사용하여 이 시스템을 테스트했습니다. 하나는 다양한 반려동물 질병이 담긴 1,736장의 이미지였고, 다른 하나는 피부 문제를 가진 강아지 443장의 사진이었습니다. 그들은 AI에 정보를 제공하는 세 가지 다른 방법을 시도했습니다: 사진만 제공하기, 텍text 설명만 제공하기, 그리고 사진과 텍스트를 섞어서 제공하기입니다. 결과는 매우 흥-미로웠습니다. AI가 사진만 보았을 때(마치 흐릿한 스냅샷으로 질병을 맞히려는 것처럼)는 성능이 좋지 않았습니다. 강아지 피부 질병 테스트에서 정답률은 약 33%에 불과했습니다. 그러나 AI가 증상을 읽고 사진까지 함께 볼 수 있게 되자, 성능이 크게 뛰어올랐습니다. 강아지 피부 테스트에서 정확도는 72% 이상으로 상승했으며, 광범위한 반려동물 질병 테스트에서도 텍스트와 이미지의 조합이 시스템이 훨씬 더 똑똑한 추측을 하도록 도왔습니다. 흥미롭게도, 어떤 경우에는 사진만 보는 것보다 증상에 대한 텍스트 설명을 읽는 것이 훨씬 더 강력했는데, 이는 무엇을 찾아야 하는지 아는 것이 단순히 보는 것보다 더 중요할 수 있음을 시사합니다.

이 논문은 이러한 '팀 접근 방식'이 동물 건강 모니터링의 미래라고 제안합니다. 이는 카메라, 인간의 관찰, 그리고 스마트한 AI 워크플로우를 결합하면 단순한 카메라보다 더 빨리 질병을 잡아낼 수 있음을 보여줍니다. 하지만 저자들은 이것이 '진행 중인 작업'임을 신중하게 밝히고 있습니다. 그들은 자신들의 테스트가 상대적으로 작은 규모의 사진 그룹을 사용했다는 점과, AI가 수만 마리의 아픈 동물에 대해 특별히 훈련받지 않은 채 추측했다는 점(이를 '제로샷' 방식이라 함)을 인정합니다. 또한 현재의 카메라는 한 방향에서만 볼 수 있어 동물이 움직일 경우 놓칠 수 있다는 점도 언급했습니다. 하지만 핵심 아이디어는 견고합니다. 정적인 카메라를 조정되고 안전을 고려하는 팀으로 바꿈으로써, VetClaw는 단순히 병을 예측하는 것을 넘어 확인, 검증, 그리고 필요할 때 도움을 요청하는 전체 과정을 관리할 수 있는 시스템을 구축할 수 있음을 시사합니다. 이는 우리의 털 달린 친구들이 스스로 말할 수 없을 때도 필요한 보살핌을 받을 수 있는 세상을 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →