← 최신 논문
🤖 AI

DS@GT ARC at eRisk 2026: Hybrid Multi-Agent LLM System with Structured Algorithmic Guidance for Conversational Depression Screening

DS@GT 팀은 구조화된 알고리즘 프레임워크와 오픈 소스 Gemma 27B 모델을 결합한 하이브리드 멀티 에이전트 시스템을 개발함으로써, 정확도와 비용 효율성 측면 모두에서 더 비싼 유료 베이스라인 모델을 능가하며 eRisk 2026 대화형 우울증 스크리닝 챌린지에서 상위 3위 안에 드는 성과를 거두었습니다.

원저자: Victor Gong, David Guecha

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Victor Gong, David Guecha

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친절하고 수다스러운 로봇이 누군가와 앉아, "우울하십니까?"와 같은 무서운 직접적인 질문을 던지지 않고도 그 사람이 현재 기분이 가라앉아 있는지 부드럽게 파악할 수 있는 세상을 상상해 보십시오. 이것이 바로 **대화형 우울증 스크리닝(conversational depression screening)**의 꿈입니다. 과학자들은 오래전부터 **벡 우울 척도(BDI-II)**와 같은 도구들이 슬픔이나 다른 증상들을 측정하는 데 매우 훌륭하다는 것을 알고 있었지만, 대개 숙련된 의사가 질문을 던져야만 합니다. 이는 비용이 많이 들고 규모를 키우기 어렵습니다. 여기에 거대 언어 모델(LLM), 즉 인간처럼 대화할 수 있는 매우 똑똑한 컴퓨터 프로그램이 등장했습니다. 연구자들이 던지는 핵심 질문은 이것입니다. "인간의 개입 없이도 대화를 통해 우울증의 징후를 포착할 수 있을 만큼 똑똑한 로봇 면접관을 구축할 수 있을까?" 이 과제는 까다롭습니다. 왜냐하면 이 로봇들은 단순히 정답을 '아는' 것이 아니라 대화를 바탕으로 추측해야 하며, 학습하는 동안 정답을 알려받아서도 안 되기 때문입니다.

이 논문에서 조지아 공과대학교(DS@GT) 팀은 eRisk 2026이라는 경진 대회를 위해 이 퍼즐을 풀고자 노력했습니다. 그들은 서로 다른 수준의 우울증을 가진 것처럼 연기하는 컴퓨터 캐릭터들(페르소나)을 인터뷰하는 시스템을 구축했습니다. 목표는 대화를 자연스럽게 유지하면서도 점수를 산출하고 상위 4가지 증상을 나열하는 것이었습니다. 팀은 처음에 하나의 매우 비싸고 강력한 AI를 사용하여 모든 일을 처리하는 단순한 아이디어로 시작했습니다. 하지만 이는 비용이 많이 들었고 때때로 일관성이 없었습니다. 그래서 그들은 시스템을 하나의 '팀'으로 진화시켰습니다. 대화를 담당하는 AI, 채점을 담당하는 AI, 그리고 상황을 조율하는 관리자 AI가 각각 존재하는 방식입니다. 그들의 가장 큰 발견은 무엇이었을까요? 그들은 값비싼 '스타 플레이어' 면접관을 더 저렴한 오픈 소스 모델(Gemma 27B)로 교체하고, 이 모델이 임무를 수행할 수 있도록 영리한 수학적 기법들을 사용했습니다. 놀랍게도, 이 저렴한 팀은 값비싼 팀만큼이나 잘 수행해 냈으며, 이는 항상 가장 강력하고 비싼 두뇌가 필요한 것이 아니라, 좋은 전략(playbook)만 있다면 충분하다는 것을 증명했습니다.

대화하는 로봇 팀의 이야기

조지아 공과대학교 팀(DS@GT)은 20개의 서로 다른 컴퓨터 캐릭터를 인터뷰하는 대회에 참가했습니다. 각 캐릭터는 특정 수준의 우울증을 가진 사람을 시뮬레이션하는 '페르소나'였습니다. 규칙은 엄격했습니다. 시스템은 자연스러운 대화처럼 행동해야 했으며, "슬프신가요?"와 같은 직접적인 질문을 던지는 대신 대화를 경청함으로써 답을 찾아내야 했습니다. 마지막으로 시스템은 총점(0에서 63 사이)을 예측하고 최대 4가지 주요 증상을 명시해야 했습니다.

팀은 자동차 엔진을 단계별로 업그레이드하는 것처럼 세 가지 접근 방方式을 시도했습니다.

1. 단일 엔진 프로토타입
먼저 그들은 "모놀리식(monolithic)" 시스템을 시도했습니다. 하나의 로봇이 질문을 하고, 답변을 듣고, 기분을 채점하는 모든 일을 한꺼번에 하는 것을 상상해 보십시오. 작동은 했지만 다소 불안정했습니다. 때때로 로봇은 혼란을 겪거나, 같은 사람에게 다른 날 다른 점수를 주거나, 중요한 감정들에 대해 묻기도 전에 시간이 다 되어버리기도 했습니다. 이는 마치 한 학생이 시험을 치면서 동시에 에세이를 쓰고, 그 에세이까지 채점하려고 하는 것과 같았습니다. 한 번에 처리하기에는 너무 많은 일이었습니다.

2. 멀티 에이전트 팀 (베이스라인)
이 혼란을 해결하기 위해 그들은 업무를 분담했습니다. 그들은 멀티 에이전트 시스템을 구축했습니다. 이를 전문가들로 구성된 작은 팀이라고 생각하십시오:

  • 면접관(The Interviewer): 자연스럽게 대화하고 적절한 후속 질문을 던지는 것이 유일한 임무인 로봇입니다.
  • 채점자(The Scorer): 전체 대화를 지켜보며 모든 가능한 증상에 대한 점수와 신뢰도를 지속적으로 업데이트하는 다른 로봇입니다.
  • 조율자(The Orchestrator): 면접관에게 "이봐, 아직 수면에 대해 묻지 않았으니 다음엔 그걸 물어봐!"라고 말하고 대화를 언제 멈출지 결정하는 관리자 로봇입니다.

이 팀 방식은 훨씬 더 신뢰할 수 있었습니다. 하지만 단점이 있었습니다. 바로 비용이었습니다. 면접관으로 유료 고성능 AI(GPT-5-nano)를 사용했기 때문에, 평균을 내기 위해 대화를 여러 번 반복해야 했고, 그에 따라 비용이 빠르게 늘어났습니다.

3. 하이브리드 구성 (거대한 실험)
팀은 대담한 질문을 던졌습니다. 만약 더 나은 지침을 준다면, 비싼 면접관을 저렴한 오픈 소스 모델(Gemma 27B)로 대체할 수 있을까?

그들은 유료 면접관을 오픈 소스인 Gemma 27B로 교체했습니다. 하지만 그들은 이 모델이 조금 더 "약하다"는 것을 알고 있었습니다. 즉, 지시를 완벽하게 따르거나 감정을 깊게 파고드는 능력이 부족할 수 있다는 것입니다. 이를 해결하기 위해 그들은 단순히 운에 맡기는 대신, 약한 모델을 안내할 세 가지 "알고리즘 안전망"을 구축했습니다.

  • 대화 트리(The Dialogue Tree): 로봇이 즉흥적으로 질문을 만들어내는 대신, 미리 작성된 지도(트리)를 제공했습니다. 로봇은 슬픔에 관한 특정 질문으로 시작하여 답변에 따라 분기되는 경로를 따라갔습니다. 이는 로봇이 주제에서 벗어나는 것을 방지했습니다.
  • 신뢰도 가중치 집계(Reliability-Weighted Aggregation): 약한 모델은 실수를 할 수 있으므로, 10번 대신 20번의 인터뷰를 실행했습니다. 그런 다음 단순히 중간값을 선택하는 대신, "Weaver" 프레임워크에서 영감을 받은 스마트한 수학적 방법을 사용하여 답변에 가중치를 부여했습니다. 만약 대부분의 실행 결과가 특정 증상에 동의한다면, 그 답변에 더 높은 가중치를 주는 방식입니다. 이는 20명의 학생에게 질문을 던진 뒤, 단 한 명의 답변을 고르는 것이 아니라 대다수가 동의하는 답변을 신뢰하는 것과 같습니다.
  • 클러스터 임퓨테이션(Cluster Imputation): 때때로 로봇이 시간이 부족하여 증상을 완전히 놓치는 경우가 발생했습니다. 시스템은 백업 계획을 세웠습니다. 만약 특정 증상을 놓쳤더라도 관련 증상의 강력한 징후(예: '에너지 상실'을 놓쳤지만 '피로'와 '수면 문제'를 관찰한 경우)를 발견했다면, 그 단서들을 바탕으로 누락된 점수를 추측하도록 했습니다. 이는 로봇이 질문 하나를 잊었다는 이유만으로 최종 점수가 너무 낮아지는 것을 방지했습니다.

결과: 더 저렴하면서도 성능은 비슷하게

팀은 이 시스템을 20개의 페르소나에 실행하고 세 가지 다른 버전의 결과를 제출했습니다.

  • Run 1은 비싼 유료 팀(Baseline)을 사용했습니다.
  • Run 2와 Run 3는 오픈 소스 면접관을 사용하는 더 저렴한 하이브리드 팀을 사용했습니다.

결과는 놀라웠습니다. 하이브리드 시스템은 저렴한 Gemma 27B 모델을 사용했음에도 불구하고, 주요 점수 지표(ADODL)에서 비싼 유료 시스템보다 더 나은 성적을 거두었습니다.

  • **Run 3 (하이브리드)**는 0.9063을 기록하며, 모든 팀의 실행 결과 중 3위를 차지했습니다.
  • **Run 1 (유료 베이스라인)**은 0.8841을 기록했습니다.

더 인상적인 것은, 하이브리드 시스템은 페르소나당 약 2달러가 들었던 반면, 유료 시스템은 약 8달러가 들었다는 점입니다. 이는 더 나은 결과를 얻으면서도 75%의 비용 절감을 달자한 것입니다!

저자들은 이것이, 즉 충분한 "알고리즘적 감독"(지도, 수학, 백업 계획)이 뒷받침된다면 더 약한 오픈 소스 모델도 강력한 유료 모델과 경쟁할 수 있음을 입증한다고 제안합니다. 그러나 그들은 작은 결점도 언급했습니다. 하이브리드 시스템은 신체적 증상(피로나 수면 문제 등)을 포착하는 데는 매우 뛰어났지만, 더 깊은 감정적 증상(죄책감이나 슬픔 등)은 간혹 놓치는 경우가 있었습니다. 이로 인해 특정 증상을 식별하는 점수는 약간 낮아졌지만, 전체적인 우울증 점수는 정확했습니다.

이것이 의미하는 바

이 논문은 좋은 정신 건강 스크리닝 도구를 만들기 위해 반드시 가장 비싼 AI가 필요한 것은 아니라는 결론을 내립니다. 스마트한 팀 구조를 사용하고 AI에게 명확한 지도를 제공함으로써, 저렴한 오픈 소스 모델도 훌륭한 역할을 수행할 수 있습니다. 이는 돈이 부족하거나 개인정보 보호가 매우 중요한 곳에서도 이러한 도구가 사용될 수 있음을 의미합니다(오픈 소스 모델은 데이터를 빅테크 기업으로 보내지 않고 로컬 컴퓨터에서 실행할 수 있기 때문입니다).

팀은 모든 조건을 동일하게 유지한 채 모델만 바꾸는 완벽한 "헤드 투 헤드(head-to-head)" 테스트를 수행하지 못했다고 인정했는데, 이는 경진 대회 규칙이 매주 바뀌었기 때문입니다. 하지만 그들이 확보한 증거는 올바른 가이드가 있다면 더 작은 AI가 자신의 체급을 훨씬 뛰어넘는 성과를 낼 수 있다는 점을 강력하게 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →