← 최신 논문
💬 NLP

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

StocksTalk는 스트리밍 음성 인식, 검색 증강 제약 조건 추출, 그리고 대화형 인간 참여 검증(human-in-the-loop)을 결합하여 기준이 되는 LLM 방식보다 정확도와 안정성 면에서 뛰어난 성능을 발휘하며, 구어체 금융 요청을 검증되고 실행 가능한 SQL 쿼리로 변환하는 투명한 음성 지원 대화형 에이전트입니다.

원저자: Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

금융의 세계에서 결정을 내리는 것은 종종 건초더미에서 바늘을 찾는 것처럼 느껴지지만, 그 건초더미는 수백만 개의 숫자로 이루어져 있으며 바늘은 특정한 성장이나 가치의 패턴입니다. 수십 년 동안 연구자들은 컴퓨터가 인간의 언어를 이해하도록 가르쳐서 누구나 질문을 던지면 데이터베이스로부터 정확한 답변을 얻을 수 있도록 노력해 왔습니다. 텍스트 투 SQL(text-to-SQL)로 알려진 이 분야는 사람들이 말하는 무질서하고 유연한 방식을 컴퓨터 데이터베이스가 요구하는 엄격하고 정확한 언어로 번역하는 것을 목표로 합니다. 그러나 이러한 시스템 대부분은 텍스트로 된 조용하고 완벽한 조건에서 테스트되었습니다. 이들은 배경 소음, 억양, 그리고 불완전한 생각으로 말하는 인간의 자연스러운 경향이 존재하는 실제 인간의 음성 앞에서는 어려움을 겪습니다. 단 하나의 숫자 오해로도 막대한 비용이 드는 실수를 초래할 수 있는 고위험 투자 현장에서, 사람이 말하는 것과 컴퓨터가 실행하는 것 사이의 간극은 위험한 심연입니다.

IIIT-델리(IIIT-Delhi)와 싱가포르 기술대학교(Singapore Institute of Technology)의 연구팀은 이 간극을 메우기 위해 '스톡스톡(StocksTalk)'이라는 새로운 시스템을 구축했습니다. 그들은 음성 기반의 어시스턴트를 만들어, 구두로 전달된 투자 아이디어를 유효하고 작동 가능한 데이터베이스 쿼리로 변환하도록 설계했습니다. 사용자의 의도를 추측하고 결과가 잘 나오기를 바라는 기존의 도구들과 달리, 스톡스톡은 투명하고 신중하도록 설계되었습니다. 이 시스템은 주식을 찾는 과정을 단 한 번의 논리적 도약이 아니라, 컴퓨터가 자신의 작업을 검증하고 인간에게도 검증을 요청하는 일련의 세심한 단계로 취급합니다. 시스템은 사용자의 말을 듣고, 문장을 특정 금융 규칙으로 분해하며, 해당 규칙을 실시간 시장 데이터베이스와 대조한 다음, 실제로 검색을 실행하기 전에 자신이 무엇을 할 계획인지 사용자에게 정확히 보여줍니다.

연구진은 세 가지 유형의 투자 전략—빠르게 성장하는 기업 찾기, 정기적인 배당금을 지급하는 주식 찾기, 저평가된 자산 사냥하기—을 포함하여 정교하게 준비된 150개의 음성 프롬프트로 이 시스템을 테스트했습니다. 이 프롬프트들은 두 가지 매우 다른 환경, 즉 조용한 방과 실제 세계의 산만함을 시뮬레이션하기 위한 시끄러운 카페테리아에서 각각 녹음되었습니다. 결과에 따르면, 보조 장치가 없는 일반적인 인공지능 모델은 약 81%의 확률로 쿼리를 생성하며 충돌 없이 작동했지만, 종종 논리적으로 일관성이 없거나 금융적으로 말이 안 되는 답을 내놓았습니다. 반면, 검증 레이어를 추가하고 과정 중에 특정 금융 정의를 검색하는 방법을 도입함으로써, 시스템은 올바른 쿼리를 생성하는 능력을 거의 98%까지 향상시켰습니다. 더 중요한 점은, 인간이 단계를 검증할 수 있도록 허용했을 때 주고받는 대화 과정에서 경로를 유지하는 능력이 약 51%에서 거의 89%로 극적으로 향상되었다는 것입니다.

이 시스템 성공의 핵심은 인간 언어의 불확실성을 처리하는 방식에 있습니다. 사용자가 "수익성이 개선되는 대형 기술주를 찾아줘"라고 말하면, 시스템은 즉시 검색을 실행하지 않습니다. 대신, 먼저 음성을 텍스트로 변환한 다음, 검색 시스템을 사용하여 사용하는 특정 데이터베이스의 맥락에서 "수익성 개선"이 정확히 무엇을 의미하는지 찾아냅니다. 그런 다음 초안 쿼리를 작성하여 대시보드에 표시합니다. 이 대시보드는 추출된 규칙, 선택된 수학적 연산자, 그리고 실행하려는 최종 코드를 사용자에게 보여줍니다. 사용자는 검색이 시작되기 전에 컴퓨터가 숫자나 카테고리를 잘못 이해했는지 확인하고 이를 수정할 수 있습니다. 이러한 '인간 참여형(human-in-the-loop)' 접근 방식은 특히 여러 조건이 포함된 복잡한 요청에서 필수적이었는데, 시스템 단독으로는 세 번 중 한 번 꼴로 오류를 범했기 때문입니다.

또한 본 연구는 음성 인식 자체의 품질이 가장 큰 장애물임을 강조했습니다. 오디오가 시끄러운 환경에서 녹음되었을 때, 특정 숫자와 금융 용어를 정확히 식별하는 시스템의 능력이 크게 떨어졌으며, 이는 최종 쿼리의 오류를 증가시켰습니다. 이는 논리와 검증 레이어가 견고하더라도, 사용자의 말을 명확하게 듣는 첫 번째 단계가 여전히 가장 취약한 부분임을 시사합니다. 연구진은 문제를 작고 검증 가능한 단계로 나누는 방법이 작은 실수가 큰 실패로 이어지는 것을 방지한다는 것을 발견했습니다. 예를 들어, 사용자가 검색 조건을 정교화하는 다회차 대화에서, 인간의 검증이 없는 시스템은 종-종 원래의 제약 조건을 놓쳤던 반면, 상호작용형 버전은 거의 90%의 확률로 올바른 경로를 유지했습니다.

앞으로 팀은 이 접근 방식을 실시간 뉴스 및 실적 보고서까지 확장하여, "지난 분기에 수익 추정치를 상회한 기업은 어디인가?"와 같은 질문에 최신 데이터가 들어오는 대로 답변할 수 있도록 구상하고 있습니다. 또한 시스템이 새로운 발견 내용을 사용자의 기존 포트폴리오와 비교할 수 있도록 하여 더욱 개인화된 조언을 제공할 계획입니다. 이 연구는 복잡하고 위험도가 높은 과업을 수행할 때, 가장 신뢰할 수 있는 길은 스스로 완벽해지려고 노력하는 기계를 만드는 것이 아니라, 언제 멈추고, 자신의 작업 과정을 보여주고, 도움을 요청해야 하는지를 아는 기계를 만드는 것임을 입증합니다. 추론 과정을 가시화하고 편집 가능하게 만듦으로써, 스톡스톡은 인공지능이라는 블랙박스를 협업 도구로 변화시켜, 최종 답변이 단순한 추측이 아닌 현실 세계에서 검증된 사실이 되도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →