← 최신 논문
🤖 machine learning

Human Preference aligned Tabular Similarity

이 논문은 예측 작업에 최적화된 현재의 테이블형 임베딩 방식이 유사도 검색에 대한 인간의 선호도와 일치하지 않는다고 주장하며, 제품 수명 주기 관리(PLM) 사례 연구를 통해 이 간극을 해결하기 위한 새로운 평가 절차를 제안한다.

원저자: Frederik Hoppe, Astrid Franz, Marianne Michaelis, Lars Kleinemeier, Udo Göbel

게시일 2026-07-29
📖 5 분 읽기🧠 심층 분석

원저자: Frederik Hoppe, Astrid Franz, Marianne Michaelis, Lars Kleinemeier, Udo Göbel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 마법 같은 도서관을 걷고 있다고 상상해 보세요. 이곳의 모든 책은 사실 숫자와 단어로 이루어진 스프레드시트입니다. 이 도서관에는 당신이 들고 있는 책과 "유사한" 책을 찾아내는 것이 직업인 로봇들이 있습니다. 만약 당신이 "고장 난 토스터 수리하기"에 관한 책을 집어 든다면, 로봇은 케이크를 굽거나 자동차를 운전하는 책이 아니라, 토스터 수리에 관한 다른 책들을 가져다주어야 합니다. 이것이 바로 **표 형식 데이터(tabular data)**의 세계입니다. 즉, 우리 기업, 병원, 공장을 움직이는 조직화된 정보의 격자들입니다. 로봇들은 **임베딩(embeddings)**이라고 불리는 것을 사용하는데, 이는 각 데이터 행을 거대한 다차원 공간 속의 한 점으로 변환하는 보이지 않는 자기적 코드와 같습니다. 두 점이 가까울수록, 로간은 그 데이터가 더 유사하다고 생각합니다.

오랫동안 과학자들은 이 로봇들이 "이 부품이 부러질 것인가?" 또는 "가격은 얼마인가?"와 같은 특정 질문에 답하는 데 매우 능숙해지도록 가르쳐 왔습니다. 하지만 여기 함정이 있습니다. 정답을 잘 맞히는 것이 반드시 인간이 느끼기에 "유사하다"고 느끼는 것을 찾는 능력을 의미하지는 않는다는 것입니다. 로봇은 두 부품에 모두 숫자 "5"가 들어 있다는 이유로 그것들을 쌍둥이라고 생각할 수도 있지만, 인간 엔지니어는 하나는 나사이고 다른 하나는 볼트라는 것을 알고 있습니다. 이 논문은 매우 중요한 질문을 던집니다. 어떻게 하면 우리가 엔지니어, 공장 노동자, 혹은 구매자와 같이 이 시스템을 사용하는 서로 다른 사람들에게 실제로 의미 있는 것을 로봇이 찾도록 만들 수 있을까요?


문제점: 로봇이 "느낌"을 잘못 잡을 때

이 논문의 저자들은 제품 수명 주기를 관리하는 소프트웨어를 구축하는 회사와 협력하며 큰 간극을 발견했습니다. 그들은 로봇이 표 데이터를 저 보이지 않는 자기적 코드로 변換하는 데는 점점 더 똑똑해지고 있지만, 그 코드가 인간이 실제로 중요하게 생각하는 바와 일치하는지 확인할 좋은 방법이 없다는 것을 깨달았습니다.

예를 들어, 당신이 새로운 자동차 부품을 위한 "유사한" 변경 요청을 찾아달라고 로봇에게 요청한다고 가정해 봅시다. 엔지니어는 "이것들은 둘 다 엔진 냉각 시스템을 다루기 때문에 유사하다"라고 말할 수 있습니다. 공장 노동자는 "아니요, 이것들은 동일한 용접기를 필요로 하기 때문에 유사합니다"라고 말할 수 있습니다. 구매자는 "이것들은 동일한 공급업체로부터 왔기 때문에 유사합니다"라고 말할 수 있습니다.

논문은 현재의 로봇 테스트 방식이 마치 학생이 시인이 되려고 노력하고 있음에도 불구하고 오직 수학 시험 점수로만 그 학생을 성적 매기는 것과 같다고 주장합니다. 표준 테스트는 로봇이 숫자나 카테고리를 정확하게 예측하는지를 측정하지만, "인간 사용자가 그 결과를 유용하다고 느꼈는가?"를 묻지는 않습니다. 저자들은 인간의 생각을 묻지 않는다면, 우리는 눈을 가린 채 비행하고 있는 것과 같다고 제안합니다. 우리는 수학적으로는 완벽하지만 인간의 요구를 이해하는 데는 형편없는 로봇을 가질 수도 있습니다.

해결책: 데이터에 대한 "맛 테스트"

이를 해결하기 위해 저자들은 음식에 대한 블라인드 테스트와 비슷하지만 데이터에 적용되는 새로운 워크플로우를 제안합니다. 단순히 로봇을 실행하고 결과가 좋기를 바라는 대신, 그들은 인간의 피드백을 받기 위한 3단계 프로세스를 제안합니다.

  1. 설정: 먼저, 로봇은 모든 데이터에 대한 자기적 코드를 생성하고 이를 저장합니다.
  2. 선택: 인간 사용자는 특정 아이템(이하 "앵커")을 보여받습니다. 예를 들어 특정 부품이나 티켓 같은 것입니다. 그러면 로봇은 자신이 가장 가깝다고 생각하는 아이템 목록을 불러옵니다.
  3. 투표: 인간은 원래의 아이템과 로봇의 제안 중 하나를 나란히 놓고 비교합니다. 그런 다음 "동일함", "유사함", "약간 유사함", 또는 "유사하지 않음" 중 하나의 등급을 매깁니다.

이것은 단 한 번으로 끝나는 일이 아닙니다. 저자들은 이 과정을 반복하여 수천 개의 이러한 "투표"를 수집할 것을 제안합니다. 이를 통해 서로 다른 집단의 사람들이 실제로 무엇을 유사하다고 생각하는지에 대한 지도를 만들 수 있습니다.

발견한 점: 모두가 세상을 다르게 본다

이 아이디어를 테스트하기 위해 팀은 작은 파일럿 연구를 수행했습니다. 그들은 20개의 서로 다른 "티켓"(도움 요청이나 변경 사항 등) 목록을 가져와 세 명의 서로 다른 사람에게 로봇이 찾은 상위 6개 매칭 항목을 평가하도록 요청했습니다.

결과는 놀라웠습니다. 검토한 120개의 아이템 쌍 중에서, 세 사람은 단 63쌍(즉, 52.5%)에 대해서만 등급이 일치했습니다. 52쌍(43.3%)에서는 두 명은 동의했지만 세 번째 사람은 동의하지 않았습니다. 그리고 5쌍(4.2%)에서는 세 명 모두 서로 다른 등급을 주었습니다!

이는 "유사성"이 단일하고 고정된 사실이 아님을 증명합니다. 그것은 전적으로 당신이 누구인지에 달려 있습니다. 엔지니어는 구매자가 놓치는 패턴을 볼 수 있고, 그 반대의 경우도 마찬가지입니다.

그 후 팀은 어떤 로봇 알고리즘이 인간이 원하는 바를 가장 잘 추측하는지 알아보기 위해 10가지 서로 다른 로봇 알고리즘을 테스트했습니다. 여기서 반전이 있습니다. 단 하나의 "승자"는 없었습니다.

  • 검토자 1과 검토자 3의 경우, 알고리즘 7이 가장 좋았습니다.
  • 하지만 검토자 2의 경우, 알고리즘 4가 가장 좋았습니다.

더 흥ей미로운 점은, 검토자 2에게 있어 "최고"와 "차석"의 차이가 165개의 트리플릿(세 개가 한 묶음인 그룹) 중 단 한 개의 트리플릿일 정도로 미미했다는 것입니다. 이는 투표 수가 적을 때는 어떤 로봇이 진정으로 더 나은지 100% 확신하기 어렵다는 것을 시사합니다. 저자들은 더 많은 데이터가 필요하다고 지적하지만, 핵심적인 결론은 명확합니다. "하나의 크기가 모두에게 맞을 수는 없다(One size does not fit all)." 엔지니어에게는 완벽한 로봇이 구매자에게는 쓸모없을 수 있습니다.

신뢰를 위한 중요성

논문은 AI가 진정으로 신뢰할 수 있으려면, 단순히 로봇의 내부 수학에만 의존해서는 안 된다고 결론짓습니다. 우리는 인간이 끊임없이 로봇의 작업을 점검할 수 있는 시스템을 구축해야 합니다.

그들은 이 접근 방식의 네 가지 주요 이점을 강조합니다:

  • 공정성: 로봇이 (엔지니어 대 구매자와 같이) 서로 다른 집단을 편애하지 않고 공정하게 대하도록 보장합니다.
  • 투명성: 사람들이 로봇이 왜 특정 아이템을 선택했는지 알 수 있게 하여, "블랙박스"를 조금 덜 어둡게 만듭니다.
  • 강건성(Robustness): 중복 데이터나 혼란스러운 카테로리와 같이 로봇이 잘못 파악하고 있을 수 있는 지저-분한 데이터를 찾는 데 도움을 줍니다.
  • 책임성: 인간의 결정에 대한 기록을 만들어, 규제가 엄격한 산업에서 AI가 실수를 했을 때 매우 중요한 근거를 제공합니다.

저자들은 인간에게 이 작업을 요청하는 것이 어렵고 시간이 걸리는 일임을 인정합니다. 그들은 아직 문제를 완벽하게 해결했다고 주장하는 것이 아닙니다. 대신, 과학계가 이러한 "인간의 맛 테스트"를 AI를 구축하는 표준적인 부분으로 사용하기 시작할 것을 촉구하고 있습니다. 그들은 신뢰란 코드에 한 번 구워 넣는 것이 아니라, 시스템을 사용하는 사람들의 목소리에 끊임없이 귀를 기울임으로써 구축하는 것이라고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →