Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces
이 논문은 6개의 시각-언어 모델을 감사하여 감성적 칸세(Kansei) 기술어에 따른 3D 객체의 순위 지정 일관성을 평가하며, 모델들이 우연 수준 이상의 부분적인 합의를 보여주지만 객체 범주와 의미적 정렬에 따라 수렴도가 크게 달라진다는 점을 밝히고, 생성형 디자인 인터페이스를 위한 신뢰할 수 있는 의미적 제어 요소의 선택을 안내하는 UI 프로토타입을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디자인의 초기 단계에서, 새로운 의자를 스케치하든 자동차를 모델링하든, 창작자들은 종종 자신의 도구를 안내하기 위해 언어에 의존합니다. 그들은 "더 우아하게", "덜 투박하게", 또는 "더 미니멀하게"와 같은 요청을 할 수 있습니다. 오늘날 인공지능 시스템은 이미지와 텍득을 읽을 수 있는 강력한 컴퓨터 프로그램을 사용하여 이러한 요청을 이해하고 새로운 형태를 생성하며, 이러한 요청을 바탕으로 형상을 만들어내기 시작했습니다. 비전-언어 모델(vision-language models)로 알려진 이 시스템들은 디자이너의 모호한 아이디어와 구체적인 3D 객체 사이의 가교 역할을 합니다. 그러나 결정적인 질문이 남아 있습니다. 과연 이 서로 다른 컴퓨터 프로그램들이 그 단어들의 의미에 대해 실제로 동의하고 있는가 하는 점입니다. 만약 한 프로그램은 키가 크고 가는 병을 "우아하다"고 생각하는 반면, 다른 프로그램은 짧고 넓은 병을 우아하다고 생각한다면, 이 도구는 신뢰할 수 없게 됩니다. 디자이너들은 디지털 조수가 자신의 작업을 형성하는 데 있어 신뢰를 얻기 전, 그 도구가 일관성을 갖추고 있는지 알아야 합니다.
혼다 리서치 인스티튜트 유럽(Honda Research Institute Europe)과 율리우스 막시밀리언스 대학 바이츠부르크(Julius-Maximilians-Universität Würzburg)의 연구진은 가장 진보된 6개의 비전-언어 모델을 감사(audit)함으로써 이 질문에 답하고자 했습니다. 그들은 서로 다른 회사에서 구축되고 서로 다른 데이터로 학습된 이 독립적인 프로그램들이, 동일한 사물을 보고 감정적이거나 "정동적(affective)"인 특성을 판단하도록 요청받았을 때 동일한 방식으로 순위를 매기는지 확인하고자 했습니다. 이를 위해 연구진은 컴퓨터의 주의를 분산시킬 수 있는 모든 요소를 제거했습니다. 그들은 의자, 램프, 항아리와 같은 일상적인 아이템의 수천 개 3D 모델을 가져와 질감이 없는 단순한 회색 형상으로 렌더링했습니다. 색상, 재질, 질감을 제거함으로써, 연구진은 마치 채색하기 전의 점토 모델을 보는 조각가처럼, 모델들이 오직 형태만을 바탕으로 사물을 판단하도록 보장했습니다.
연구진은 이 6개의 컴퓨터 모델 각각에게 이 회색 형상들을 다양한 척도에 따라 순위를 매기도록 요청했습니다. 어떤 척도들은 "키가 큰 대 짧은", 또는 "상자형 대 곡선형"과 같이 단순한 물리적 묘사였으며, 이는 모델들이 기본적인 기하학에 대해서조차 합의할 수 있는지를 확인하기 위한 대조군 역할을 했습니다. 다른 척도들은 "현대적인 대 전통적인" 또는 "우아한 대 지저분한"과 같이 디자이너들이 실제로 사용하는 더 복잡하고 인간적인 기술어들이었습니다. 마지막으로, 연구진은 무작위적인 합의를 위한 기준선을 설정하기 위해 "시끄러운 대 조용한"과 같은 무의미한 쌍들을 포함했습니다. 만약 모델들이 이러한 무관한 쌍들에 대해서도 합의한다면, 그것은 그들의 순위 매기기가 그저 노이즈에 불과하다는 것을 의미할 것이기 때문입니다.
결과는 미묘한 차이가 있는 양상을 보여주었습니다. 모델들은 단순한 물리적 특성을 판단할 때는 매우 일관적이었으며, 어떤 것이 키가 크고 작은지에 대해 대체로 의견이 일치했습니다. 보다 추상적이고 감정적인 특성에 이르러서는, 모델들이 무작위 확률보다는 유의미하게 높지만 완벽하지는 않은 중간 수준의 합의를 보여주었습니다. 평균적으로, 모델들은 감정적 용어에 대한 객체의 순위를 매길 때 약 36%의 일치율을 보였는데, 이는 무의미한 용어들의 일치율인 14%와 비교했을 때 높은 수치였습니다. 이는 컴퓨터가 형태와 느낌 사이의 관계에 대한 공유된 감각을 발달시켰지만, 아직 완벽하게 정렬되지는 않았음을 시사합니다.
결정적으로, 이 연구는 이러한 합의가 모든 유형의 객체에 걸쳐 균일하게 나타나지 않는다는 점을 발견했습니다. 항아리와 같은 일부 범주에서는 모델들이 무엇이 "우아한지" 또는 "호화로운지"에 대해 강력하게 합의하여 50% 이상의 일치율에 도달했습니다. 반면 책장과 같은 다른 범주에서는 모델들이 공통된 기반을 찾는 데 어려움을 겪었으며, 일치율은 21%까지 떨어졌습니다. 연구진은 이러한 변동이 객체들이 서로 얼마나 다르게 보이는가보다는, 해당 범주의 특정 형태 변화가 실제로 단어가 가리키는 방향과 일치하는지 여부에 달려 있다는 것을 발견했습니다. 예를 들어, 의자 그룹이 주로 높이의 변화를 보인다면 모델은 어떤 것이 "키가 큰지" 쉽게 합의할 수 있지만, 만약 그룹의 변화가 "우아함"이라는 개념과 일치하지 않는 미세한 곡선의 변화라면 모델들은 서로 의견이 엇갈릴 것입니다.
연구진은 또한 이러한 합의가 특정 객체 유형에 국한된 것인지, 아니면 단순히 텍스트의 일반적인 특징인지를 테스트했습니다. 그들은 "폭신한 대 딱딱한"과 같이 소파에는 적절한 기술어가 병에 적용될 때는 잘 작동하지 않는다는 것을 발견했습니다. 이는 모델들이 단순히 일반적인 규칙을 적용하는 것이 아니라, 특정 객체의 형태와 사용된 단어 사이의 관계를 실제로 해석하고 있음을 확인시켜 주었습니다.
이러한 발견을 실제 디자인에 유용하게 만들기 위해, 팀은 이 합의를 시각화하는 프로토타입 인터페이스를 구축했습니다. 이 도구에서 디자이너는 객체를 선택하고 "더 현대적으로 만들기"와 같은 잠재적인 제어 항목 목록을 볼 수 있습니다. 각 제어 항목 옆에는 서로 다른 컴퓨터 모델들이 해당 지침에 대해 얼마나 합의하는지를 나타내는 점수가 표시됩니다. 점수가 높으면 디자이너는 도구가 예측 가능하게 작동할 것이라고 확신할 수 있습니다. 점수가 낮으면, 인터페이스는 해당 제어 항목이 특정 객체에 대해 신뢰할 수 없으므로 제외하거나 더 잘 지원되는 대안으로 교체해야 함을 제안합니다.
이 연구는 컴퓨터가 인간의 감정을 배웠다거나 그들의 합의가 옳다는 것을 증명한다고 주장하는 것이 아닙니다. 대신, 이는 디지털 도구가 사용자에게 전달되기 전에 안정적인지를 확인할 수 있는 실용적인 방법을 제공합니다. 서로 다른 컴퓨터 모델 간의 합의를 품질 관리의 한 형태로 취급함으로써, 디자이너는 어떤 감정적 기술어를 안전하게 사용할 수 있고 어떤 것이 혼란을 야기할 수 있는지 식별할 수 있습니다. 이 연구는 인공지능이 디자인의 강력한 파트너가 되고 있지만, 우리가 디자이너가 "우아함"을 요구할 때 기계도 똑같은 것을 바라보고 있는지 그 이해도를 반드시 면밀히 감사해야 함을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.