Using Large Language Models for Idea Generation in Innovation
이 연구는 AI가 생성한 제품 아이디어가 인간이 생성한 아이디어에 비해 참신함과 다양성은 낮지만, 평균 구매 의도 측면에서는 인간의 아이디어를 크게 능가하며 상위 10%의 고품질 개념에 포함될 확률은 7배 더 높다는 것을 보여준다.
원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 "아이디어의 풍경(The Idea Landscape)"이라 불리는 광활하고 안개 낀 들판에 서 있다고 상상해 보십시오. 당신의 목표는 이 들판 어딘가에 숨겨진 단 하나의 가장 가치 있는 보물을 찾는 것입니다. 비즈니스와 혁신의 세계에서 이 보물이란 사람들이 기꺼이 사고 싶어 할 만한 아주 멋진 신제품 아이디어를 의미합니다. 오랫동안 이 보물을 찾는 유일한 방법은 인간 탐험대들을 파견하는 것이었습니다. 이 인간들은 이곳저곳을 돌아다니며 아이디어를 하나씩 파헤쳤습니다. 이 게임의 규칙은 모든 아이디어가 완벽할 필요는 없다는 것이었습니다. 그저 몇 개의 절대적인 보석을 찾아내기만 하면 됩니다. 만약 당신가 100개의 아이디어를 파냈는데 99개가 돌덩이이고 단 하나가 다이아몬드라면, 당신은 승리한 것입니다. 하지만 만에 인간이 열 개를 파내는 동안 1,000개의 아이디어를 파낼 수 있는 마법처럼 빠르고 강력한 로봇을 고용할 수 있다면 어떨까요? 이것이 바로 과학자들이 인공지능(AI)에 대해 던지는 질문입니다. 구체적으로, 그들은 "거대 언어 모델(LLM)"—인터넷에 존재하는 거의 모든 글을 학습한 매우 똑똑한 컴퓨터 프로그램—을 테스트하고 있습니다. 이 프로그램들은 이야기를 쓰거나 질문에 답하는 데는 뛰어나지만, 새로운 것을 발명하는 데 있어서 인간만큼 창의적일 수 있을까요? 이 논문은 이 디지털 꿈꾸는 자들이 실제로 실제 사람들을 능가하여 발명할 수 있는지를 알아보고자 합니다.
최고 수준의 대학 연구진들은 특정 과제를 통해 이를 테스트하기로 했습니다: 대학생들을 위한 50달러 이하의 새로운 물리적 제품을 발명하는 것입니다. 그들은 세 그룹의 "아이디어 생성기"를 모았습니다. 첫 번째 그룹은 챗GPT(ChatGPT)와 같은 AI 도구들이 널리 보급되기 전에 제품 디자인 수업을 들었던 대학생 팀이었습니다. 두 번째 그룹은 단순한 지시사항, 즉 빈 캔버스(이를 "제로샷(zero-shot)" 프롬프팅이라고 합니다)와 함께 요청을 받은 컴퓨터 프로그램(OpenAI의 GPT-4)이었습니다. 세 번째 그룹은 동일한 컴퓨터 프로그램이었지만, 이번에는 컴퓨터가 분위기를 잡을 수 있도록 몇 가지 훌륭한 예시를 먼저 보여주었습니다(이를 "퓨샷(few-shot)" 프롬프팅이라고 합니다).
누가 가장 잘했는지 확인하기 위해, 연구진은 단순히 전문가들에게 묻지 않았습니다. 그들은 수백 개의 제품 아이디어를 모아 대규모의 대학생 집단에게 보여준 뒤, "이 제품을 구매할 의향이 얼마나 있습니까?"라고 물었습니다. 그들은 이 답변들을 "구매 점수"로 변환하여 품질을 측정했습니다. 또한, 아이디어들이 서로 얼마나 유사한지 확인하기 위해 컴퓨터 도구를 사용했으며, 사람들에게 아이디어가 얼마나 "새롭거나" "참신한지" 평가하도록 요청했습니다.
결과는 다음과 같았으며, 이는 다소 놀랍습니다. 첫째, AI는 핵심적인 업무에서 실제로 더 뛰어났습니다: 즉, 사람들이 사고 싶어 하는 아이디어를 만드는 데 있어서 말입니다. 평균적으로 컴퓨터가 생성한 아이디어는 학생들이 만든 아이디어보다 더 높은 점수를 받았습니다. 몇 가지 예시를 먼저 본 컴퓨터(퓨샷)가 가장 뛰어난 성과를 냈습니다. 마치 로봇이 고객이 원하는 것을 파악하는 더 나은 "귀"를 가진 것 같았습니다.
하지만 함정이 있었습니다. AI가 좋은 아이디어를 만드는 데는 더 뛰어났지만, 다양한 아이디어를 만드는 데는 그만큼 뛰어나지 않았습니다. 컴퓨터의 아이디어들은 서로 매우 비슷하게 보이고 들리는 경향이 있었습니다. 만약 인간 학생들이 안개 낀 들판 전체를 탐험한다고 가정한다면, AI는 한두 군데의 특정 지점에 머물며 동일한 몇 가지 보물의 변형들을 많이 파내는 것처럼 보였습니다. 컴퓨터의 아이디어들은 사람들에게 약간 덜 "참신하거나" 독특하다는 평가를 받기도 했습니다. 마치 로봇은 기존의 개념을 다듬는 데는 매우 능숙하지만, 인간이 때때로 그러하듯 틀을 깨는 사고를 하는 데는 어려움을 겪는 것 같았습니다.
그러나 가장 흥eli로운 부분은 여기 있습니다. 혁신에 있어서 평균적인 아이디어는 중요하지 않습니다. 가장 최고의 아이디어가 중요합니다. 연구진은 수집된 모든 아이디어 중 상위 10%에 해당하는, 즉 절대적인 최상위 아이디어들을 살펴보았습니다. 그들은 AI가 인간에 비해 이 상위 10%에 드는 아이디어를 만들어낼 확률이 7배나 더 높다는 것을 발견했습니다. 학생들이 하나의 훌륭한 아이디어를 내놓을 때마다, 컴퓨터는 일곱 개의 아이디어를 내놓았습니다.
저자들은 이것이 오히려 보수적인 추정치라고 제안합니다. 그들은 컴퓨터가 얼마나 더 빠른지는 계산조차 하지 않았기 때문입니다. 인간은 다섯 개의 아이디어를 내는 데 15분이 걸릴 수 있지만, 컴퓨터는 같은 시간 동안 200개의 아이디어를 생성할 수 있습니다. 따라서 컴퓨터는 품질 면에서 더 나을 뿐만 아니라, 생산성의 괴물입니다.
이 논문은 AI가 인간의 브레인스토밍 세션만큼 거칠거나 다양하지는 않을지라도, 고품질의 시장성 있는 아이디어를 찾아내는 데 있어 강력한 힘을 가지고 있다고 결론짓습니다. 이는 미래에 기업들이 처음부터 아이디어를 짜내기 위해 그렇게 많은 시간을 소비할 필요가 없을 수도 있음을 시사합니다. 대신, AI가 수백 개의 고품질 옵션을 빠르게 생성하게 하고, 인간은 최고의 것을 골라내고 그것을 더욱 발전시키는 데 집중할 수 있습니다. 로봇은 인간 꿈꾸는 자를 대체하는 것이 아니라, 그들에게 훨씬 더 빨리 다이아몬드를 파낼 수 있는 초강력 삽을 쥐여주는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.