AI-Conducted Interviews in Empirical Software Engineering: An Experience Report
이 경험 보고서는 AI가 수행하는 자가 실시형 인터뷰가 짧고 위험도가 낮은 경험적 소프트으로 공학 연구에 있어 운영 측면에서 실행 가능하며 참가자들로부터 긍정적인 반응을 얻고 있음을 입증하지만, 깊이, 민감성 및 개인정보 보호 측면의 한계로 인해 현재로서는 인간 주도형 인터뷰를 보완하는 도구로서 가장 적합하다는 것을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
소프트웨어 엔지니어링의 세계를 디지털 마천루를 건설하는 거대하고 북적이는 건설 현장이라고 상상해 보세요. 이 건설업자들이 어떻게 일하는지 이해하기 위해, 연구자들은 종종 클립보드를 들고 찾아와 질문을 던지곤 하는데, 이 방법을 "인터뷰"라고 부릅니다. 이는 마치 범죄가 어떻게 일어났는지 알아내기 위해 형사가 목격자와 대화하는 것과 비슷하지만, 범죄 대신 프로그래머들이 버그를 어떻게 고치고, 하루를 어떻게 조직하며, 새로운 도구를 어떻게 사용하는지를 조사합니다. 전통적으로 이 과정에는 인간 연구자가 앉아서 질문을 하고 노트를 작성해야 하며, 이는 시간 소모가 크고 모든 사람이 서로 다른 시간대에 있거나 다른 언어를 사용할 때 까다로운 작업입니다.
최ผม 최근, 새로운 종류의 "디지털 탐정"이 등장했습니다: 바로 인공지능(AI)입니다. AI를 수백만 권의 책을 읽고 인간처럼 말하는 법을 배운 아주 똑똑한 로봇이라고 생각하면 됩니다. 이 로봇들이 대화에 매우 능숙해짐에 따라, 연구자들은 다음과 같은 의문을 갖게 되었습니다. "우리가 로봇이 인간 대신 인터뷰를 하게 할 수 있을까?" 이것이 이 논문이 다루는 핵심 질문입니다. 이 질문은 로봇이 소프트웨어 개발가들과 성공적으로 대화하고, 그들의 업무에 대해 묻고, 인간이 전화를 한 통도 들지 않은 상태에서 유용한 이야기들을 수집할 수 있는지를 묻습니다. 연구자들은 로봇이 인간보다 더 낫다는 것을 증명하려는 것이 아니라, 로봇이 충분히 유용할 만큼 잘 작동하는 하나의 가능한 도구인지를 확인하려는 것입니다.
실험: 마이크를 넘겨받은 로봇
이 연구에서 브라질의 연구진은 이 아이디어를 시험 운행해 보기로 했습니다. 그들은 두 가지 맞춤형 "AI 인터뷰어"(이들을 MyGPTs라고 불렀습니다)를 만들고 소프트웨어 전문가들에게 대화를 요청했습니다. 한 로봇은 "리팩터링(refactoring)"—코드가 더 잘 실행되도록 지저분한 코드를 정리하는 멋진 용어—에 대해 묻도록 설계되었습니다. 다른 로봇은 팀이 업무를 조직하는 인기 있는 방식인 "스크럼(Scrum)" 내에서 AI 도구를 사용하는 것에 대해 물었습니다.
연구자들은 화상 통화 일정을 잡는 대신 링크를 보냈습니다. 참가자들은 링크를 클릭하여 자신의 휴대폰이나 컴퓨터로 채팅창을 열고 대화를 시작했습니다. 그들은 스마트 어시스턴트에게 말하듯 목소리를 사용하여 로봇에게 말할 수도 있었습니다. 로봇은 일련의 질문을 던지고, 답변을 듣고, 마지막에는 대화 내용을 깔끔하게 요약했습니다. 그 후 참가자는 그 요약본을 연구자에게 다시 보내기 위해 버튼을 클릭해야 했습니다. 이것은 셀프 서비스 인터뷰였습니다. 방 안에 인간 연구자는 없었고, 일정 충돌도 없었으며, 이 모든 과정은 참가자가 원하는 시간에 이루어졌습니다.
결과: 좋았던 점, 이상했던 점, 그리고 오류들
연구진은 완료된 66개의 인터뷰를 검토했습니다. 데이터가 알려준 내용은 다음과 같으며, 좋은 소식과 수정이 필요한 부분으로 나누어 정리했습니다.
좋은 소식: 사람들은 만족했다
인터뷰를 마친 대부분의 사람들은 꽤 멋진 경험이었다고 생각했습니다.
- 편안함: 약 91%가 질문에 답하는 데 편안함을 느꼈습니다.
- 명확성: 거의 96%가 로봇의 질문을 이해하기 쉽다고 답했습니다.
- 속도: 97% 이상이 대화 속도가 적절하다고 느꼈습니다.
- 의지: 거의 90%가 다시 참여할 의사가 있다고 답했습니다.
알고 보니, 많은 사람이 로봇과 대화하는 아이디어를 실제로 좋아했습니다. 어떤 이들은 인간과 대화할 때보다 압박감을 덜 느꼈고, 누군가 시계를 확인하며 기다릴까 봐 걱정하지 않고 자신의 속도에 맞춰 답할 수 있다는 점을 높게 평가했습니다.
"어라, 이게 뭐지?" 하는 순간들
하지만 완벽하지는 않았습니다. 로봇을 인간 인터뷰어와 비교했을 때 결과는 다소 엇갈렸습니다. 약 42%의 사람들은 로봇이 더 낫지도, 더 나쁘지도 않은 중간 정도라고 느꼈습니다. 약 38%는 인간과 대화하는 것을 선호했고, 로봇을 선호하는 비율은 약 20%에 불과했습니다.
가장 큰 불만 사항은 로봇이 가끔 너무 일반적인 질문을 하거나 답변에 대해 깊이 파고들지 못한다는 점이었습니다. 약 29%의 사람들은 로봇이 자신의 구체적인 이야기에 충분히 민감하게 반응하지 못한다고 느꼈고, 또 다른 27%는 대화가 충분히 깊게 진행되지 않았다고 느꼈습니다. 일부 사람들은 인간적인 연결 고리를 그리워하며, 사람 대신 기계와 대화하는 것이 다소 이상하게 느껴진다고 말했습니다.
기술적 결함
실제적인 문제들도 있었습니다.
- 잘못된 요약: 약 9%(66건 중 6건)의 경우, 참가자가 잘못된 것을 보냈습니다. 로봇이 생성한 깔끔한 요약본 대신, 채팅의 무작위 부분이나 구조화되지 않은 텍스트를 붙여넣었습니다.
- 잘못된 주제: 2건의 경우, 참가자가 "스크럼"에 대한 질문에 답했으나 "리팩터링"에 관한 요약본을 보냈습니다. 이는 인간이 혼자 작업할 때 질문과 답변 사이의 연결이 뒤섞일 수 있음을 보여줍니다.
- 음성 문제: 사람들이 목소리를 사용했기 때문에, 가끔 로봇이 소리를 오해하기도 했습니다. 한 사람은 기침 소리가 실수로 답변으로 기록되어 인터뷰의 흐로를 방해했다고 언급했습니다.
핵심 결론: 훌륭한 조력자, 대체재는 아님
이 논문이 우리에게 말해주는 가장 중요한 것은 AI 인터뷰어가 무엇을 할 수 있고 무엇을 할 수 없는지에 대한 것입니다.
연구진은 매우 명확하게 밝힙니다: 그들은 로봇이 인간 인터이어를 대체할 수 있다는 것을 증명한 것이 아닙니다. 그들은 로봇의 요약이 인간의 노트만큼 정확하거나, 깊이 있거나, 풍부한지를 확인하지 않았습니다. 단지 그 과정이 제대로 작동하는지, 그리고 사람들이 그것을 괜찮게 느끼는지를 확인했을 뿐입니다.
결론은 AI 인터뷰가 보완적인 도구라는 것입니다. AI 인터뷰는 사람들이 어떻게 생각하는지 일반적인 아이디어만 필요할 때 사용하는 빠르고 짧으며 위험 부담이 낮은 대화에 적합합니다. 일정 잡는 시간을 아끼고 사람들이 원할 때 언제든 말할 수 있게 해준다는 점에서 매우 훌륭합니다. 하지만 복잡한 감정을 깊이 파고들어야 하거나, 매우 민감한 비밀을 다루거나, 까다로운 문제에 대해 매우 깊은 이해가 필요하다면 여전히 인간 인터뷰어가 최선의 선택입니다.
AI 인터뷰어를 식료품점의 셀프 계산대라고 생각해 보세요. 빠르고 편리하며 몇 가지 물건을 처리할 때 아주 좋습니다. 하지만 이상한 쿠폰이 있거나, 무거운 감자 자루가 있거나, 농산물에 대해 질문이 있다면 여전히 사람 점원을 원하게 됩니다. 이 연구는 소프트웨어 연구자들에게 "셀프 계산대"를 사용할 준비가 되었지만, 데이터의 품질을 보장하기 위해 여전히 인간의 개입이 필요함을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.