Spreadsheet Modeling Experiments Using GPTs on Small Problem Statements and the Wall Task
본 논문은 재사용 가능한 스프레드시트 모델 생성을 위한 GPT 기반 도구, 특히 엑셀 AI 의 능력을 평가한 결과, 잘 구성된 초안을 생성할 수는 있지만 일관성 부재, 재현성 결여, 그리고 이로 인해 숙련된 사용자의 검증이 필요하다는 점이 현재 전문적 활용을 위한 신뢰성을 제한하고 있음을 발견했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하지만 때로는 산만할 수 있는 로봇 어시스턴트가 스프레드시트를 만드는 법을 가르치려 한다고 상상해 보세요. 수학 문제의 간단한 설명을 그에게 주고, 영원히 사용할 수 있는 완벽하게 정리된 엑셀 파일을 돌려받을 것을 기대합니다.
이 논문은 그 로봇 어시스턴트가 실제로 얼마나 잘 수행했는지에 대한 성적표입니다. 토마스 그로스먼 (Thomas Grossman) 과 그의 팀은 다섯 가지 다른 "AI 도우미"를 테스트하여 어떤 것이 가장 잘 재사용 가능한 스프레드시트 모델을 구축할 수 있는지 확인했습니다. 그들은 Excel AI라는 도구를 우승자로 선정하고, 일련의 스트레스 테스트를 거쳤습니다.
다음은 일상적인 비유를 사용하여 그들의 발견 사항을 정리한 것입니다:
1. 목표: "모래성"이 아닌 "레고 세트"를 만드는 것
연구자들은 AI 가 재사용 가능한 스프레드시트를 구축하기를 원했습니다.
- 나쁜 방법 (모래성): AI 가 셀에 직접 숫자 (예: "10"과 "12") 를 입력한다고 상상해 보세요. 나중에 방 크기를 변경하고 싶다면 모든 것을 지우고 다시 써야 합니다. 이는 모래성을 쌓는 것과 같습니다. 잠시 동안은 보기 좋지만, 쉽게 다시 쌓을 수 없습니다.
- 좋은 방법 (레고 세트): 연구자들은 AI 가 숫자를 특별한 "입력" 상자에 넣고 나머지는 공식 (예:
=A1*B1) 을 사용하도록 원했습니다. 이는 레고 세트와 같습니다. 벽돌 (입력 숫자) 을 교체하면 전체 구조가 자동으로 업데이트됩니다. 이것이 바로 그들이 ERFR(재사용성을 위한 필수 요구사항) 이라고 부르는 것입니다.
2. 선별: 최고의 어시스턴트 찾기
팀원들은 다섯 가지 다른 AI 도구를 시험해 보았습니다. 이는 sheds 를 짓기 위해 다섯 명의 다른 계약자를 고용한 것과 같았습니다.
- 어떤 계약자들은 고장 난 설계도를 돌려주었습니다.
- 어떤 이들은 shed 자체 대신 shed 의 그림을 주었습니다.
- 한 명의 계약자, Excel AI가 가장 일관성이 있었습니다. 이 도구는 보통 올바른 구조를 가진 깔끔하고 다운로드 가능한 파일을 돌려주었습니다. 따라서 연구자들은 향후 모든 테스트를 이 도구에 집중하기로 결정했습니다.
3. 실험: 로봇이 다양한 작업을 어떻게 처리했는지
연구자들은 Excel AI 에게 "방의 면적 계산"이나 "한 달 동안의 사과 비용 계산"과 같은 여덟 가지 다른 간단한 수학 문제를 해결하도록 했습니다. 그들은 세 가지 구체적인 사항을 테스트했습니다:
"레시피" 테스트 (데이터 대 변수):
- 시나리오 A: "여기 숫자가 있습니다: 10 과 12."
- 시나리오 B: "여기 숫자의 이름이 있습니다: 길이와 너비."
- 결과: 로봇은 두 가지 경우 모두 완벽하게 처리했습니다. 숫자가 주어지지 않으면 사용자가 나중에 채울 수 있도록 빈 상자를 남겨두어야 한다는 것을 알았습니다.
"달력" 테스트 (30 일 대 한 달):
- 시나리오 A: "30 일 동안 이것을 하세요."
- 시나리오 B: "한 달 동안 이것을 하세요."
- 결과: 여기서 로봇이 흔들렸습니다. "30 일"이라고 지시받으면 30 행의 완벽한 목록을 만들었습니다. 하지만 "한 달"이라고 지시받으면 혼란스러워졌습니다. 때로는 현재 달 (31 일 또는 그 이하) 에 대한 목록을 만들고, 때로는 셀에 실제 숫자를 넣는 대신 공식을 사용했습니다. 이는 "30 분"이라는 레시피는 완벽하게 따라 할 수 있지만, "한 시간"이라고 하면 당황하여 추측을 시작하는 요리사와 같았습니다.
" nonsense 단어" 테스트:
- 그들은 실제 객체 (예: 사과) 대신 invented 단어 (예: "Zorp") 를 사용했습니다.
- 결과: 로봇은 전혀 개의치 않았습니다. "Zorp"를 "Apple"과 정확히 동일하게 처리했습니다. 이는 성공이었습니다.
4. 큰 문제: "매직 8-Ball" 효과
연구자들이 발견한 가장 큰 문제는 재현성입니다.
- 로봇에게 정확히 같은 질문을 두 번 해도 두 가지 다른 답변을 받을 수 있습니다.
- 비유: 인간 어시스턴트에게 "나에게 샌드위치를 만들어 줘"라고 요청한다고 상상해 보세요. 첫 번째 요청에는 완벽한 칠면조 샌드위치를 줍니다. 두 번째로 정확히 같은 것을 요청하면, 가장자리를 잘라낸 땅콩 버터 샌드위치를 줍니다.
- "벽 작업"(벽을 쌓는 것에 대한 약간 더 복잡한 문제) 에서 로봇은 때로는 완벽하고 전문급 모델을 만들었습니다. 다른 때는 공식이 누락되어 엑셀이 충돌하는 고장 난 모델을 만들었습니다. 어떤 버전을 받을지 결코 알 수 없었습니다.
5. "자신감"과 "워크플로우" 문제
이 논문은 이 기술을 사용하려는 모든 사람에게 두 가지 큰 두통으로 결론을 내립니다:
자신감의 문제:
로봇이 스프레드시트를 건네줄 때, 그것이 맞는지 어떻게 알 수 있습니까?- 비유: 학생이 수학 시험지를 건네주면 답을 확인할 수 있습니다. 하지만 그 학생이 환각을 일으킬 수 있는 로봇이라면, 자신의 작업을 검증하기 위해 스스로 수학 전문가가 되어야 합니다. 단순히 신뢰할 수 없습니다. 논문은 로봇의 작업을 검증하기 위해 숙련된 인간이 필요하다고 말합니다. 이는 로봇을 사용하여 시간을 절약하려는 목적을 무효화합니다.
워크플로우의 문제:
어떤 사람들은 "아마도 로봇은 우리가 수정할 수 있는 '초안'만 주면 될지도 모른다"고 주장합니다.- 비유: 로봇에게 소설의 초안을 쓰게 하는 것과 같습니다. 초안에 줄거리 구멍과 오타가 가득하다면, 그것을 수정하는 것이 더 빠를까요, 아니면 처음부터 책을 쓰는 것이 더 빠를까요? 연구자들은 복잡한 스프레드시트의 경우, 로봇의 messy 한 초안을 수정하는 것이 직접 하는 것보다 시간이 더 걸리거나 (또는) 똑같이 걸린다는 사실을 발견했습니다.
최종 판결
이 논문의 결론은 신중합니다.
- 좋은 점: AI 는 간단한 지시사항에서 때로는 아름답고 전문적으로 보이는 스프레드시트를 만들 수 있습니다.
- 나쁜 점: 일관성이 없고, 신뢰할 수 없으며, 종종 예측 불가능합니다.
- 현실: 현재 이 도구들은 본격적인 사용에 준비되지 않았습니다. 실수가 금전적 손실을 초래할 수 있는 전문적인 용도로는 신뢰할 수 없습니다. 숙련된 인간이 작업을 감독하고, 검증하며, 수정해야 하는 "초안 작성 보조 도구"로 보는 것이 가장 좋습니다.
간단히 말해: 로봇은 때로는 걸작을 만들고 때로는 카드 하우스를 만드는 재능 있는 견습공입니다. 일관성을 배우기 전까지는, 여전히 클립보드를 들고 있는 마스터 빌더 (인간) 가 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.