← 최신 논문
💻 computer science

Spreadsheet Modeling Experiments Using GPTs on Small Problem Statements and the Wall Task

본 논문은 재사용 가능한 스프레드시트 모델 생성을 위한 GPT 기반 도구, 특히 엑셀 AI 의 능력을 평가한 결과, 잘 구성된 초안을 생성할 수는 있지만 일관성 부재, 재현성 결여, 그리고 이로 인해 숙련된 사용자의 검증이 필요하다는 점이 현재 전문적 활용을 위한 신뢰성을 제한하고 있음을 발견했습니다.

원저자: Thomas A. Grossman, Yuan Chen, Sopiko Datuashvili

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thomas A. Grossman, Yuan Chen, Sopiko Datuashvili

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 때로는 산만할 수 있는 로봇 어시스턴트가 스프레드시트를 만드는 법을 가르치려 한다고 상상해 보세요. 수학 문제의 간단한 설명을 그에게 주고, 영원히 사용할 수 있는 완벽하게 정리된 엑셀 파일을 돌려받을 것을 기대합니다.

이 논문은 그 로봇 어시스턴트가 실제로 얼마나 잘 수행했는지에 대한 성적표입니다. 토마스 그로스먼 (Thomas Grossman) 과 그의 팀은 다섯 가지 다른 "AI 도우미"를 테스트하여 어떤 것이 가장 잘 재사용 가능한 스프레드시트 모델을 구축할 수 있는지 확인했습니다. 그들은 Excel AI라는 도구를 우승자로 선정하고, 일련의 스트레스 테스트를 거쳤습니다.

다음은 일상적인 비유를 사용하여 그들의 발견 사항을 정리한 것입니다:

1. 목표: "모래성"이 아닌 "레고 세트"를 만드는 것

연구자들은 AI 가 재사용 가능한 스프레드시트를 구축하기를 원했습니다.

  • 나쁜 방법 (모래성): AI 가 셀에 직접 숫자 (예: "10"과 "12") 를 입력한다고 상상해 보세요. 나중에 방 크기를 변경하고 싶다면 모든 것을 지우고 다시 써야 합니다. 이는 모래성을 쌓는 것과 같습니다. 잠시 동안은 보기 좋지만, 쉽게 다시 쌓을 수 없습니다.
  • 좋은 방법 (레고 세트): 연구자들은 AI 가 숫자를 특별한 "입력" 상자에 넣고 나머지는 공식 (예: =A1*B1) 을 사용하도록 원했습니다. 이는 레고 세트와 같습니다. 벽돌 (입력 숫자) 을 교체하면 전체 구조가 자동으로 업데이트됩니다. 이것이 바로 그들이 ERFR(재사용성을 위한 필수 요구사항) 이라고 부르는 것입니다.

2. 선별: 최고의 어시스턴트 찾기

팀원들은 다섯 가지 다른 AI 도구를 시험해 보았습니다. 이는 sheds 를 짓기 위해 다섯 명의 다른 계약자를 고용한 것과 같았습니다.

  • 어떤 계약자들은 고장 난 설계도를 돌려주었습니다.
  • 어떤 이들은 shed 자체 대신 shed 의 그림을 주었습니다.
  • 한 명의 계약자, Excel AI가 가장 일관성이 있었습니다. 이 도구는 보통 올바른 구조를 가진 깔끔하고 다운로드 가능한 파일을 돌려주었습니다. 따라서 연구자들은 향후 모든 테스트를 이 도구에 집중하기로 결정했습니다.

3. 실험: 로봇이 다양한 작업을 어떻게 처리했는지

연구자들은 Excel AI 에게 "방의 면적 계산"이나 "한 달 동안의 사과 비용 계산"과 같은 여덟 가지 다른 간단한 수학 문제를 해결하도록 했습니다. 그들은 세 가지 구체적인 사항을 테스트했습니다:

  • "레시피" 테스트 (데이터 대 변수):

    • 시나리오 A: "여기 숫자가 있습니다: 10 과 12."
    • 시나리오 B: "여기 숫자의 이름이 있습니다: 길이와 너비."
    • 결과: 로봇은 두 가지 경우 모두 완벽하게 처리했습니다. 숫자가 주어지지 않으면 사용자가 나중에 채울 수 있도록 빈 상자를 남겨두어야 한다는 것을 알았습니다.
  • "달력" 테스트 (30 일 대 한 달):

    • 시나리오 A: "30 일 동안 이것을 하세요."
    • 시나리오 B: "한 달 동안 이것을 하세요."
    • 결과: 여기서 로봇이 흔들렸습니다. "30 일"이라고 지시받으면 30 행의 완벽한 목록을 만들었습니다. 하지만 "한 달"이라고 지시받으면 혼란스러워졌습니다. 때로는 현재 달 (31 일 또는 그 이하) 에 대한 목록을 만들고, 때로는 셀에 실제 숫자를 넣는 대신 공식을 사용했습니다. 이는 "30 분"이라는 레시피는 완벽하게 따라 할 수 있지만, "한 시간"이라고 하면 당황하여 추측을 시작하는 요리사와 같았습니다.
  • " nonsense 단어" 테스트:

    • 그들은 실제 객체 (예: 사과) 대신 invented 단어 (예: "Zorp") 를 사용했습니다.
    • 결과: 로봇은 전혀 개의치 않았습니다. "Zorp"를 "Apple"과 정확히 동일하게 처리했습니다. 이는 성공이었습니다.

4. 큰 문제: "매직 8-Ball" 효과

연구자들이 발견한 가장 큰 문제는 재현성입니다.

  • 로봇에게 정확히 같은 질문을 두 번 해도 두 가지 다른 답변을 받을 수 있습니다.
  • 비유: 인간 어시스턴트에게 "나에게 샌드위치를 만들어 줘"라고 요청한다고 상상해 보세요. 첫 번째 요청에는 완벽한 칠면조 샌드위치를 줍니다. 두 번째로 정확히 같은 것을 요청하면, 가장자리를 잘라낸 땅콩 버터 샌드위치를 줍니다.
  • "벽 작업"(벽을 쌓는 것에 대한 약간 더 복잡한 문제) 에서 로봇은 때로는 완벽하고 전문급 모델을 만들었습니다. 다른 때는 공식이 누락되어 엑셀이 충돌하는 고장 난 모델을 만들었습니다. 어떤 버전을 받을지 결코 알 수 없었습니다.

5. "자신감"과 "워크플로우" 문제

이 논문은 이 기술을 사용하려는 모든 사람에게 두 가지 큰 두통으로 결론을 내립니다:

  • 자신감의 문제:
    로봇이 스프레드시트를 건네줄 때, 그것이 맞는지 어떻게 알 수 있습니까?

    • 비유: 학생이 수학 시험지를 건네주면 답을 확인할 수 있습니다. 하지만 그 학생이 환각을 일으킬 수 있는 로봇이라면, 자신의 작업을 검증하기 위해 스스로 수학 전문가가 되어야 합니다. 단순히 신뢰할 수 없습니다. 논문은 로봇의 작업을 검증하기 위해 숙련된 인간이 필요하다고 말합니다. 이는 로봇을 사용하여 시간을 절약하려는 목적을 무효화합니다.
  • 워크플로우의 문제:
    어떤 사람들은 "아마도 로봇은 우리가 수정할 수 있는 '초안'만 주면 될지도 모른다"고 주장합니다.

    • 비유: 로봇에게 소설의 초안을 쓰게 하는 것과 같습니다. 초안에 줄거리 구멍과 오타가 가득하다면, 그것을 수정하는 것이 더 빠를까요, 아니면 처음부터 책을 쓰는 것이 더 빠를까요? 연구자들은 복잡한 스프레드시트의 경우, 로봇의 messy 한 초안을 수정하는 것이 직접 하는 것보다 시간이 더 걸리거나 (또는) 똑같이 걸린다는 사실을 발견했습니다.

최종 판결

이 논문의 결론은 신중합니다.

  • 좋은 점: AI 는 간단한 지시사항에서 때로는 아름답고 전문적으로 보이는 스프레드시트를 만들 수 있습니다.
  • 나쁜 점: 일관성이 없고, 신뢰할 수 없으며, 종종 예측 불가능합니다.
  • 현실: 현재 이 도구들은 본격적인 사용에 준비되지 않았습니다. 실수가 금전적 손실을 초래할 수 있는 전문적인 용도로는 신뢰할 수 없습니다. 숙련된 인간이 작업을 감독하고, 검증하며, 수정해야 하는 "초안 작성 보조 도구"로 보는 것이 가장 좋습니다.

간단히 말해: 로봇은 때로는 걸작을 만들고 때로는 카드 하우스를 만드는 재능 있는 견습공입니다. 일관성을 배우기 전까지는, 여전히 클립보드를 들고 있는 마스터 빌더 (인간) 가 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →