← 최신 논문
🤖 AI

Empirical Computation: Prompting versus Programming

이 비전 논문은 거대 언어 모델이 전통적인 프로그래밍 대신 프롬프팅을 통해 계산 문제를 해결하는 새로운 패러다임으로서 '경험적 계산(empirical computation)'을 제안하며, 이러한 모델의 독특한 능력과 한계로 인해 소프트웨어 공학계가 정당성 및 근본적인 경계를 분석하기 위한 새로운 기초 이론과 기술을 개발해야 한다고 주장한다.

원저자: Eric Tang, Jing Liu, Marcel Böhme

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eric Tang, Jing Liu, Marcel Böhme

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게는 일을 완수하기 위한 두 가지 방법이 있습니다: **프로그래밍(Programming)**과 프롬프팅(Prompting).

옛 방식: 프로그래밍 (엄격한 설계자)

전통적인 프로그래밍은 엄격하고 원칙을 준수하는 설계자를 고용하는 것과 같습니다. 당신은 그들에게 정확한 치수, 특정 재료, 그리고 단계별 계획이 담긴 청사진을 제공합니다.

  • 작동 방식: 당신은 컴퓨터에게 숫자를 정렬하는 것처럼 문제를 해결하는 정확한 방법을 알려줍니다. 예를 들어, "특정 알고리즘(병합 정렬)을 사용하고, 이러한 입력값을 받아서, 이 규칙들을 따라라"라고 명령합니다.
  • 결과: 만약 설계자가 실수를 한다면, 당신은 청사진에서 정확히 어떤 벽돌이 잘못되었는지 찾아낼 수 있고, 그것을 수정하면 다음에는 건물이 제대로 서 있을 것이라는 사실을 확신할 수 있습니다.
  • 한계: 건물을 짓는 데 걸리는 시간은 수학적 복잡도에 따라 달라집니다. 숫자 리스트를 정렬하는 데 걸리는 시간은 리스트의 크기에 따라 예측 가능한 양(O(nlogn)O(n \log n))으로 결정됩니다.

새로운 방식: 프롬프팅 (직관적인 예술가)

이제, 대신에 아주 영리하고 직관적인 예술가를 고용한다고 상상해 보세요. 당신은 청사진을 주지 않습니다. 그저 이렇게 말할 뿐입니다. "헤이, 여기 엉망으로 뒤섞인 숫자 더미가 있는데, 이것 좀 정렬해 줄래?"

  • 작동 방식: 당신은 자연어(프롬프트)를 사용하여 문제를 설명합니다. "컴퓨터"(대규모 언어 모델 또는 LLM)는 엄격한 규칙을 따르지 않습니다. 대신, 인터넷에서 읽은 모든 것을 바탕으로 가장 가능성 높은 답을 추측합니다. 이는 마치 요리사가 레시피를 따르는 대신, 국물 맛을 보고 재료를 추측하는 것과 같습니다.
  • 결과: 답은 빠르게 돌아오지만, 그것은 추측이지 보증이 아닙니다. 그것은 "확실히 옳은" 답이 아니라 "가장 그럴듯한" 답입니다.

논문이 발견한 것: "경험적" 놀라움

이 논문의 저자들은 이 "직관적인 예술가"가 숫자 정렬이나 리스트에서 항목 찾기와 같은 고전적인 수학 문제에서 얼마나 잘 수행하는지 알아보기 위해 실험을 진행했습니다. 그들이 발견한 내용은 다음과 같습니다.

1. 시간은 똑같이 작동하지 않는다

  • 프로그래밍: 정렬할 항목의 수를 두 배로 늘리면, 걸리는 시간도 특정한 수학적 방식으로 증가합니다.
  • 프롬프팅: LLM이 숫자를 정렬하는 데 걸리는 시간은 리스트가 커짐에 따라 선형적으로(그저 직선 형태로) 증가합니다. 왜냐하면 수학이 더 어려워져서가 아니라, LLM이 더 긴 리스트를 처리하기 위해 더 많은 단어(토큰)를 읽고 써야 하기 때문입니다. 이는 마치 더 긴 책을 읽는 것과 같습니다. 이야기가 복잡해져서가 아니라 단어를 읽는 데 시간이 더 걸리는 것입니다.

2. 규모가 커질수록 정확도가 떨어진다

  • 프로그래밍: 올바른 프로그램은 매번 100% 정확합니다.
  • 프롬프팅: LLM은 작은 작업에는 뛰어나지만, 리스트가 커지면 혼란에 빠집니다.
    • 50개의 숫자가 있는 리스트의 경우, LLM은 약 90%의 확률로 정답을 맞혔습니다.
    • 150개의 숫자가 있는 경우, 정답률은 약 58%로 떨어졌습니다.
    • 짧은 문자열에서 특정 패턴을 찾으라고 요청하면, 문자열이 약간만 길어져도 거의 즉시 실패할 수 있습니다.
    • "생각하기" 모드: LLM이 답변하기 전에 "단계별로 생각(reason step-by-step)"하도록 허용하면 매우 높은 정확도를 유지하지만, 훨씬 더 오래 걸립니다.

3. 언어 게임

  • 프로그래밍: 코드를 영어로 쓰든 독일어로 쓰든 상관없습니다. 컴퓨터는 기호를 동일하게 읽습니다.
  • 프롬프팅: LLM은 인터넷에서 읽은 내용에 의해 편향됩니다.
    • 숫자를 영어 단어("one, two, three")로 써서 정렬해 달라고 하면 아주 잘 해냅니다.
    • 하지만 독일어("eins, zwei, drei")로 써서 정렬해 달라고 하면 거의 완전히 실패합니다.
    • 왜 그럴까요? LLM은 인터넷에서 수백만 개의 영어 예시를 보았지만, 독일어 예시는 훨씬 적게 보았습니다. 이는 마치 요리사에게 한 번도 본 적 없는 요리를 해달라고 요청하는 것과 같습니다. 그들은 잘못된 추측을 할 수 있습니다.

4. "깨진 벽돌" 문제

  • 프로그래밍: 프로그램이 실패하면, 당신은 버그를 찾아내어 코드를 수정할 수 있고, 그 문제는 영구적으로 해결됩니다.
  • 프롬프팅: LLM이 틀린 답을 내놓는다면, 당신은 "버그"를 쉽게 찾을 수 없습니다. 수정할 특정 코드 라인을 지목할 수 없습니다. 프롬프트를 바꾸거나 "더 열심히 생각하라"고 요청해 볼 수는 있지만, 그것이 다음에도 작동할 것이라는 보장은 없습니다. 이는 마치 꿈을 고치기 위해 꿈꾸는 사람의 기분을 바꾸려는 것과 같습니다.

핵심 결론

이 논문은 우리가 **"경험적 계산(Empirical Computation)"**이라 불리는 새로운 시대에 진입하고 있다고 주장합니다.

과거의 세계에서 우리는 컴퓨터가 엄격한 규칙을 따르기 때문에 신뢰했습니다(합리주의적 프레임워크). 이 새로운 세계에서 우리는 컴퓨터가 데이터를 바탕으로 "교육된 추측"을 하기 때문에 신뢰합니다(경험주의적 프레임워크).

저자들은 소프트웨어 엔지니어들에게 이 AI 시스템을 구식 프로그램처럼 분석하려 하지 말라고 촉구하고 있습니다. 우리는 이 "추측하는 기계"가 어떻게 작동하는지 측정하고, 테스트하고, 이해하기 위한 새로운 도구들이 필요합니다. 왜냐하면 기존의 수학과 논리의 규칙은 더 이상 이들에게 온전히 적용되지 않기 때문입니다. 우리는 "확실히 옳은" 결과가 아니라 "아마도 맞을 법한" 결과를 어떻게 신뢰할 것인지 알아내야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →