← 최신 논문
🤖 AI

Uncertainty Quantification for LLM-based Code Generation

본 논문은 LLM 기반 코드 생성에 대한 위험 제어 예측 집합을 구축하기 위해 다중 가설 검정을 활용하는 새로운 프레임워크인 RisCoSet 을 소개하며, 이는 여러 개의 유효한 출력을 수용하고 불필요한 코드 제거를 크게 줄이면서도 정확성에 대한 높은 확신을 유지함으로써 기존 방법의 한계를 효과적으로 극복합니다.

원저자: Senrong Xu, Yuhao Tan, Yanke Zhou, Guangyuan Wu, Zenan Li, Yuan Yao, Taolue Chen, Feng Xu, Xiaoxing Ma

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Senrong Xu, Yuhao Tan, Yanke Zhou, Guangyuan Wu, Zenan Li, Yuan Yao, Taolue Chen, Feng Xu, Xiaoxing Ma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 재능이 있지만 때때로 과도하게 자신감 있는 AI 에게 컴퓨터 프로그램을 작성해 달라고 요청한다고 상상해 보세요. 때로는 AI 가 완벽한 코드를 작성합니다. 다른 경우에는 프로그램이 실제로 작동하지 않도록 보이기는 하지만 실제로는 프로그램을 망가뜨리는 줄을 섞어 "환각"을 일으키기도 합니다.

문제는 다음과 같습니다: AI 의 코드 중 어떤 부분이 안전하게 유지할 수 있고, 어떤 부분이 위험한지 어떻게 알 수 있을까요?

이 논문은 이를 해결하기 위해 RISCOSET이라는 새로운 방법을 소개합니다. 이를 AI 가 생성한 코드를 위한 "안전망"으로 생각하세요.

기존 방법의 문제점

이전에는 연구자들이 PAC(Probably Approximately Correct, 아마도 대략적으로 정확함) 라는 방법을 사용하려고 시도했습니다.

  • 비유: 거대하고 지저분한 서랍에 가득 찬 열쇠들 중에서 특정 열쇠를 찾으려 한다고 상상해 보세요. 기존 방법 (PAC) 은 다음과 같은 엄격한 규칙을 따랐습니다. "당신은 마지막으로 선택한 열쇠보다 작은 열쇠들만 살펴볼 수 있습니다."
  • 결함: 이 규칙은 너무 경직되어 있었습니다. 연구자들은 규칙을 따르기 위해 너무 많은 잠재적으로 좋은 열쇠들 (이 경우 코드 줄) 을 버려야 했습니다. 또한 이는 오직 하나의 정답만 존재한다고 가정했지만, 코딩에서는 정확히 같은 일을 수행하는 프로그램을 작성하는 여러 가지 다른 방법이 종종 존재합니다.

새로운 해결책: RISCOSET

저자들은 LTT(Learn Then Test, 학습 후 테스트) 라는 더 지능적인 접근법을 사용하는 RISCOSET을 제안합니다.

1. "부분 프로그램" (뼈대)
완벽한 전체 프로그램을 추측하려고 시도하는 대신, RISCOSET 은 "뼈대"나 "부분 프로그램"을 구축합니다.

  • 비유: AI 가 이야기를 쓰지만 결말에 대해 확신이 없다고 상상해 보세요. RISCOSET 은 전체 이야기를 삭제하지 않습니다. 대신, 불확실한 문장을 강조하고 오직 그 특정 부분들만 제거하여, 안전하다고 알려진 견고한 틀 (부분 이야기) 을 남깁니다.
  • 목표: 이 뼈대는 (높은 통계적 신뢰도로) 올바른 해법의 일부임이 보장됩니다. 그런 다음 나중에 누락된 부분을 채울 수 있습니다.

2. "멀티-레이블"의 장점
기존 방법은 오직 하나의 "올바른" 답만 존재한다고 가정했습니다. RISCOSET 은 코딩에는 많은 유효한 해법이 있다는 점을 이해합니다.

  • 비유: 케이크 레시피를 요청한다면, 그것을 만드는 오직 하나의 "올바른" 방법만 있는 것은 아닙니다. 버터나 기름을 사용할 수 있으며, 둥근 팬이나 네모난 팬에 구울 수 있습니다. RISCOSET 은 많은 "올바른" 버전이 존재한다는 점을 인정하므로, 첫 번째 추측과 약간 다르게 보인다고 해서 좋은 코드를 버리지 않습니다.

3. "선택적 실행" (시간과 비용 절감)
"뼈대"가 안전한지 확인하기 위해 시스템은 코드를 테스트해야 합니다. 하지만 모든 코드 조각을 테스트하는 것은 느리고 비용이 많이 듭니다 (마치 모든 나사 하나하나마다 자동차 엔진 전체 테스트를 실행하는 것과 같습니다).

  • 비유: RISCOSET 은 "선택적 실행" 전략을 사용합니다. 이는 품질 검사관이 제품을 살펴보는 것과 같습니다. 제품이 매우 깨끗하고 고품질로 보인다면 (불확실성이 낮음), 검사관은 전체 테스트를 건너뜁니다. 만약 지저분해 보인다면 (불확실성이 높음), 검사관은 전체 테스트를 실행합니다.
  • 결과: 이는 오류율을 매우 낮게 유지하면서도 엄청난 양의 시간과 컴퓨팅 파워를 절약합니다.

그들은 무엇을 발견했나요?

연구자들은 이 방법을 세 가지 다른 AI 모델과 세 가지 다른 코딩 데이터셋에서 테스트했습니다.

  • 낭비 감소: 기존 최상의 방법들과 비교하여 RISCOSET 은 코드 줄을 24.5% 덜 제거했습니다. 이는 AI 의 유용한 작업을 더 많이 유지할 수 있음을 의미합니다.
  • 안전 최우선: 더 많은 코드를 유지했음에도 불구하고, 그들은 여전히 동일한 높은 수준의 안전 보장을 유지했습니다. 그들이 구축한 "뼈대"는 기존 방법들만큼이나 올바른 해법을 포함할 가능성이 높았지만, 불필요한 삭제는 훨씬 적었습니다.

요약

RISCOSET은 AI 가 생성한 코드를 더 잘 신뢰할 수 있도록 도와주는 새로운 도구입니다. 실수를 두려워하여 코드의 큰 덩어리들을 버리는 대신, 작동하는 해법의 일부임이 보장된 안전한 "뼈대"를 신중하게 조각해냅니다. 이는 더 지능적이고, 낭비가 적으며, 좋은 코드를 작성하는 방법에는 여러 가지가 있다는 사실을 존중합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →