← 최신 논문
🤖 machine learning

Benchmarking Web API Integration Code Generation

이 논문은 현재의 오픈 소스 대규모 언어 모델들이 엔드포인트 환각 및 잘못된 인자 사용 등의 문제로 인해 올바른 웹 API 통합 코드를 생성하는 데 있어 성공률이 40% 미만에 그치는 등 상당한 어려움을 겪고 있음을 밝히는 데이터셋이자 평가 파이프라인인 WAPIIBench를 소개한다.

원저자: Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하고 박식한 로봇에게 거대하고 복잡한 레스토랑 메뉴에서 특정 식사를 주문하는 법을 가르치려 한다고 상상해 보세요. 이 메뉴는 단순히 요리 목록이 아닙니다. 주문을 작성하는 법, 눌러야 할 버튼, 그리고 각 재료를 정확하게 나열하는 법에 대한 엄격한 규칙의 집합체입니다. 단 하나의 세부 사항이라도 틀리면 주방에서는 주문을 거절합니다.

이 논문은 이러한 "로봇"(실제로는 챗봇의 기술적 기반인 대규모 언어 모델, 즉 LLM)이 실제 웹 서비스(Google Calendar, Slack, Asana 등)로 주문을 보내기 위해 필요한 코드를 얼마나 잘 작성할 수 있는지 테스트하는 것에 관한 것입니다.

다음은 연구자들이 수행한 작업과 발견한 내용을 쉬운 비유를 사용하여 정리한 내용입니다.

문제점: "마법"은 아직 마법이 아닙니다

개발자들은 서로 다른 소프트웨어가 대화할 수 있도록 만들기 위해 "웹 API"를 사용합니다. 이는 마치 레고 블록을 연결하는 것과 같습니다. 보통은 인간이 이 블록들을 끼워 맞추기 위한 지침을 작성해야 합니다. 목표는 AI가 이 작업을 자동으로 수행하는 것이었습니다.

연구자들은 다음과 같은 질문을 던졌습니다: AI가 "내 캘린더에 새 일정 추가하기"와 같은 간단한 요청을 보고, 이를 실행하기 위한 완벽하고 오류 없는 코드를 작성할 수 있을까?

실험: AI를 위한 "운전 면허 시험" 구축

결과를 확인하기 위해 연구팀은 WAPIIBench라고 불리는 특별한 테스트를 만들었습니다. 이것은 AI를 위한 일종의 운전 면허 시험이라고 생각하면 됩니다.

  1. 코스: 그들은 네 가지 인기 있는 실제 서비스(Asana, Google Calendar, Google Sheets, Slack)를 사용하여 395개의 구체적인 "운전 시나리오"를 만들었습니다.
  2. 규칙: 그들은 올바른 주문이 어떻게 생겼는지 알기 위해 해당 서비스들의 공식 "운전 매뉴얼"(OpenAPI 사양)을 사용했습니다.
  3. 테스트: 연구진은 AI에게 프롬프트(예: "새 캘린더 생성")를 주고 코드를 작성하도록 요청했습니다.
  4. 검증: 단순히 코드가 제대로 된 것처럼 "보이는지" 읽는 대신, 그들은 안전하고 통제된 샌드박스 안에서 실제로 코드를 실행해 보았습니다. 만약 코드가 존재하지 않는 주소로 주문을 보내려고 하거나 잘못된 재료를 사용했다면, 그 테스트는 실패로 처리되었습니다.

결과: AI는 자주 길을 잃습니다

결과는 즉각적인 자동화를 기대했던 이들에게 다소 실망스러웠습니다.

  • 점수: 가장 뛰어난 오픈 소스 AI 모델들도 작업의 약 **30%에서 40%**만을 완전히 정확하게 수행했습니다. 가장 우수한 상용 모델인 GPT-4o는 더 높은 성적을 거두어 약 60~77%에 도달했지만, 이는 여전히 약 3분의 1의 경우에 실패했음을 의미합니다.
  • "환각(Hallucinations)": 이것이 가장 큰 문제입니다. AI는 종종 사실이 아닌 것을 지어냈습니다.
    • 가짜 주소: AI는 존재하지 않는 URL 주소를 만들어냈습니다(예를 들어, 식당이 "456 Main St"에 있는데 택시 기사에게 "123 Fake Street"로 가라고 말하는 것과 같습니다). 이 현상은 최대 39%의 사례에서 발생했습니다.
    • 잘못된 재료: AI는 서비스가 허용하지 않는 파라미터(재료)를 포함하거나, 반드시 필요한 재료를 빠뜨리기도 했습니다.
  • 부분적 성공: AI는 코드의 일반적인 형태를 기억하는 데는 능숙했습니다(예를 들어, '취소'를 하는 것이 아니라 '주문을 넣어야' 한다는 것을 아는 것처럼 POST 메서드를 사용해야 한다는 것을 아는 것). 하지만 어디로 보낼지(주소)와 정확히 무엇을 말해야 하는지(세부 사항)와 같은 구체적인 부분에 있어서는 조각들을 올바르게 맞추는 데 어려움을 겪었습니다.

몇 가지 놀라운 반전

  • 덩치가 크다고 항상 좋은 것은 아니다: 때때로 중간 크기의 AI 모델이 아주 작은 모델과 아주 큰 모델 모두보다 성능이 떨어지는 경우가 있었습니다. 이는 마치 공부를 너무 열심히 했지만 엉뚱한 시험을 봐서 혼란에 빠진 학생과 같습니다.
  • 기억력 vs 이해력: AI는 훈련 데이터로부터 매뉴얼의 일부를 "암기"한 것으로 보였습니다. 특정 URL이나 인자(argument) 이름은 알고 있었지만, 이를 신뢰성 있게 결합하여 새로운 특정 문제를 해결하지는 못했습니다. 이는 작년 수학 시험 답안을 외웠지만 올해의 문제는 풀지 못하는 학생과 같았습니다.
  • "빈칸 채우기" 기법: 연구진이 AI에게 올바른 주소(URL)를 제공하고 나머지 부분만 채우도록 했을 때, AI는 훨씬 더 나은 성능을 보였습니다. 이는 AI가 목적지를 먼저 추측할 필요가 없다면 지침을 따르는 데 능숙하다는 것을 시사합니다.

결론

이 논문은 AI가 코드를 작성하는 데는 점점 능숙해지고 있지만, 인간의 감독 없이 소프트웨어 시스템을 자동으로 연결할 만큼 아직 신뢰할 수 있는 수준은 아니다라고 결론짓습니다. 만약 지금 당신의 비즈니스 앱을 인터넷에 연결하는 코드를 AI에게 맡긴다면, 데이터가 잘못된 곳으로 전송되거나 연결이 끊어질 확률이 60%에서 70%에 달할 것입니다.

연구자들은 우리가 AI가 스스로 이러한 연결을 구축할 수 있도록 믿기 위해서는, 더 나은 안전 점검 장치와 AI가 (기억에 의존하는 대신) 실시간으로 규칙을 "찾아볼 수 있는" 새로운 방법이 필요하다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →