Benchmarking Real-Time Question Answering via Executable Code Workflows
이 논문은 기존 정적 벤치마크의 한계를 극복하기 위해 실행 가능한 코드 워크플로우를 통해 실시간 정보를 수집하고 자가 수리 메커니즘을 갖춘 동적 평가 프레임워크 'RT-QA'를 제안하며, 최신 모델들이 실시간 적응성 부족과 시간적 혼란으로 인해 낮은 정확도를 보임을 규명했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
1. 문제: "과거의 교과서"만 보는 AI
지금까지 AI 를 평가할 때는 마치 학생에게 10 년 전의 역사 시험지를 내주는 것과 같았습니다.
- 기존 방식 (Static QA): "누가 햄릿을 썼나요?" 같은 질문은 정답이 변하지 않습니다. AI 가 기억력만 좋으면 정답을 맞힐 수 있어요.
- 하지만 현실은 다릅니다: "어제 <인민일보> 1 면 제목은 뭐였나요?", "지난 7 일간 아카이브에 컴퓨터 과학 논문이 몇 편 올라왔나요?" 같은 질문은 내일 가면 정답이 완전히 달라집니다.
- 현재의 문제: 기존 시험지는 정답이 고정되어 있어서, AI 가 검색을 하지 않고도 과거에 배운 지식 (기억) 으로 답을 맞출 수 있습니다. 하지만 실제 세상에서는 정보가 매일 변하는데, AI 가 그 변화를 따라가지 못하면 큰일 납니다.
2. 해결책: "살아있는 요리사"를 채용하다 (RT-QA)
저자들은 이 문제를 해결하기 위해 RT-QA라는 새로운 평가 시스템을 만들었습니다.
이것은 정해진 레시피 (정답) 를 주는 게 아니라, '요리 도구 (코드)'를 주는 방식입니다.
- 비유:
- 기존 방식: "오늘의 주가 정답은 100 원이다"라고 종이에 적어두고 AI 에게 맞히게 합니다. (내일 주가가 200 원이 되어도 정답은 100 원으로 고정됨)
- RT-QA 방식: "오늘의 주가를 찾아오려면 이 **자동 로봇 팔 (실행 가능한 코드)**을 써서 증권사 웹사이트에 직접 가서 숫자를 읽어오게 해"라고 합니다.
- 결과: AI 가 이 로봇 팔을 작동시켜 지금 이 순간 웹사이트에 접속해서 진짜 최신 정보를 가져와야만 정답을 맞출 수 있습니다.
3. 어떻게 만들었나요? (자동화된 탐정)
이런 '자동 로봇 팔'을 사람이 일일이 만들면 너무 힘들죠. 그래서 저자들은 AI 스스로가 코드를 짜게 했습니다.
- 탐정 (RT Agent) 배치: AI 에게 "이 웹사이트를 보고 오늘 날짜에 맞는 정보를 찾아오는 코드를 짜봐"라고 시킵니다.
- 스스로 고치기 (Self-Repair): 웹사이트 디자인이 바뀌면 코드가 고장 납니다. 이때 AI 가 "아, 버튼 위치가 바뀌었네?"라고 알아서 코드를 수정하고 다시 실행합니다. 마치 고장 난 로봇을 스스로 고치는 로봇 같은 거죠.
4. 실험 결과: AI 들의 실력은?
최고급 AI(GPT-5.2, GLM-4.7 등) 들을 이 새로운 시험에 붙여봤습니다. 결과는 충격적이었습니다.
- 성적표: 최고 모델도 평균 **46%**밖에 못 맞췄습니다. (정답이 100 점인데 절반도 못 맞춘 셈입니다.)
- 왜 실패했을까? (두 가지 큰 실수)
- 게으른 검색 (Lazy Retrieval):
- 상황: "어제 날씨 어땠어?"라고 물으면, AI 는 검색 결과의 **간단한 요약 (스니펫)**만 보고 "맑음"이라고 답합니다.
- 문제: 하지만 실제 웹사이트에 들어가서 자세히 보면 "비"였을 수도 있습니다. AI 가 직접 가서 확인하지 않고, 남의 말만 믿는 게으름이 문제였습니다.
- 시간 감각 혼란 (Temporal Confusion):
- 상황: "2024 년에 열린 콘서트에서 누가 불렀고, 오늘 그 아티스트가 다시 콘서트를 연다면?" 같은 질문입니다.
- 문제: AI 는 2024 년 정보를 찾아낸 뒤, 그 날짜를 '지금'으로 착각하고 계속 그 과거 날짜로 논리를 전개합니다. 마치 과거의 일기장을 꺼내와서 '오늘'의 일기라고 쓰는 것과 같습니다.
- 게으른 검색 (Lazy Retrieval):
5. 결론: AI 는 '검색기'를 넘어 '탐정'이 되어야 한다
이 논문은 우리에게 중요한 메시지를 줍니다.
- 단순히 더 많은 정보를 검색하는 도구만으로는 부족합니다.
- AI 는 과거의 정보와 현재의 시간을 명확히 구분할 줄 알고, 직접 웹사이트에 접속해서 정보를 꼼꼼히 확인하는 '능동적인 탐정'이 되어야 합니다.
한 줄 요약:
"AI 가 과거의 교과서만 외우는 게 아니라, 매일 변하는 세상의 생생한 소식을 직접 찾아와서 정확히 전달할 수 있도록, '살아있는 코드'로 시험을 치르고 그 약점을 찾아낸 연구입니다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.