← 최신 논문
🧬 biology

Shot saturation and evidence limits in quantum-AI hardware benchmarks

이 논문은 아카이브된 양자-AI 하드웨어 벤치마크를 재분석하여 샷 포화(shot saturation)와 불완전한 데이터 처리가 오차 재구성 및 관측값 해석에 어떻게 상당한 영향을 미치는지 입증하는 한편, 측정된 값과 부과된 값을 구별하는 데 있어 현재 보고 표준의 한계를 강조한다.

원저자: Vikram Lex

게시일 2026-09-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vikram Lex

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

생각하는 기계를 만들기 위한 경쟁 속에서, 물리적 세계의 법칙과 인공지능의 논리가 만나는 새로운 개척지가 등장했습니다. 과학자들은 오늘날의 슈퍼컴퓨터가 해결하는 데 수 세기가 걸릴 문제를 해결할 수 있기를 바라며, 양자 역학의 원리로 작동하는 작고 취약한 프로세서를 테스트하고 있습니다. 이 기계들이 제대로 작동하는지 알기 위해, 연구자들은 두 데이터 패턴이 얼마나 밀접하게 일치하는지, 또는 회로가 퍼즐의 최적의 해답을 얼마나 잘 찾아내는지와 같은 특정 수치들을 측정해야 합니다. 그러나 이러한 측정은 단 한 번 이루어지는 것이 아니라, 동전이 공정한지 확인하기 위해 여러 번 던져보는 것과 마찬가지로 신뢰할 수 있는 그림을 그리기 위해 수천 번 반복됩니다. 문제는 이 양자 기계들이 노이즈가 많고 불완전하다는 점이며, 연구자들이 시도 횟수, 즉 '샷(shots)'을 계산하는 방식에 따라 숫자가 나타내는 의미가 급격히 달라질 수 있다는 점입니다. 만약 계산 방식에 결함이 있거나 데이터가 불완전하다면, 결과는 실제로는 오해의 소지가 있음에도 불구하고 유망해 보일 수 있으며, 이는 기계가 진정으로 학습하고 있는 것인지 아니면 단순히 노이즈 속에서 비틀거리고 있는 것인지 구별하기 어렵게 만듭니다.

KarLex AI의 Vikram Lex가 수행한 최근 연구는 이러한 양자 프로세서와 관련된 과거 실험 모음집을 엄격하고 비판적으로 검토했습니다. 연구자는 하드웨어 자체에서 새로운 테스트를 수행한 것이 아닙니다. 대신, 그는 Rigetti나 IonQ와 같은 제공업체의 클라우드 기반 양자 컴퓨터를 사용했던 이전 캠페인의 디지털 아카이브를 다시 조사했습니다. 그의 목표는 해당 실험들로부터 도출된 결론이 더 엄격하고 투명한 현미경 아래에서도 유효한지를 확인하기 위해 실험의 가공되지 않은 요약본들을 재검토하는 것이었습니다. 그는 벡터 간의 유사성을 측정하는 것, 머신러เรียน링에 사용되는 특정 유형의 수학적 행렬을 테스트하는 것, 그리고 그래프 문제를 해결하기 위해 설계된 알고리즘을 실행하는 것 등 세 가지 유형의 작업에 집중했습니다. 데이터가 어떻게 기록되었는지에 대한 세부 사항을 파헤친 결과, 그는 실험이 설정되고 보고되는 방식이 종종 기계의 실제 성능을 가리고 있다는 것을 발견했습니다.

조사의 첫 번째 부분은 측정 시도 횟수를 늘리는 것이 결과의 정확도에 어떤 영향을 미치는지 살펴보았습니다. 이 실험들에서 연구자들은 회로를 실행하고 그 결과를 수천 번 기록한 다음, 그 결과들을 평균하여 하나의 숫자를 얻었습니다. 연구는 한 배치당 시도 횟수를 256회에서 2,048회로 늘렸을 때의 데이터를 재분석했습니다. 기대치는 단순히 더 많은 샷을 실행하는 것만으로도 오류를 완화하고 결과를 실제 값에 가깝게 만들 수 있다는 것이었습니다. 그러나 재분석 결과는 다른 이야기를 들려주었습니다. 샷을 추가함에 따라 데이터의 무작위 변동은 약간 감소했지만, 전체적인 오차는 여전히 완고하게 높게 유지되었습니다. 실수의 주요 원인은 데이터의 부족이 아니라, 평균값 자체의 일관된 편차(offset)였습니다. 2,048회의 샷을 수행하더라도 평균 결과는 이상적이고 완벽한 기계가 만들어냈어야 할 값과 여전히 크게 달랐습니다. 이는 단순히 기계에게 더 열심히 혹은 더 자주 시도하라고 요구하는 것이 문제를 해결하지 못할 것임을 시사합니다. 문제는 테스트를 아무리 반복하더라도 변하지 않는, 측정의 근본적인 설정이나 하드웨어의 동작 방식에 있었습니다.

두 번째 초점 영역은 데이터 포인트들이 서로 어떻게 연관되어 있는지를 나타내는 숫자 표인 '커널(kernel)'이라는 수학적 구조였습니다. 완전하고 유용한 표라면 가능한 모든 데이터 쌍에 대해 측정된 값이 있어야 합니다. 한 제공업체인 Rigetti의 아카이브 데이터에서는 45개의 가능한 쌍이 모두 측정되었습니다. 그러나 다른 제공업체인 IonQ의 데이터에서는 컴퓨팅 크레딧이 소진되기 전에 18개의 쌍만이 성공적으로 측정되었습니다. 나머지 27개의 쌍은 빈칸으로 남겨졌습니다. 연구는 이 불완전한 데이터가 어떻게 처리되었는지에 대한 결정적인 결함을 지적했습니다. 누락된 항목들을 0으로 처리했을 때, 전체 표의 평균값은 약 0.22에서 0.09로 급격히 떨어졌습니다. 이 거대한 변화는 최종 결론이 누락된 숫자를 어떻게 채워 넣느냐에 전적으로 달려 있음을 보여주었습니다. 더욱이, 연구는 두 제공업체가 정확히 동일한 데이터 입력을 테스트하고 있지 않았음을 발견했으며, 이로 인해 그들의 하드웨어 성능을 공정하게 비교하는 것이 불가능했습니다. 어떤 데이터 포인트가 사용되었는지 정확히 알 수 없고 모든 항목이 측정되었음을 보장할 수 없다면, 두 기계 사이의 그 어떤 비교도 과학적으로 타당하지 않습니다.

마지막 섹션은 네트워크의 연결을 두 그룹으로 나누는 최적의 방법을 찾는 QAOA라는 알고리즘을 조사했습니다. 연구자들은 자신들이 찾은 분할의 품질을 네트워크의 총 연결 수와 비교한 비율로 보고해 왔습니다. 재분석 결과, 서로 다른 제공업체들이 이 비율의 분모를 정의하는 방식이 서로 달랐음이 드러났습니다. 한 제공업체는 결과를 그래프의 총 엣지(edge) 수로 나누었고, 다른 제공업체는 이론적인 최적의 점수로 나누었습니다. 이는 한 기계의 점수가 0.5이고 다른 기계의 점수가 0.6이라고 해서 반드시 두 번째 기계가 더 낫다는 것을 의미하지는 않는다는 것입니다. 그들은 단지 동일한 것을 측정하기 위해 서로 다른 자를 사용했을 뿐입니다. 또한, 데이터에는 기계가 의도한 대로 문제를 실제로 풀고 있는지, 아니면 결과가 단순히 데이터 처리 방식의 부산물인지를 검증하는 데 필요한 상세한 기록이 부족했습니다. 연구는 이러한 수치를 보고하는 표준화된 방법과 원시 데이터에 대한 완전한 접근 권한 없이는 어떤 하드웨어가 진정으로 우월한지 판단하는 것이 불가능하다고 결론지었습니다.

궁극적으로, 이 재분석은 양자 인공지능 분야에 경종을 울리는 사례가 됩니다. 이는 방대한 양의 데이터나 높은 횟수의 측정 시도가 근본적인 정의가 불분명하거나 데이터가 불완전할 경우 올바른 답을 보장하지 않는다는 것을 입증합니다. 연구는 이러한 실험들의 지배적인 오류가 더 많은 테스트를 통해 고칠 수 있는 무작위 노이즈가 아니라, 실험이 설계되고 보고되는 방식과 관련된 체계적인 문제였다는 것을 발견했습니다. 연구진은 앞으로 나아가기 위해서, 어떤 데이터를 기록해야 하는지, 누락된 정보를 어떻게 처리해야 하는지, 그리고 결과를 어떻게 비교해야 하는지에 대한 엄격한 표준을 확립해야 한다고 강조했습니다. 이러한 기초적인 문제들이 해결되지 않는 한, 하드웨어의 성능에 대한 주장은 검증하기 어려울 것이며, 이 기계들의 진정한 잠재력은 불완전한 증거라는 베일 뒤에 숨겨진 채로 남을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →