Can LLMs Solve Science or Just Write Code? Evaluating Quantum Solver Generation
본 논문은 정제를 통해 양자 솔버의 성공률을 향상시킬 수 있음을 보여주지만, 여전히 수치적 정확도에서 어려움을 겪고 상당한 계산 오버헤드를 초래하며 완전한 과학적 양자 소프트웨어 개발 자동화의 현재 한계를 드러내는 반복적 평가 방법론인 Q-SAGE 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 재능 있고 초고속인 로봇 비서가 있는데, 컴퓨터 코드 작성에 놀라울 정도로 능숙합니다. 여러분이 이 로봇에게 어려운 물리학 퍼즐을 해결하기 위한 복잡한 기계를 만들어 달라고 요청합니다. 로봇이 코드를 타이핑하고 기계가 작동하기 시작합니다. 충돌하지도 않고, 오류 메시지를 던지지도 않습니다. 완벽하게 작동하는 것처럼 보입니다.
하지만 여기에 함정이 있습니다: 기계가 작동하고는 있지만, 여러분에게 잘못된 답을 주고 있습니다.
이것이 밀라노 공과대학교와 룩셈부르크 대학교의 연구자들이 논문 "LLM 은 과학을 해결할 수 있는가, 아니면 단순히 코드를 작성할 수 있는가?"에서 다루었던 핵심 문제입니다. 그들은 ChatGPT 같은 도구의 뒤를 이끄는 AI 두뇌인 대규모 언어 모델 (LLM) 이 실제 과학 문제를 올바르게 해결하는 코드를 작성할 수 있는지, 아니면 단순히 보기에는 맞지만 수학 시험에는 실패하는 코드만 작성하는지 알고 싶어 했습니다.
"Q-SAGE" 워크숍
이를 알아내기 위해 연구자들은 Q-SAGE라는 테스트 프레임워크를 구축했습니다. Q-SAGE 를 AI 코드를 위한 엄격하고 반복적인 워크숍으로 생각하세요:
- 과제 부여: AI 는 과학적 문제 (작은 자석 안의 전자 행동 파악이나 분자 결합 방식 등) 를 해결하라고 지시받습니다.
- 초안 작성: AI 는 이를 해결하기 위한 파이썬 스크립트를 작성합니다.
- 테스트 실행: 스크립트가 컴퓨터에서 실행됩니다.
- 현실 점검: 결과는 "황금 표준 (Golden Standard)"과 비교됩니다. 이는 우리가 올바른 답을 제공한다는 것을 알고 있는 신뢰할 수 있는 구식 고전 컴퓨터 프로그램입니다.
- 피드백 루프: AI 의 답이 틀리거나 코드가 충돌하면 워크숍은 단순히 "불합격"이라고만 말하지 않습니다. 대신 AI 에게 왜 실패했는지 (예: "수학 오류가 발생했습니다" 또는 "코드가 충돌했습니다") 알려줍니다. 그런 다음 AI 는 코드를 다시 작성하고 다시 시도합니다.
연구자들은 양자 물리학에서 화학에 이르기까지 다섯 가지 유형의 과학적 문제와 오픈소스 모델부터 대형 기술 기업 모델까지 다섯 가지 다른 AI 모델을 사용하여 이 워크숍을 진행했습니다.
그들이 발견한 것들
1. "첫 번째 초안" 문제
AI 에게 피드백 없이 한 번만 코드를 작성하도록 요청했을 때, 실패하는 경우가 많았습니다. 마치 학생에게 공부나 연습 없이 기말고사를 치르라고 요구한 것과 같았습니다. 많은 스크립트가 즉시 충돌하거나 잘못된 도구를 사용했습니다 (전구 나사를 조이기 위해 망치를 사용한 것처럼).
2. "시도, 실패, 수정"의 마법
연구자들이 AI 가 실수를 보고 다시 시도할 수 있도록 반복을 허용했을 때, 성공률은 극적으로 급증했습니다.
- 비유: 요리사가 케이크를 굽는다고 상상해 보세요. 첫 번째 시도에는 계란을 넣는 것을 잊었습니다. 심사위원이 "계란이 없습니다"라고 말합니다. 요리사가 다시 시도해 계란을 넣지만 케이크를 태웁니다. 심사위원이 "불을 낮추세요"라고 말합니다. 세 번째 또는 네 번째 시도에서 요리사는 마침내 완벽한 케이크를 굽습니다.
- 결과: 더 간단한 문제들의 경우, AI 는 약 5 번의 시도 내에 자신의 실수를 수정하는 데 매우 능숙해졌습니다.
3. "침묵하는 살인자": 잘못된 수학
가장 중요한 발견은 다음과 같습니다: AI 모델이 더 똑똑해질수록 실수의 유형이 바뀌었습니다.
- 바보 같은 AI: "구문 (syntax)" 오류를 범했습니다. 코드조차 실행되지 않았습니다. 열쇠가 잘못된 시동구에 꽂혀 있어 시동이 걸리지 않는 차와 같았습니다.
- 똑똑한 AI: 코드가 완벽하게 실행되었습니다! 하지만 숫자가 틀렸습니다. GPS 가 약간 어긋나서 잘못된 방향으로 향했지만 부드럽게 주행하는 차와 같았습니다.
- 교훈: 최고의 AI 모델조차 수치적 정확성에 어려움을 겪습니다. 양자 물리학 해결책처럼 보이는 코드를 작성할 수는 있지만, 내부의 수학이 약간 어긋나 과학적으로 쓸모없는 결과를 초래합니다.
4. 완벽함의 대가
AI 가 실수를 수정하도록 만드는 데는 시간이 걸립니다.
- 비유: 사람에게 보고서 작성을 요청하면 1 시간이 걸립니다. 작성하고 피드백을 받아 수정하고, 다시 피드백을 받아 다섯 번 더 수정하도록 요청하면 5 시간이 걸릴 수 있습니다.
- 결과: 연구자들은 반복적 피드백이 효과적이었지만, 막대한 "시간세"가 따랐음을 발견했습니다. 올바른 답을 얻는 것은 코드를 한 번 실행하는 것보다 훨씬 더 오래 걸리는 경우가 많았습니다. 매우 복잡한 문제의 경우, AI 는 때때로 시도하고 실패하는 루프에 빠져 컴퓨터 시간을 많이 소모하기도 했습니다.
결론
이 논문은 AI 가 코드 작성 능력이 향상되고 있지만, 아직은 신뢰할 수 있는 과학자가 아니다라고 결론 내립니다.
- 코드를 작성할 수 있는가? 네, 특히 실수를 수정하도록 허용한다면 가능합니다.
- 과학을 해결할 수 있는가? 스스로는 신뢰할 수 없습니다. 실행은 되지만 잘못된 숫자를 제공하는 코드를 자주 생성합니다.
연구자들은 현재로서는 AI 가 80% 까지 도달하게 해주는 훌륭한 "초안 작성자"이지만, 최종 수학을 확인하려면 여전히 인간 전문가 (또는 매우 엄격한 검증 시스템) 가 필요하다고 제안합니다. AI 가 과학을 수행한다고 믿어서는 안 됩니다. 실행되는 프로그램이 항상 올바른 답을 의미하는 것은 아니기 때문에 결과를 검증해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.