Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance
이 논문은 국제 해상 위험물 규칙(IMDG Code)에 대한 대규모 언어 모델의 성능을 평가하는 첫 번째 벤치마크인 DGEval을 소개하며, 모델들이 객관식 문제와 구조화된 조회 작업에서는 인간보다 뛰어난 성능을 보일 수 있으나, 적재 및 격리(stowage and segregation)와 같은 안전 필수 영역에서의 신뢰성 부족으로 인해 배포 전 지속적인 인간의 감독이 필요함을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
대양은 거대하고 강력한 힘이며, 그 위에서 물자를 운송하기 위해서는 선박과 선원, 그리고 환경을 안전하게 지키기 위한 엄격한 규칙 세트가 필요합니다. 기업들이 화학 물질, 배터리, 또는 인화성 액체와 같은 위험물을 운송할 때, 그들은 국제 해사 위험물 규칙(International Maritime Dangerous Goods Code)이라 불리는 방대한 국제 규칙집을 반드시 준수해야 합니다. 이 문서는 단순한 목록이 아닙니다. 모든 품목이 어떻게 분류되고, 포장되고, 라벨이 붙으며, 선박의 어느 위치에 배치되어야 하는지를 규정하는 복잡한 지침의 망입니다. 이를 잘못 처리하면 화재, 폭발, 또는 독성 물질 유출로 이어질 수 있으며, 일단 선박이 바다 위에 떠 있으면 이를 해결하는 것은 거의 불가능합니다. 수십 년 동안 이러한 결정을 책임지는 사람들은 자신의 훈련 내용과 세심한 수동 점검에 의존해 왔습니다. 그러나 오늘날, 많은 전문가들이 새로운 종류의 도구인 대규모 언어 모델(large language models)이라 불리는 인공지능 시스템으로 눈을 돌리고 있습니다. 이 컴퓨터 프로그램들은 인간의 언어로 질문을 읽고 답할 수 있어, 수천 페이지에 달하는 규정에 즉각적으로 접근할 수 있다는 약속을 제시합니다. 하지만 이 분야에서의 실수는 생명과 직결될 수 있기 때문에, 문제는 단순히 이 도구들이 얼마나 똑똑한가가 아니라, 가장 중요한 결정들을 맡길 수 있을 만큼 충분히 안전한가 하는 것입니다.
한 연구팀은 해사 안전을 위해 특별히 설계된 엄격한 테스트를 구축함으로써 이 질문에 답하고자 했습니다. 그들은 인공지능을 위한 최종 시험 역할을 하는 DGEval이라는 벤치마크를 만들었습니다. 이 테스트는 해사 전문가들이 사용하는 실제 교육 자료와 위험물 공식 목록을 바탕으로 제작되었습니다. 여기에는 화학 물질의 정확한 명칭을 식별하는 것부터 특정 컨테이너를 재난 없이 선박의 어느 위치에 배치할 것인지 결정하는 것에 이르기까지, 거의 1,700개의 질문이 포함되어 있습니다. 연구진은 6개의 주요 기술 기업에서 나온 13개의 서로 다른 인공지능 모델을 평가했습니다. 그들은 모델들에게 객관식 질문에 답하게 하거나, 자유 형식의 설명문을 작성하게 하거나, 특정 데이터를 찾아내거나, 답변이 포함된 규칙집의 정확한 부분을 식별하게 하는 등 다양한 방식으로 테스트를 진행했습니다. 또한, 모델들에게 인터넷을 통해 정보를 검색할 수 있는 권한을 주는 것이 성능 향상에 도움이 되는지도 테스트했습니다.
결과는 이 모델들이 할 수 있는 것과 할 수 없는 것 사이의 명확한 차이를 보여주었습니다. 가장 성능이 뛰어난 모델인 구글의 대규모 시스템은 훈련된 평균적인 전문가보다 객관식 질문을 더 자주 정확하게 맞혔습니다. 이 모델은 화학 물질의 공식 명칭이나 기본적인 위험 등급과 같은 단순한 사실을 검색하는 데 탁-월했습니다. 그러나 연구 결과, 모델들은 안전에 있어 가장 중요한 영역에서는 현저히 약하다는 것이 밝혀졌습니다. 질문이 복잡한 운영 결정, 즉 서로 양립할 수 없는 물품을 어떻게 분리하거나 선박의 어디에 적재할 것인가와 관련될 때 모델들은 고전했습니다. 최고 성능의 시스템조차도 이러한 고위험 영역에서는 빈번한 오류를 범했습니다. 또한 연구진은 모델들이 답변을 찾을 수 있는 규칙집의 특정 섹션을 지목하는 능력이 매우 떨어진다는 것을 발견했는데, 이는 인간이 AI의 작업을 검증하는 데 필수적인 기술입니다.
연구는 또한 질문의 유형이 성능에 어떤 영향을 미치는지 살펴보았습니다. 모델들에게 목록 중에서 정답을 선택하도록 요청했을 때는 비교적 잘 수행했습니다. 하지만 선택지 없이 처음부터 답변을 생성하도록 요청했을 때는 정확도가 떨어졌습니다. 이는 모델들이 정보가 제시되었을 때 그것을 인식하는 데는 능숙하지만, 스스로 그 정보를 생성해 내는 데는 신뢰도가 낮다는 것을 시사합니다. 연구진은 모델들에게 인터넷을 통해 답을 찾는 권한을 주는 것이 특정 데이터를 찾아낼 때는 큰 도움이 되었지만, 복잡한 추론 작업에는 도움이 되지 않았다는 것을 발견했습니다. 흥ًا, 해사 규정에 대해 특별히 학습된 모델이 일반적인 범용 모델보다 더 나은 성능을 보이지 않았는데, 이는 단순히 선박에 관한 텍스트를 학습 데이터에 추가하는 것만으로는 문제를 해결할 수 없음을 나타냅니다.
아마도 가장 중요한 발견은 모델들이 일관성이 없었다는 점일 것입니다. 어떤 시스템은 단순한 사실은 맞히면서도, 화재를 예방할 수 있는 안전에 직결된 규칙은 틀릴 수 있습니다. 연구진은 모델들이 폭발물이나 독성 가스와 같은 위험 물질에 대한 질문을 받았을 때, 정당한 안전 문의를 마치 유해한 요청인 것처럼 취급하며 답변을 거부하는 경우가 많다고 언급했습니다. 이러한 안전 질문과 안전 위협을 구분하지 못하는 능력의 부재는, 현재 이 도구들이 가장 위험한 업무를 수행하기에는 신뢰할 수 없음을 의미합니다. 연구는 이러한 인공지능 도구들이 전문가들이 정보를 빠르게 찾는 데는 유용할 수 있지만, 아직 스스로 안전 결정을 내릴 준비는 되지 않았다고 결론지었습니다. 연구진은 인간의 감독이 여전히 필수적임을 강조했습니다. 전문가는 최종 결정을 내리기 전에 항상 공식 규칙집을 통해 AI의 작업을 확인해야 합니다. 이 연구는 단 한 번의 판결이 아니라 지속적인 안전 보장을 위한 도구이며, 이러한 컴퓨터 시스템이 진화함에 따라 가장 중요한 순간에 실패하지 않도록 끊임없이 테스트되어야 한다는 점을 업계에 상기시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.