Testing JSON Schema Instruction Artifacts: Distributional Robustness under Validation-Equivalent Serialization and JSON Mode
본 연구는 검증상 동등한 JSON 스키마 직렬화가 언어 모델 출력 분포에 통계적으로 유의미하고 실질적으로 의미 있는 변화를 유발할 수 있음을 입증하며, 이는 검증 동등성만으로는 배포된 시스템의 분포적 강건성을 보장하기 위한 불충분한 회귀 오라클임을 드러낸다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하지만 약간은 글자 그대로만 받아들이는 로봇에게 특정한 종류의 샌드위치를 만드는 지침을 주고 있다고 상상해 보세요. 당신은 종이에 그 지침을 적습니다. 이제, "이 샌드위치 레시피는 완벽하다"라고 적힌 마법 도장을 상상해 보세요. 이 도장은 당신이 모든 올바른 재료(빵, 치즈, 햄)를 갖추었는지, 그리고 실수로 머스터드를 빠뜨리지는 않았는지 확인합니다. 하지만 여기 함정이 있습니다. 이 도장은 당신이 단계를 적은 순서에는 신경 쓰지 않습니다. 당신이 "빵 위에 햄을 올리고, 그다음 치즈를 올려라"라고 하든, "빵 위에 치즈를 올리고, 그다음 햄을 올려라"라고 하든, 최종적인 샌드위치는 동일한 구성 요소를 가지고 있기 때문에 도장은 똑같이 "완벽함"이라는 엄지손가락을 치켜세워 줍니다.
컴퓨터 과학의 세계에서, 이 "도장"은 **JSON 스키마(JSON Schema)**라고 불립니다. 이것은 데이터가 어떤 모습이어야 하는지를 알려주는 규칙 책입니다. 우리가 인공지능(AI)에게 코드를 작성하거나 정보를 정리하도록 요청할 때, 우리는 종종 이 규칙 책을 지침 세트로 제공합니다. 여기서 큰 질문은, 만약 우리가 종이 위의 지침 순서를 바꾼다면—실제 규칙이나 "완벽한" 도장은 바꾸지 않은 채로—AI가 여전히 정확히 똑같은 샌드위치를 만들어낼 것인가 하는 점입니다. 즉, AI가 새로운 순서 때문에 혼란에 빠져, 도장의 검사를 통과했음에도 불구하고 약간 다른 것을 내놓게 될까요? 이것은 중요한 이유는, 만약 AI가 단어를 재배열했다는 이유만으로 마음을 바꾼다면, 의료 기록이나 금융 보고서와 같은 중요한 업무에서 신뢰할 수 없게 되기 때문입니다.
이 논문은 마치 탐정 소설과 같습니다. 저자인 션야오 선(Shengyao Sun)은 AI의 "두뇌"가 이 규칙 책에 적힌 단어의 순서에 민감한지 조사합니다. 이 연구는 서로 다른 AI 모델들에게 동일한 규칙 책을 사용하여 동일한 퍼즐을 풀도록 요청하되, 지침이 서로 다른 순서로 작성된 방식으로 테스트를 진행했습니다. 그들은 단순히 한 번만 물어본 것이 아니라, 어떤 변화가 단순히 우연에 의한 것이 아님을 확실히 하기 위해 각 버전마다 다섯 번씩 물어보았습니다. 그들은 일부 AI 시스템의 경우, 단어의 순서가 중요했다는 사실을 발견했습니다. 속성(예: "이름" 또는 "나이")의 순서가 바뀌었을 때, AI는 비록 그 답변들이 규칙 책에 따라 기술적으로는 "정당"할지라도, 다른 답변을 내놓기 시작했습니다.
하지만 모든 AI의 이야기가 똑같지는 않습니다. 저자는 이 "순서 민감도"가 사용하는 특정 AI 시스템에 전적으로 달려 있다는 것을 발견했습니다. "Sonnet"과 "Qwen" 시스템의 경우, 순서를 섞었을 때 평소보다 약 5%에서 12% 더 많은 불일치가 발생하는 등 눈에 띄는 변화가 나타났습니다. 그러나 "GPT"와 "DeepSeek" 시스템의 경우에는 순서를 섞어도 거의 차이가 없었습니다. 연구진은 또한 특별한 "JSON 모드"(AI에게 형식을 매우 주의 깊게 다루라고 지시하는 설정)가 이 문제를 해결할 수 있는지 확인했습니다. 놀랍게도, 그것은 해결책이 되지 못했습니다. AI는 엄격한 모드에서도 단어의 순서 때문에 여전히 혼란을 겪었습니다.
가장 중요한 시사점은, 컴퓨터 프로그램이 어떤 지침 세트가 "유효"하거나 "정확하다"고 말한다고 해서, 그것이 형식을 약간 수정했을 때 AI가 똑같이 행동할 것이라는 보장은 없다는 것입니다. 저자는 우리가 더 이상 "도장"만을 신뢰해서는 안 된다고 제안합니다. 대신, 우리는 이 지침 세트를 소프트웨어 코드처럼 취급해야 합니다. 즉, 이를 표준 순서(예: 항상 알파벳 순으로 재료를 나열하는 것)로 고정하고, 실제 세상에서 실행하기 전에 면밀히 테스트해야 합니다. 이 연구는 검증만으로는 충분하지 않다는 것을 증명합니다. 우리는 지침이 재배열되었을 때 AI의 행동이 안정적으로 유지되는지 확인해야 합니다. 왜냐면 어떤 AI들에게는, 단어의 순서가 비밀스러운 레시피의 일부이기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.