DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams
본 논문은 높은 정확도만 달성하고 신뢰할 수 있는 추론 근거가 부재하다는 한계를 해결하기 위해 다이어그램 내의 구체적인 시각적 증거에 기반한 답변 능력을 평가하도록 설계된 비전 - 언어 모델용 벤치마크 데이터셋 및 평가 프레임워크인 DRAGON 을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
복잡한 다이어그램—예를 들어 지도, 회로도, 또는 막대 그래프—을 보고 그에 관한 질문에 답해야 하는 시험을 치르고 있다고 상상해 보세요.
과거에는 컴퓨터 프로그램 (AI) 이 정답을 맞혔다면 우리는 그것이 그림을 "이해"했다고 가정했습니다. 하지만 이 새로운 논문인 DRAGON은 정답을 맞추는 것만으로는 부족하다고 주장합니다. AI 가 실제로 정답이 참임을 증명하는 그림의 특정 부분을 보지 않고도 질문의 단어나 데이터의 패턴을 바탕으로 답을 추측하거나, 심지어 속일 수도 있기 때문입니다.
수학 시험을 치르는 학생이라고 생각해 보세요.
- 옛날 방식: 학생이 답으로 "42"라고 적으면, 선생님은 체크 표시를 해줍니다. 우리가 그 학생이 계산을 했는지 아니면 그냥 추측했는지는 알 수 없습니다.
- DRAGON 방식: 선생님은 학생의 풀이 과정을 보여달라고 요구합니다. 학생은 사용한 구체적인 숫자를 동그라미로 표시하고, 공식으로 화살표를 그리며, "42"로 이어진 그래프의 부분을 강조해야 합니다. 증거를 가리킬 수 없다면, 최종 숫자가 정확했더라도 그들은 실제로 문제를 해결한 것이 아닙니다.
DRAGON 이란 무엇인가요?
DRAGON은 추측하는 AI 모델을 잡아내기 위해 고안된 새로운 "시험" (벤치마크) 입니다. 이는 간단하지만 어려운 질문을 던집니다: "정답을 찾은 그림의 정확한 위치를 보여주세요."
이 시험에 통과하려면 AI 는 사용한 구체적인 시각적 단서들을 상자로 표시해야 합니다. 이러한 단서들은 다음과 같을 수 있습니다:
- 차트의 특정 막대
- 지도의 라벨
- 회로도상의 전선
- 범례나 제목
시험을 어떻게 만들었나요?
연구자들은 단순히 AI 에게 추측하도록 요청한 것이 아니라, 여섯 가지 유형의 다이어그램 (차트, 지도, 회로도 등) 에서 11,000 개 이상의 질문으로 구성된 방대한 라이브러리를 구축했습니다.
각 질문마다 사람들이 "진실 증언자" 역할을 했습니다. 그들은 다이어그램과 정답을 보고, 그 답을 증명하는 데 필요한 시각적 증거를 정확히 상자로 표시했습니다.
- 비유: 범죄를 해결하는 형사를 상상해 보세요. 인간 주석 작성자들은 "단서는 방 전체가 아니라 바닥에 있는 이 특정 진흙 발자국입니다"라고 말합니다. 그런 다음 AI 는 그 동일한 발자국을 찾아야 합니다.
AI 에게 질문한 세 가지 방법
연구자들은 AI 가 풀이 과정을 보여줄 수 있는지 확인하기 위해 세 가지 다른 "프롬프트" (AI 에게 작업을 지시하는 방식) 를 시도했습니다:
- EDGE (직접적 접근): "여기 그림과 답이 있습니다. 증거 주변에 상자를 그려주세요." (학생에게 답만 쓰라고 하는 것과 같습니다).
- SAGE (단계별 접근): "먼저 무엇을 봐야 하는지 알려주세요 (예: '빨간 막대'와 '2020 년'). 그런 다음 그것들을 둘러싸는 상자를 그려주세요." (학생에게 풀이 전에 단계를 나열하도록 요구하는 것과 같습니다).
- VERGE (자기 수정 접근): "상자를 그려보세요. 이제 다시 그려진 것을 보세요. 무엇을 놓쳤나요? 상자가 너무 크나요? 수정하세요." (학생에게 작업을 다시 확인하도록 요구하는 것과 같습니다).
발견한 것 (결과)
결과는 AI 커뮤니티에 일종의 경각심을 불러일으켰습니다:
- AI 는 추측은 잘하지만 증명하는 것은 못함: 많은 AI 모델이 정답을 맞혔지만, 상자를 그려달라고 요청받았을 때 처참하게 실패했습니다. 그들은 종종 이미지의 잘못된 부분을 가리키거나 중요한 세부 사항을 놓쳤습니다.
- "블랙박스" 문제: 가장 똑똑한 AI 모델들 (Claude Opus 나 Gemini 등) 조차도 풀이 과정을 보여주는 데 어려움을 겪었습니다. 그들은 "정답은 50 입니다"라고 말할 수는 있지만, 차트에서 "50"을 신뢰할 수 있게 가리킬 수는 없었습니다.
- 일부 모델이 다른 모델보다 더 낫다: "클로즈드 소스" 모델 (Anthropic 과 Google 과 같은 대기업의 크고 비싼 모델들) 은 오픈 소스 모델보다 증거를 찾는 데 더 능했지만, 아무것도 완벽하지는 않았습니다.
- 정중하게 요청하는 것이 조금 도움이 됨: 단계별 (SAGE) 또는 자기 수정 (VERGE) 방법을 사용하면 AI 가 올바른 위치를 더 자주 찾을 수 있었지만, 근본적인 문제를 해결하지는 못했습니다. AI 는 여전히 증거의 일부를 놓치는 경우가 많았습니다.
왜 이것이 중요한가요?
이 논문은 AI 가 정답을 맞췄다는 이유만으로 다이어그램에 대한 추론을 신뢰할 수 없다고 결론 내립니다. AI 가 의료 차트, 재무 그래프, 또는 안전 다이어그램을 분석하는 데 사용된다면, 우리가 그 결정이 왜 내려졌는지 알아야 합니다.
DRAGON은 AI 가 추측을 멈추고 "풀이 과정을 보여주기" 시작하도록 강제하는 도구입니다. AI 가 그림을 이해한다고 말할 때 실제로 증거를 가리킬 수 있도록 보장하는 새로운 기준입니다.
한계점
저자들은 그들의 시험이 완벽하지 않다고 인정합니다. 그들은 증거를 표시하기 위해 간단한 직사각형 상자를 사용합니다. 이는 큰 막대나 블록에는 작동하지만, 회로도상의 가늘고 구불구불한 전선이나 지도상의 굽은 화살표와 같은 것을 표시하는 데는 상자를 사용하는 것이 어렵습니다. 또한, 때로는 서로 다른 사람들이 그림의 어떤 부분이 "가장 중요한" 단서인지에 대해 이견을 가질 수 있어, 시험에 약간의 주관성이 추가됩니다.
요약하자면: DRAGON은 "답만 주지 말고, 그림 속의 증거를 보여줘"라고 말하는 새로운 규칙집입니다. 그리고 현재 대부분의 AI 학생들은 그 시험에 낙제하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.