Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation
이 연구는 소규모 시각-언어 모델들이 현실적인 이미지 저하 상황에서 자신의 오류에 대한 정확한 내부적 자기 지식을 보유하고 있음에도 불구하고 이를 언어화하는 데는 실패하며, 이에 따라 내부 토큰 확률이 명시된 신뢰도보다 유예를 위한 더 우수한 신호가 되지만, 두 신호 모두 심각한 저조도 조건에서는 신뢰할 수 없게 된다는 점을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 아주 똑똑하지만 아주 작은 로봇 가이드와 함께 북적이는 도시를 걷고 있다고 상상해 보세요. 이 로봇은 눈 역할을 하는 카메라와 말하는 목소리를 가지고 있습니다. 로봇의 임은 주변 사물을 보고 그것이 무엇인지 당신에게 알려주는 것입니다. 하지만 여기에는 함정이 있습니다. 도시는 매우 무질서합니다. 때로는 햇빛이 너무 눈부시고, 때로는 칠흑 같은 어둠이 깔리며, 때로는 카메라 렌즈가 더럽거나 흔들리기도 합니다. 인공지능의 세계에서 이러한 "무질서한" 사진들을 **저하된 이미지(degraded images)**라고 부릅니다.
로봇이 나쁜 사진 때문에 혼란에 빠졌을 때, 로봇은 틀린 답을 자신 있게 추측하는 대신 "모르겠어요, 사람에게 물어보세요"라고 말할 줄 알아야 합니다. 자신이 확신하지 못한다는 것을 아는 이 능력은 **불확실성(uncertainty)**이라고 불립니다. 로봇이 불확실성을 보여주는 데는 두 가지 방법이 있습니다. 첫 번째는 **언어화된 확신(verbalized confidence)**입니다. 로봇이 단순히 입 밖으로 "저는 90% 확신합니다!"라고 말하는 것이죠. 두 번째는 **내부적 확신(internal confidence)**입니다. 이는 로봇의 생각 속에 있는 비밀스럽고 조용한 신호로, 로봇이 말을 하지 않더라도 자신의 생각이 얼마나 흔들리고 있는지를 측정합니다. 대부분의 사람들은 로봇이 확신한다고 말하면, 정말로 확신하고 있을 것이라고 가정합니다. 하지만 만 만약 로봇이 그저 형편없는 거짓말쟁이라면 어떻게 될까요? 이것이 바로 이 논문이 던지는 질문입니다.
비밀 신호의 이야기
이 연구에서 연구진은 두 개의 작은 오픈 소스 로bt 가이드(Qwen2-VL과 SmolVLM)를 엄격한 테스트에 투입했습니다. 연구진은 단순히 깨끗하고 완벽한 사진만을 보여준 것이 아닙니다. 대신, 음식 사진 100장을 가져와 여섯 가지 방식으로 의도적으로 망가뜨렸습니다. JPEG 파일처럼 품질을 뭉개거나, 움직임으로 인해 흐릿하게 만들거나, 거의 암흑이 될 때까지 빛을 줄이거나, 눈이 멀 정도로 눈부신 빛을 더하거나, 카메라를 기울이거나, 이미지를 축소 및 확대했습니다. 각 유형마다 세 가지 수준의 심각도를 적용했습니다.
로봇은 모든 망가진 사진 속의 음식이 무엇인지 맞춰야 했습니다. 그런 다음 연구진은 두 가지를 확인했습니다:
- 로봇이 "확신해요!"라고 말했는가, 아니면 "잘 모르겠어요"라고 말했는가? (언어적 신호)
- 로봇의 비밀스러운 내부 점수인 '정답일 확률'은 얼마였는가? (내부적 신호)
커다란 반전: 틀렸음을 인정하지 않는 로봇
결과는 마치 실력은 형편없으면서도 계속해서 허리를 굽히며 "완벽했습니다!"라고 외치는 마술사를 보는 것과 같았습니다.
언어적 신호 (로봇의 입):
자신의 확신을 말해달라는 요청을 받았을 때, 로직들은 믿기 힘들 정도로 고집스러웠습니다. 사진이 아무리 엉망이든, 아무리 흐릿하거나 어둡든 상관없이, 그들은 계속해서 약 87%에서 90% 정도 확신한다고 말했습니다. 심지어 사진이 너무 어두워서 로봇이 사실상 무작위로 찍고 있는 상황(정답률이 **22%**에 불과한 상황)에서도, 로봇은 여전히 "87% 확신합니다!"라고 당당하게 말했습니다. 마치 로봇의 확신 다이얼이 "높음"에 고장 난 채로 박혀 있는 것 같았습니다. 실제로 한 로봇의 경우, 확신 수치를 말하도록 요청하는 것이 너무 어려웠는지, 숫자 없이 음식의 이름만 말하고 답변을 거부하는 경우가 대부분이었습니다.
내부적 신호 (로봇의 뇌):
하지만 연구진이 로봇의 뇌 속을 들여 들여다보며 비밀스러운 '토큰 확률(token probabilities, 로봇의 수학적 확신도를 측정하는 세련된 방식)'을 확인했을 때, 완전히 다른 결과가 나왔습니다. 로봇의 내부 신호는 사실 매우 정직했습니다! 사진이 깨끗할 때는 내부 점수가 높았습니다. 사진이 흐릿하거나 어두워지면 내부 점수는 크게 떨어졌습니다. 이 비밀 신호는 매우 뛰어나서, 정답과 오답을 **92%에서 99%**의 정확도로 구분해 낼 수 있었습니다.
"저조도"의 함정
하지만 이 이야기에는 한 가지 무서운 순간이 있었습니다. 연구진이 사진을 극도로 어둡게 만들었을 때(심각한 저노출 단계), 두 신호 모두 실패했습니다. 로봇의 정확도는 급락했고( **99%**에서 **22%**로 하락), 정직했던 내부 신호마저 작동을 멈췄습니다. 내부 신호는 더 이상 정답과 오답을 구분하지 못했습니다. 마치 어둠이 너무 짙어서 로봇의 비밀스러운 뇌마저 안개가 낀 것처럼 흐릿해진 것 같았습니다.
이것이 당신에게 의미하는 바
그렇다면 연구진은 무엇을 배웠을까요?
- 로봇의 입을 믿지 마세요. 작은 로봇 가이드에게 얼마나 확신하느냐고 묻는다면, 로봇은 길을 잃었을 때조차 매우 확신한다고 거짓말을 할 가능성이 높습니다. 이 논문은 이러한 "말해진 확신(stated confidence)"이 언제 멈추고 사람에게 도움을 요청해야 할지 판단하는 데 있어 쓸모없다는 것을 보여줍니다.
- 로봇의 뇌를 믿으세요 (대체로). 비밀스러운 내부 수학 모델이 훨씬 더 낫습니다. 그것은 자신이 혼란스러울 때를 알고 있으며, 이를 컴퓨터 시스템에 신호로 보낼 수 있어 시스템이 "알겠습니다, 잘 모르겠으니 사람에게 확인을 요청합시다"라고 말할 수 있게 해줍니다.
- 하지만 어둠을 주의하세요. 이미지가 너무 어두우면 정직한 내부 신호조차 무너집니다. 만약 당신이 어두운 방이나 밤에 이 로봇들을 사용한다면, 로봇이 실패했다는 것을 알려주기를 기다려서는 안 됩니다. 로봇이 눈을 뜨기도 전에 사진이 너무 어둡지는 않은지 확인하는 별도의 "안전 점검"이 필요합니다.
요약하자면, 작은 AI 로봇들은 자신의 코드 깊은 곳에서는 자신이 틀렸다는 것을 알고 있지만, 그것을 입 밖으로 내뱉지는 않습니다. 그들은 시험 문제를 틀려놓고도 여전히 손을 들며 "전 완전히 확신합니다!"라고 말하는 학생과 같습니다. 그들을 잡아낼 유일한 방법은 그들이 하는 말을 듣는 것이 아니라, 그들의 비밀스러운 연습장을 들여다보는 것뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.