← 최신 논문
🤖 machine learning

FreshRetailNet-LT: A Stockout-Annotated Censored Demand Dataset for Latent Demand Recovery and Forecasting in Fresh Retail

이 논문은 50,000개의 시간당 매장-상품 시계열 데이터와 정밀한 품절 주석을 특징으로 하는 최초의 대규모 벤치마크 데이터셋인 FreshRetailNet-50K를 소개하며, 이는 연구자들이 잠재 수요를 재구성하고 검열된 판매 데이터로 인해 발생하는 체계적 편향을 교정함으로써 신선 식품의 예측 정확도를 크게 향상시킬 수 있게 한다.

원저자: Yangyang Wang, Jiawei Gu, Li Long, Xin Li, Li Shen, Zhouyu Fu, Xiangjun Zhou, Xu Jiang

게시일 2026-06-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yangyang Wang, Jiawei Gu, Li Long, Xin Li, Li Shen, Zhouyu Fu, Xiangjun Zhou, Xu Jiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 아주 바쁜 레모네이드 가판대를 운영하고 있다고 상상해 보세요. 당신은 사람들이 정확히 몇 잔의 레모네이드를 원하는지 알고 싶습니다. 그래야 완벽한 양을 만들 수 있기 때문입니다. 너무 많이 만들면 시어버리고(낭비), 너무 적게 만들면 판매 기회를 놓치게 됩니다.

문제는, 당신의 판매 기록이 거짓말을 하고 있다는 점입니다.

문제: "빈 컵"의 환상

신선 식품(딸기, 생선, 우유 등)의 세계에서 상점들은 종종 재고가 바닥나곤 합니다. 예를 들어, 100명의 고객이 딸기를 원하지만, 당신에게는 50개밖에 없다고 해봅시다. 당신은 오전 11시에 품절되었습니다.

그 후 남은 시간 동안의 판매 기록은 다음과 같이 말합니다: "판매량 0."

하지만 이것은 사실이 아닙! 수요는 여전히 존재했지만, 단지 재고가 없었을 뿐입니다. 이것을 **검열된 데이터(censored data)**라고 부릅니다. 이는 마치 배터리가 다 되어 녹화가 중단된 카메라와 같습니다. 만약 당신이 이 고장 난 카메라를 통해 학습하려 한다면, "아, 오후에는 아무도 딸기를 원하지 않는구나"라고 생각하게 될 것입니다. 그리고 다음 날에는 딸기를 더 적게 주문하게 되는 악순ร의 고리에 빠지게 됩니다.

해결책: FreshRetailNet-LT

이 논문의 저자들은 이 고장 난 카메라를 고치기 위해 FreshRetailNet-LT라는 새로운 대규모 데이터셋을 만들었습니다. 이것은 신선 식품 판매에 대한 "매우 상세한 일기"라고 생각하면 됩니다.

이 데이터셋이 특별한 이유는 다음과 같습니다 (쉬운 비유를 사용하겠습니다):

1. 고화질 비디오 vs. 일일 요약본
기존의 대부분의 데이터셋은 일일 요약 노트와 같습니다: "오늘 사과 50개 판매됨." 이 노트는 당신이 언제 품절되었는지는 알려주지 않습니다.
이 새로운 데이터셋은 매시간 기록되는 고화질 비디오와 같습니다. 이는 선반이 정확히 언제 비었는지를 보여줍니다. 이 데이터셋은 18개 도시, 1,000개 이상의 매장에서 2년 동안 발생한 20,000개의 서로 다른 제품 이야기를 기록합니다. 시간 단위로 추적하기 때문에, 오후 2시에 판매가 없더라도 오전 11시에 딸기가 품절되었다는 사실을 포착할 수 있습니다.

2. "진실 레이블 (Truth Label)"
보통 컴퓨터는 상점에 재고가 떨어졌는지 여부를 추측해야 합니다. 하지만 이 데이터셋에는 **검증된 "품절 레이블(stockout labels)"**이 포함되어 있습니다. 이는 마치 선생님이 선반이 실제로 비어 있었던 모든 순간에 금색 별표를 붙여주는 것과 같습니다. 이를 통해 연구자들은 "아무도 원하지 않은 것(진정한 수요 0)"과 "재고가 떨어진 것(검열된 수요)"의 차이를 컴퓨터에게 가르칠 수 있습니다.

3. 맥락적 단서 (Context Clues)
이 데이터셋은 단순히 판매량만 세는 것이 아니라, 판매에 대한 "기상 보고서"를 기록합니다. 여기에는 다음이 포함됩니다:

  • 프로모션: 50% 할인 행사를 했나요? (이는 보통 수요의 급증을 일으킵니다).
  • 날씨: 비가 오나요? (사람들이 집에서 요리하기 위해 신선한 채소를 더 많이 살 수도 있습니다).
  • 공휴일: 중국 설날인가요? (사람들은 평소와 다른 물건을 삽니다).

테스트 방법: 2단계 해결책

연구진은 이 새로운 데이터셋을 사용하여 "거짓말하는 판매 기록"을 고치는 2단계 방법을 테스트했습니다.

  • 1단계: 탐정 업무 (복구 - Recovery)
    먼저, 그들은 "금색 별표" 레이블을 사용하여 누락된 판매량을 재구성했습니다. 만약 선반이 오전 11시에 비었다면, 모델은 선반이 비어 있지 않았을 경우 사람들이 얼마나 많은 딸기를 샀을지를 추정합니다. 이는 영화의 빠진 프레임을 채워 넣는 것과 같습니다.
  • 2단계: 수정구슬 (예측 - Forecasting)
    둘째, 그들은 이 "재구성된 진실"을 사용하여 컴퓨터가 미래의 수요를 예측하는 법을 학습시켰습니다.

결과: 더 명확한 그림

이 방법을 테스트했을 때, 결과는 인상적이었습니다:

  • 추측 감소: 컴퓨터는 수요를 과소평가하는 것을 멈췄습니다. 이전에는 약 6.7% 정도의 오차(사람들이 실제보다 덜 원한다고 생각함)가 있었지만, 이 새로운 방법을 사용한 후 오차는 0에 가깝게 떨어졌습니다.
  • 더 높은 정확도: 전체적인 예측 정확도가 1.63% 향상되었습니다. 수백만 달러 규모의 신선 식품을 판매하는 세상에서, 이 작은 퍼센트는 엄청난 돈을 아끼고 낭비를 줄여줍니다.

왜 중요한가

이 논문은 단순한 수학에 관한 것이 아니라, 깨진 시스템을 고치는 것에 관한 것입니다. "재고가 떨어졌다"는 사실을 인정하고 정확히 언제 그랬는지를 알려주는 데이터셋을 제공함으로써, 상점들이 신선한 식품이 품절되는 순환을 멈추도록 돕습니다. 이를 통해 상점들은 썩기 쉬운 물건을 적절한 양만큼 주문할 수 있고, 여러분이 가게에 갔을 때 딸기가 실제로 진열되어 있도록 보장할 수 있습니다.

저자들은 과학자와 상점 주인 모두가 이 퍼즐을 풀 수 있도록 이 "매우 상세한 일기"와 그들의 코드를 누구나 사용할 수 있도록 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →