How Partition Access Visualizations Reduced our Data Lake S3 Cost by 33%
Author: Nick Del Nano (Yelp Data Streaming) | Source: Yelp Engineering Blog | Published: 2026-05-21
한 줄 요약
S3 서버 액세스 로그로 파티션·엔티티별 접근 패턴을 시각화해 데이터 소유자가 누가·어떻게 데이터를 쓰는지 파악하게 함으로써, Iceberg 마이그레이션 우선순위와 스토리지 클래스 최적화로 데이터 레이크 S3 비용을 33% 절감.
핵심 주장/내용
- 데이터 팀의 고질적 난제 “내 데이터를 누가 쓰는가”를 파티션 키 값(시간) vs 접근 이벤트 타임스탬프 플롯으로 해결
- 접근 패턴에서 사용 시그니처 식별: 일일 배치(y=x 대각선), 백필(수직선), 애드혹 쿼리(산점도) — 접근 IAM 역할까지 시각화
- 세 가지 플랫폼 가치: 고객 가치(소비자 추적), 비즈니스 가치(스토리지 클래스 추천 → 33% 절감), 플랫폼 효율(활성 테이블 우선 Iceberg 마이그레이션)
- 알려진 접근 패턴 기반 S3 스토리지 클래스 활용: 예측 불가 시 Intelligent Tiering 기본, 명확한 콜드 데이터는 Glacier
- Default Access Retention: 예상 접근 윈도우를 정의하고, 그 이후 데이터는 S3에 남기되 제한적 IAM 정책으로 게이팅(Terraform PR + 비용 추정 대시보드 + 승인 단계)
주요 수치 / 사실
- S3 스토리지 비용 33% 절감
- Intelligent Tiering: 30일 미접근 시 비용 40%↓, 90일 미접근 시 81%↓ (Glacier에 근접)
- 페타바이트급 데이터 레이크, 수천 개 테이블을 Iceberg로 마이그레이션
- 구현: S3 서버 액세스 로그 → SQL 엔진으로 테이블·파티션·엔티티별 집계 + S3 Inventory 조인
관련 위키
Source: 원문 보기