Building a Centralized Alerting Framework for Data Quality Monitoring and Incident Management (Helpshift)

Author: Manav Mehta (Helpshift) | Source: Medium (Helpshift Engineering) | Published: 2026-06-17


한 줄 요약

모니터링 로직이 이미 Snowflake에 있으므로 알림 프레임워크도 Snowflake 네이티브로 구축해, Detection·Notification·Escalation을 느슨하게 결합하고 컨텍스트 있는 알림으로 MTTR을 단축.

핵심 주장/내용

  • 진짜 문제는 장애 탐지가 아니라 “적절한 사람에게 빠르게, 행동 가능한 컨텍스트와 함께 알리는 것”. 파편화된 모니터링으로 다운스트림 리포트에서야 문제 발견
  • 3대 책임 분리: Detection(Snowflake Alert가 missing partition·freshness·중복·null·task 실패 평가) → Notification(Slack webhook + Email native integration) → Escalation(Splunk On-Call)
  • 외부 시스템 보안 연결(Splunk On-Call은 outbound API): Network Rules(EGRESS 허용 endpoint) + External Access Integration(보안 경계) + Snowflake Secrets(자격증명, 코드 임베딩 회피) + Python Stored Procedure로 자동 incident 생성
  • 컨텍스트 있는 알림: “Data Quality Check Failed”는 무용 → 어떤 validation 실패, missing hours, 중복 수, invalid row, 영향 데이터셋 포함 → 조사 시간 단축
  • 느슨한 결합: 새 validation 추가가 채널 수정 불요, 새 채널 추가가 alert 로직 불요, escalation 정책 변경이 Alert 불요

주요 수치 / 사실

  • 이벤트 인제스천 파이프라인의 3대 검증: Missing Hour, Duplicate Record, Mandatory Field → 단일 Snowflake Alert로 통합
  • 확장 가능 use case: ETL 실패, task 모니터링, freshness, SLA, cost anomaly, KPI 임계
  • 핵심: 컨텍스트 > 일반 알림, detection/notification 분리, 다중 채널, 보안 통합, escalation 자동화

관련 위키


Source: 원문 보기