Building an AI Database for Agentic GTM Operations (Rippling)

Author: John Kutay (Rippling) | Source: Medium | Published: 2026-06-13


한 줄 요약

Rippling이 GTM 데이터를 단일 lakehouse로 재구축해 ML 기반 entity resolution·실시간 자연어 인터페이스(Genie)·시맨틱 검색을 결합하고, “DRY(E)” 원칙으로 1,500+ 사용자와 AI 에이전트에 통합 source of truth를 제공.

핵심 주장/내용

  • GTM의 가장 어려운 문제는 볼륨이 아니라 “무엇이 진짜인가”(같은 회사·사람이 vendor마다 다르게 등장) → ML entity resolution 필요
  • 레거시 웨어하우스는 ① AI/ML 워크로드 ② identity 통합 ③ 저지연 인터랙티브 답변을 동시에 못 함 → 단일 lakehouse로 통합. Databricks vs Snowflake bake-off에서 비용·속도·in-platform 모델 접근으로 Databricks 채택
  • ML 기반 entity resolution: candidate blocking(n² 회피용 blocking tree) → supervised pairwise classifier로 같은 엔티티 여부 스코어. 매치 종류 분류(same person/job change/internal job change/singleton)와 survivorship. 신뢰도 점수 + 기여 source 감사
  • DRY(E) — Don’t Repeat Your Embeddings: 웨어하우스 레코드를 매 요청마다 LLM 컨텍스트에 넣으면 토큰 낭비·예측 불가 → AI-ready 표현을 한 번 precompute 후 governed retrieval로 반복 서빙
  • 시맨틱 검색: raw blob이 아닌 retrieval-ready corpus(Delta change tracking으로 변경분만, speaker 라벨링, 컨텍스트 보존 chunking, embedding 전 enrichment). storage-optimized vector search(수백만~수천만 행, 수십 ms)
  • 4대 원칙: DRY(E), 증분 처리, interoperable by default(Delta + Iceberg read), Medallion

주요 수치 / 사실

  • 1,500+ 사용자 통합 source of truth, Genie API 2,000+ 사용자
  • entity resolution: 수억 레코드, 수천 Spark 파티션, ~40시간
  • 3개월 내 zero→프로덕션 핵심 인프라; demo 예약 ~1/3↑, 신규 기회 ~1/5↑(A/B); TAM 1천만+ 사용자 확대; 첫 달 addressable market 두 자릿수 성장; 세일즈 플레이 생성 ~10배 저렴

관련 위키


Source: 원문 보기