Semantic Search for AI Agents at Scale: MUSE for LinkedIn’s Hiring Assistant

Author: LinkedIn Engineering | Source: LinkedIn Engineering Blog | Published: 2026-06-11


한 줄 요약

LinkedIn이 자연어 채용 쿼리를 13억+ 프로필과 매칭하기 위해, LLM-as-Judge teacher의 qualification 판정을 dual-tower Matryoshka 임베딩(MUSE)으로 증류해 retrieval과 ranking을 단일 모델로 동시 서빙.

핵심 주장/내용

  • 문제: 리크루터는 키워드가 아닌 문단(“3+ years pediatric care, bilingual Spanish”)을 입력 → 단어가 아닌 실제 적합 후보 매칭. 기존 faceted(liquidity 높으나 부정확) / boolean(정확하나 절반 쿼리가 0 결과)의 quality-liquidity 트레이드오프
  • MUSE Teacher(LLM-as-Judge): “qualified”의 product policy(relevance 정의 + Responsible AI)를 prompt에 encode. Expert Judge(proprietary LLM)가 seed 라벨 → open-weight reasoning 모델로 수백만 라벨 확장. chain-of-thought 모델이 더 정확, 고신뢰 LLM이 human 라벨러보다 정확(기술 qualification)
  • MUSE 임베딩: dual-tower Siamese(query/profile 인코더 weight 공유, profile은 오프라인 사전계산). Matryoshka 임베딩(한 번 학습으로 4096→2048→1024 truncation) — retrieval은 2048(ANN), ranking은 full 4096(L2 ranker feature). InfoNCE contrastive loss(engagement 아닌 teacher 라벨)
  • 프로덕션: Lambda 아키텍처(batch layer 전체 재계산 + speed layer CDC delta inference), IVFPQ ANN(bisecting k-means), Iceberg date-partitioned 테이블(look-ahead bias 방지, 규제 삭제)
  • 놀라운 발견: 고신뢰 LLM > human 라벨러(knowledge-intensive), contrastive post-training 정렬 > 모델 크기, ANN + post-filter는 손실이 곱해짐(exhaustive kNN이 ~30% 더 많은 후보)

주요 수치 / 사실

  • 13억+ 프로필, query embedding < 100ms p95
  • 온라인 A/B: post-LLM Guard HRR +2.7%, InMail Sends/seat +4.1%, Eval Pass Rate +3.8%, 후보 sourced/seat ~4%↓(fewer but better)
  • semantic retrieval candidate share 18%→31%; teacher prompt 반복으로 +24% Kappa
  • L2 ranker(DCNv2, 100+ feature)에서 MUSE 임베딩이 가장 영향력 큰 feature 그룹

관련 위키


Source: 원문 보기