Crosscheck: Benchmarking AI Models in the Real World

Author: LinkedIn Labs | Source: LinkedIn Engineering Blog | Published: 2026-05-21


한 줄 요약

LinkedIn의 직업 정체성과 통계적 혁신(시간 감쇠, 정규화, 신뢰구간 티어링)을 결합해, “직무·산업별로 어떤 AI 모델이 가장 좋은가”를 크라우드소싱 쌍대 비교로 측정하는 벤치마킹 플랫폼.

핵심 주장/내용

  • 일반 벤치마크가 아닌 **“내 직무/산업의 동료들은 어떤 모델을 선호하는가”**를 답하기 위해, 사용자가 두 모델의 응답을 비교 선택하는 ‘battle’ 기반 리더보드를 구축
  • Bradley-Terry 모델(쌍대 비교 → 전역 랭킹)을 기반으로 하되, 세 가지 한계를 보완: 모델이 평가 도중에도 업데이트됨, 니치 세그먼트의 데이터 부족, 작은 점수 차를 실제 순위차로 오인
  • 3가지 통계 혁신: ① 지수적 시간 감쇠 가중치(최근 battle에 가중, 모델 제거 없이 비교 체인 유지) ② 정규화(소량 데이터에서 과신 방지, “증명 전까지 평균”이라는 보수적 가정) ③ 신뢰구간 기반 Ordinal Tiering(통계적으로 구분 불가한 모델은 같은 티어로 묶음)
  • Active Sampling: 불확실성이 큰 매치업을 우선 평가해 랭킹 수렴을 최대 35% 가속, 신규 모델은 자동으로 최우선 평가
  • LinkedIn의 직업 정체성·콘텐츠 안전 인프라로 어드버서리얼 투표/조작 방지

주요 수치 / 사실

  • 동일 모델 체크포인트도 같은 리더보드에서 17점 차로 평가될 수 있음(노이즈)
  • 90일 전 battle은 0.5, 6개월 전은 0.25 가중치
  • 4개 모델 시나리오에서 신규 쌍은 선택 확률 ~91.6%, 정착된 쌍은 ~0.01%
  • 14개 직무 작업 카테고리 + 5단계 복잡도 척도로 프롬프트 분류
  • 출시 시점 role·industry 두 차원 지원, LinkedIn 13억+ 회원 대상 글로벌 확대 예정

관련 위키


Source: 원문 보기