모든 모델은 실 데이터 백테스트로 채점되고, 재현키로 추적되고, 버전으로 비교됩니다. 이 관문을 통과하지 못한 예측은 제품이 되지 않습니다.
미래 정보를 과거로 새지 않게 walk-forward 로 각 시점을 채점하고, 예측 확률이 실제 빈도와 맞는지 신뢰도 다이어그램으로 확인합니다. 아래는 방법 시연이고, 실제 트랙레코드 수치는 다음 섹션 카드에 있습니다.
게이트가 실제로 미달 런을 거릅니다. 통과(baseline 유의 우세)와 개선 미달을 그대로 드러냅니다.
같은 지표를 공유하는 두 런을 고르세요(예: 프랜차이즈 생존 v1 vs v2). brier↓·auc↑는 개선, 스킬 계열 우선.
점추정을 넘어 분포·유의성까지 채점하고, 누출 차단·재현키·드리프트 감시로 결과를 지킵니다.
위험과 비위험을 얼마나 잘 가르는 판별력입니다. 0.5는 찍기, 1이 완벽입니다.
Diebold–Mariano 검정으로 본 유의성입니다. naive보다 유의하게 나은지(p<0.05)를 봅니다.
naive 대비 오차가 얼마나 줄었는지 봅니다. 0보다 크면 베이스라인을 이긴 것입니다.
기저율 상시예측 대비 확률 채점이 얼마나 나아졌는지 봅니다. 랭킹 가치는 lift로 따로 봅니다.
예측구간이 진값을 담는 비율입니다. 분포를 가정하지 않는 conformal로 보장합니다.
점추정을 넘어 예측분포 전체를 채점합니다.
설정(도메인·문제·모델·하이퍼)의 결정적 해시가 config_hash입니다. 같은 설정이면 같은 런을 캐시로 돌려줘 중복을 막고 비교를 안정시킵니다.
두 런의 지표 delta를 방향까지 읽습니다(개선 초록↑·퇴행 빨강↓). brier는 낮을수록, auc는 높을수록 개선이며, 스킬 계열을 우선해 판정합니다.
입력 분포가 학습 시점에서 이동하면 PSI·KS로 감지해, 조용히 진행되는 성능 저하를 잡아냅니다.
walk-forward 스플릿으로 미래 정보가 과거로 새지 않게 합니다. 학습·검증 시점을 엄격히 분리합니다.
백테스트 정본 service/platform/backtest · 버전 비교 도구 열기 ›