# Alliance measurement calibration comparison > 교육용 합성 장면에 대한 모델 측정 보정 보고서다. 실제 내담자의 임상 결과를 뜻하지 않는다. | 항목 | 기준 버전 | 후보 버전 | 변화 | |---|---:|---:|---:| | 방향 정확도 | 100.0% | 88.9% | -11.1% | | 근거 재현율 | 100.0% | 66.7% | -33.3% | | 근거 정밀도 | 100.0% | 80.0% | -20.0% | | 무점수/실패 | 0 | 1 | +1 | ## 실행 식별자 - 기준: `human_gold/oas-g0-directional-reference` · prompt `not-applicable` · run `oas-g0-human-gold-v1` - 후보: `claude_cli/claude-opus-4-8` · prompt `1.3.0` · run `g1-candidate-prompt-1.3.0-2026-08-07` - 비교 가능 예측: 8개 - 첫 실패 뒤 재시도 회복: 2개 - 평균 절대 점수 이동: 0.07500000000000001 ## 후보 버전 장면별 결과 | 장면 | 관점 | 축 | 기대 | 값 | 상태 | 방향 | 근거 recall | |---|---|---|---|---:|---|---|---:| | oas-g0-001 | independent_observer | goal | low | - | error | 실패 | 0.0% | | oas-g0-002 | independent_observer | task | low | 0.150 | ready | 통과 | 100.0% | | oas-g0-003 | independent_observer | bond | drop | 0.350 | ready | 통과 | 50.0% | | oas-g0-005 | client_agent_report | bond | low | 0.100 | ready | 통과 | 100.0% | | oas-g0-006 | client_agent_report | task | rise | 0.750 | ready | 통과 | 100.0% | | oas-g0-007 | client_agent_report | bond | low | 0.100 | ready | 통과 | 100.0% | | oas-g0-008 | client_agent_report | bond | high | 0.750 | ready | 통과 | 50.0% | | oas-g0-008 | independent_observer | goal | low | 0.250 | ready | 통과 | 100.0% | | oas-g0-008 | independent_observer | task | low | 0.250 | ready | 통과 | 50.0% |