# Alliance measurement calibration comparison > 교육용 합성 장면에 대한 모델 측정 보정 보고서다. 실제 내담자의 임상 결과를 뜻하지 않는다. | 항목 | 기준 버전 | 후보 버전 | 변화 | |---|---:|---:|---:| | 방향 정확도 | 100.0% | 100.0% | 0.0% | | 근거 재현율 | 100.0% | 88.9% | -11.1% | | 근거 정밀도 | 100.0% | 72.7% | -27.3% | | 무점수/실패 | 0 | 0 | +0 | ## 실행 식별자 - 기준: `human_gold/oas-g0-directional-reference` · prompt `not-applicable` · run `oas-g0-human-gold-v1` - 후보: `claude_cli/claude-opus-4-8` · prompt `1.2.0` · run `g1-candidate-prompt-1.2.0-2026-08-06` - 비교 가능 예측: 9개 - 첫 실패 뒤 재시도 회복: 2개 - 평균 절대 점수 이동: 0.08333333333333334 ## 후보 버전 장면별 결과 | 장면 | 관점 | 축 | 기대 | 값 | 상태 | 방향 | 근거 recall | |---|---|---|---|---:|---|---|---:| | oas-g0-001 | independent_observer | goal | low | 0.150 | ready | 통과 | 100.0% | | oas-g0-002 | independent_observer | task | low | 0.100 | ready | 통과 | 100.0% | | oas-g0-003 | independent_observer | bond | drop | 0.300 | ready | 통과 | 50.0% | | oas-g0-005 | client_agent_report | bond | low | 0.100 | ready | 통과 | 100.0% | | oas-g0-006 | client_agent_report | task | rise | 0.800 | ready | 통과 | 100.0% | | oas-g0-007 | client_agent_report | bond | low | 0.100 | ready | 통과 | 100.0% | | oas-g0-008 | client_agent_report | bond | high | 0.700 | ready | 통과 | 100.0% | | oas-g0-008 | independent_observer | goal | low | 0.200 | ready | 통과 | 100.0% | | oas-g0-008 | independent_observer | task | low | 0.400 | ready | 통과 | 50.0% |