# Alliance measurement calibration comparison > 교육용 합성 장면에 대한 모델 측정 보정 보고서다. 실제 내담자의 임상 결과를 뜻하지 않는다. | 항목 | 기준 버전 | 후보 버전 | 변화 | |---|---:|---:|---:| | 방향 정확도 | 100.0% | 88.9% | -11.1% | | 근거 재현율 | 88.9% | 94.4% | 5.6% | | 근거 정밀도 | 72.7% | 81.0% | 8.2% | | 무점수/실패 | 0 | 0 | +0 | ## 실행 식별자 - 기준: `claude_cli/claude-opus-4-8` · prompt `1.2.0` · run `g1-candidate-prompt-1.2.0-2026-08-06` - 후보: `claude_cli/claude-opus-4-8` · prompt `1.4.0` · run `g1-candidate-prompt-1.4.0-jsonrepair-envloaded-2026-08-07` - 비교 가능 예측: 24개 - 첫 실패 뒤 재시도 회복: 0개 - 평균 절대 점수 이동: 0.07208333333333335 ## 후보 버전 장면별 결과 | 장면 | 관점 | 축 | 기대 | 값 | 상태 | 방향 | 근거 recall | |---|---|---|---|---:|---|---|---:| | oas-g0-001 | independent_observer | goal | low | 0.150 | ready | 통과 | 100.0% | | oas-g0-002 | independent_observer | task | low | 0.150 | ready | 통과 | 100.0% | | oas-g0-003 | independent_observer | bond | drop | 0.450 | ready | 실패 | 50.0% | | oas-g0-005 | client_agent_report | bond | low | 0.100 | ready | 통과 | 100.0% | | oas-g0-006 | client_agent_report | task | rise | 0.800 | ready | 통과 | 100.0% | | oas-g0-007 | client_agent_report | bond | low | 0.050 | ready | 통과 | 100.0% | | oas-g0-008 | client_agent_report | bond | high | 0.750 | ready | 통과 | 100.0% | | oas-g0-008 | independent_observer | goal | low | 0.250 | ready | 통과 | 100.0% | | oas-g0-008 | independent_observer | task | low | 0.250 | ready | 통과 | 100.0% |