{ "ok": true, "database": "actual dev PostgreSQL via runtime app role", "fixture_cohort": "g6-repo-benchmark-v1", "benchmark_schema_version": "vignette.supervision-research-benchmark.v1", "benchmark_version": "1.0.0", "benchmark_content_sha256": "9b63e9e0647714116e07545fed67f9dec278822878ac742aaa129a0fc7898f64", "first_append": { "idempotent_replay": false, "drift_report_id": "c05c75f6-0fd7-5a60-9140-416d83824516", "status": "drift_flagged", "counts": { "batches": 2, "reports": 1, "subgroup_metrics": 2 } }, "replay": { "idempotent_replay": true, "counts": { "batches": 2, "reports": 1, "subgroup_metrics": 2 }, "duplicate_rows": 0 }, "periodic_cycle_replay": { "cohort_count": 6, "completed": 6, "failed": 0, "version_comparison_failed": 0, "status": "drift_flagged", "idempotent_replay": true }, "hydrated": { "status": "drift_flagged", "baseline_model": "evaluator-v1", "candidate_model": "evaluator-v2", "baseline_prompt_version": "1.0.0", "candidate_prompt_version": "2.0.0", "instrument_id": "rupture-eval", "baseline_instrument_version": "1.0.0", "candidate_instrument_version": "1.1.0", "subgroup_metrics": [ { "subgroup": "synthetic-a", "matched_count": 3, "baseline_accuracy": 1.0, "candidate_accuracy": 1.0, "accuracy_delta": 0.0 }, { "subgroup": "synthetic-b", "matched_count": 3, "baseline_accuracy": 1.0, "candidate_accuracy": 0.3333333333333333, "accuracy_delta": -0.6666666666666667 } ] }, "data_classification": "synthetic_educational", "raw_transcript_included": false, "clinical_claim_allowed": false }