G0~G8 성과·동맹 측정 OS 작업 일괄 고정
8월 7일까지 워킹트리에만 남아 있던 미커밋 작업을 커밋한다. 여러 사본 폴더(worktree·clone)에 흩어져 있던 중간 스냅샷을 정리하기 전에 원본을 git 이력으로 고정하는 것이 목적이다. - contracts/routes/services: measurement, outcome_trajectory, rupture_repair, deliberate_practice, calibration_transfer, supervision_research, multimodal_alliance, continuous_improvement 계열 신규 모듈과 테스트 - infra/db/init: 07~16 마이그레이션(측정 기반~calibration transfer 실행) - apps/web: 세션 리뷰 카드·관리 화면·E2E 스펙 추가 - docs/ops: G0~G8 라이브 통합·배포·롤백 증거 문서와 evidence JSON/PNG - scripts: smoke·ledger·릴리스 에이전트·NAS 프리뷰 운영 스크립트 engine.public 로그 .bak과 apps/web/test-results 산출물은 커밋에서 제외했다.
This commit is contained in:
parent
93dd8f82d7
commit
16e791e044
390 changed files with 243188 additions and 499 deletions
181
scripts/test_smoke_calibration_transfer_api.py
Normal file
181
scripts/test_smoke_calibration_transfer_api.py
Normal file
|
|
@ -0,0 +1,181 @@
|
|||
from __future__ import annotations
|
||||
|
||||
import importlib.util
|
||||
import sys
|
||||
import unittest
|
||||
from pathlib import Path
|
||||
from unittest.mock import patch
|
||||
|
||||
|
||||
SCRIPT_PATH = Path(__file__).with_name("smoke-calibration-transfer-api.py")
|
||||
SPEC = importlib.util.spec_from_file_location(
|
||||
"smoke_calibration_transfer_api", SCRIPT_PATH
|
||||
)
|
||||
assert SPEC is not None and SPEC.loader is not None
|
||||
MODULE = importlib.util.module_from_spec(SPEC)
|
||||
sys.modules[SPEC.name] = MODULE
|
||||
SPEC.loader.exec_module(MODULE)
|
||||
|
||||
|
||||
class FakeClient:
|
||||
def __init__(self, bodies: list[object]) -> None:
|
||||
self.bodies = list(bodies)
|
||||
self.paths: list[str] = []
|
||||
|
||||
def request(self, method: str, path: str, *args: object, **kwargs: object):
|
||||
self.paths.append(f"{method} {path}")
|
||||
if not self.bodies:
|
||||
raise AssertionError("unexpected request")
|
||||
return MODULE.ApiResponse(200, self.bodies.pop(0))
|
||||
|
||||
|
||||
class CalibrationTransferSmokeUnitTest(unittest.TestCase):
|
||||
def test_selects_distinct_source_and_practice_personas(self) -> None:
|
||||
client = FakeClient(
|
||||
[
|
||||
[
|
||||
{"code": "P2", "source": "database", "degraded": False},
|
||||
{"code": "P1", "source": "database", "degraded": False},
|
||||
{"code": "P3", "source": "fallback", "degraded": False},
|
||||
]
|
||||
]
|
||||
)
|
||||
|
||||
self.assertEqual(MODULE._choose_distinct_personas(client), ("P1", "P2"))
|
||||
|
||||
def test_session_end_poll_is_bounded_and_fetches_ready_review(self) -> None:
|
||||
client = FakeClient(
|
||||
[
|
||||
{"review_ready": False},
|
||||
{"review_ready": True},
|
||||
{"reviewReady": True, "turns": []},
|
||||
]
|
||||
)
|
||||
clock = iter([0.0, 0.0, 0.25])
|
||||
|
||||
with (
|
||||
patch.object(MODULE.time, "monotonic", side_effect=lambda: next(clock)),
|
||||
patch.object(MODULE.time, "sleep") as sleep,
|
||||
):
|
||||
result = MODULE._wait_for_session_review(
|
||||
client, "session-1", timeout=1.0, interval=0.25
|
||||
)
|
||||
|
||||
self.assertEqual(result["poll_count"], 2)
|
||||
self.assertEqual(
|
||||
client.paths,
|
||||
[
|
||||
"GET /sessions/session-1",
|
||||
"GET /sessions/session-1",
|
||||
"GET /sessions/session-1/review",
|
||||
],
|
||||
)
|
||||
sleep.assert_called_once_with(0.25)
|
||||
|
||||
def test_actual_execution_request_contains_server_identifiers_only(self) -> None:
|
||||
payload = MODULE._actual_execution_request(
|
||||
original_transfer_trial_record_id="trial-1",
|
||||
practice_session_id="session-2",
|
||||
)
|
||||
|
||||
self.assertEqual(
|
||||
payload,
|
||||
{
|
||||
"original_transfer_trial_record_id": "trial-1",
|
||||
"practice_session_id": "session-2",
|
||||
},
|
||||
)
|
||||
|
||||
def test_minimal_suite_uses_novel_phrase_and_durable_uuid_refs(self) -> None:
|
||||
suite = MODULE._build_transfer_suite(
|
||||
fixture_suffix="abc123", evidence_turn_ids=["turn-1", "turn-2"]
|
||||
)
|
||||
trial = suite["trials"][0]
|
||||
|
||||
self.assertEqual(trial["competency_id"], "competency.empathic_attunement")
|
||||
self.assertEqual(trial["evidence_refs"], ["turn-1", "turn-2"])
|
||||
self.assertNotIn(
|
||||
trial["variation"]["phrase_family_id"],
|
||||
suite["training_phrase_family_ids"],
|
||||
)
|
||||
|
||||
def test_actual_read_proof_requires_durable_model_evidence_and_separation(
|
||||
self,
|
||||
) -> None:
|
||||
proof = MODULE._actual_execution_read_proof(
|
||||
{
|
||||
"actual_executions": [
|
||||
{
|
||||
"execution_event_id": "event-1",
|
||||
"original_transfer_trial_record_id": "trial-1",
|
||||
"practice_session_id": "session-2",
|
||||
"evidence_turn_ids": ["turn-1", "turn-2"],
|
||||
"normalized_evaluator_labels": {
|
||||
"technique_codes": ["reflection"],
|
||||
"client_state_codes": ["affect_contact"],
|
||||
"appropriateness": ["pos"],
|
||||
"intent_deviation_dimensions": [],
|
||||
"evaluator_error_count": 0,
|
||||
},
|
||||
"model_run_id": "model-1",
|
||||
"source_kind": "model_inferred",
|
||||
"perspective": "independent_observer",
|
||||
"instrument_id": "unseen-transfer-g5",
|
||||
"instrument_version": "1.0.0",
|
||||
"observer_version": "calibration-actual-transfer-observer-v1",
|
||||
}
|
||||
],
|
||||
"actual_transfer_assessments": [
|
||||
{
|
||||
"evidence_source": "actual_practice_execution",
|
||||
"actual_transfer_status": "insufficient_evidence",
|
||||
"source_execution_event_ids": ["event-1"],
|
||||
}
|
||||
],
|
||||
},
|
||||
execution_event_id="event-1",
|
||||
original_transfer_trial_record_id="trial-1",
|
||||
practice_session_id="session-2",
|
||||
durable_turn_ids=["turn-1", "turn-2"],
|
||||
)
|
||||
|
||||
self.assertEqual(proof["model_run_id"], "model-1")
|
||||
self.assertEqual(proof["source_kind"], "model_inferred")
|
||||
self.assertEqual(proof["perspective"], "independent_observer")
|
||||
self.assertEqual(proof["instrument_id"], "unseen-transfer-g5")
|
||||
self.assertEqual(proof["instrument_version"], "1.0.0")
|
||||
self.assertEqual(
|
||||
proof["observer_version"], "calibration-actual-transfer-observer-v1"
|
||||
)
|
||||
self.assertEqual(
|
||||
proof["evidence_source"], "actual_practice_execution"
|
||||
)
|
||||
|
||||
def test_actual_read_proof_rejects_raw_text_keys(self) -> None:
|
||||
with self.assertRaisesRegex(MODULE.SmokeError, "raw-text"):
|
||||
MODULE._assert_no_raw_transcript(
|
||||
{"normalized_evaluator_labels": {"raw_transcript": "secret"}}
|
||||
)
|
||||
|
||||
def test_smoke_covers_actual_rejections_without_media_or_voice(self) -> None:
|
||||
source = SCRIPT_PATH.read_text(encoding="utf-8").lower()
|
||||
for required in (
|
||||
"/internal/sessions/{session_id}/calibration/transfer-suites",
|
||||
"/calibration/transfer-executions",
|
||||
"same_source_session_rejected",
|
||||
"unended_practice_session_rejected",
|
||||
"other_learner_actual_execution_rejected",
|
||||
"same_actual_execution_retry_stable",
|
||||
):
|
||||
self.assertIn(required, source)
|
||||
for forbidden in (
|
||||
"/voice",
|
||||
"getusermedia",
|
||||
"enumeratedevices",
|
||||
"mediadevices",
|
||||
):
|
||||
self.assertNotIn(forbidden, source)
|
||||
|
||||
|
||||
if __name__ == "__main__":
|
||||
unittest.main()
|
||||
Loading…
Add table
Add a link
Reference in a new issue