chore: 빅뱅 Phase 5 Part 6 wrap-up — Voice Conversation 몰입 UX + U1/U3/U4/U7 전체 정리 + 다음 세션 프롬프트
이번 세션(Part 6) 산출물: -412a2e7: Voice Conversation 몰입 UX + 사운드 4개 + Bug 13 빈 STT (U6 + U8) -dd591d0: AudioCaptureService Mac 분기 system_profiler (U7) -dc7f933: CloudSync Realtime 재구독 백오프 + Refresh token 재인증 알림 (U1 + U3 + U4) 빅뱅 성공 기준 중 Phase 3.2 PREMIUM_LLM 하나만 남음. 선행 조건은 supabase secrets set으로 ANTHROPIC/OPENAI 키 주입 (사용자 소유, 주입 후 다음 세션에서 완결). handoff-latest.md에 다음 세션 시작 프롬프트 A/B/C 분기 포함.
This commit is contained in:
parent
dc7f93349e
commit
16aaf37956
2 changed files with 419 additions and 221 deletions
275
memory/handoff-archive/2026-04-11-2240-phase5-part5.md
Normal file
275
memory/handoff-archive/2026-04-11-2240-phase5-part5.md
Normal file
|
|
@ -0,0 +1,275 @@
|
|||
# Session Handoff — 2026-04-11 22:40 (빅뱅 Phase 5 Part 5 — /simplify + Voice Conversation 파이프라인 복구 + UX 설계)
|
||||
|
||||
> From: macOS (yunchan-ui-MacBookPro)
|
||||
> Last commit (pre-handoff): `3b77be0` — refactor(desktop): IME composition 가드 helper 추출 + 8곳 Enter 핸들러 통합 (빅뱅 Phase 5 Part 5)
|
||||
> Working tree: 커밋 예정 파일 2개 (`TTSPlaybackService.ts`, `VoiceConversationService.ts`) + memory 갱신 2개
|
||||
> Branch: `main`
|
||||
> Remote: `https://gitlab.twentyoz.kr:8443/d3r0/voice.git`
|
||||
|
||||
## ✅ 이번 세션 요약 — 빅뱅 Phase 5 Part 5 (2회분: simplify + voice conversation recovery)
|
||||
|
||||
### Part 5-A: /simplify 패스 (커밋 완료 `3b77be0`)
|
||||
- `apps/desktop/src/renderer/utils/keyboard.ts` 신규 — `isImeComposingEvent(e)` helper (JSDoc에 Bug 10 원리 + 사용 패턴)
|
||||
- IME Enter 가드 8곳 통합: MeetingModePage(기존 인라인 교체) + KnowledgeBasePage + VoiceConversationPage + CommandsPage + MeetingChatPanel + EditableSegment + MeetingDetailTabs(인라인→블록) + HistoryEntryCard
|
||||
- Phase 3.3 `CloudSyncService.pushOne` 훅 8곳 품질 리뷰: 이미 fire-and-forget 일관, 리팩터 불필요 판정
|
||||
- U5(IME 잠재 버그 7곳) 해소. 사용자 실측 OK (VoiceConversationPage 채팅 + MeetingDetailTabs 타이틀 한글 Enter 1회만)
|
||||
|
||||
### Part 5-B: Voice Conversation 파이프라인 복구 (커밋 대기)
|
||||
**사용자 보고**: "음성 버튼 누르고 대답 없어" — 3개 독립 버그가 중첩돼 Mac에서 한 번도 작동한 적 없음.
|
||||
|
||||
**Bug 10.5 — TTS Mac 플랫폼 분기 (`TTSPlaybackService.ts`)**
|
||||
- `spawn('powershell', ...)` 하드코딩으로 Mac에서 `ENOENT`. 주석부터 "Windows SAPI". V2-5 플랫폼 감사 누락.
|
||||
- Fix: `_speakOne` dispatcher + `_speakOneMac`(`say -r 180×speed`) + `_speakOneWindows`(기존) + `_bindProcessHandlers` 공통 + `_getMacRate`/`_getWindowsRate` 분리.
|
||||
- 검증: `/usr/bin/say -r 180 "TTS 분기 테스트 성공"` 직접 호출 → 사용자 "오 들린다!"
|
||||
|
||||
**Bug 11 — `finishListening` 오디오 스냅샷 순서 (`VoiceConversationService.ts:193`, 진짜 root cause)**
|
||||
- 진단 로그 추가 후 발견. `finishListening called: bufferCount=311, totalBytes=597120` → 1ms 뒤 `audio too short: 0 bytes`.
|
||||
- `_stopListening()` 내부에 `this._audioBuffers = []` 리셋이 있음. `finishListening`이 그 **이후**에 Buffer.concat해서 항상 빈 배열. 19초 오디오 매번 증발.
|
||||
- Fix: `_stopListening` **전**에 `const audioBuffer = Buffer.concat(this._audioBuffers)` 스냅샷. Windows에서도 동일 버그였을 가능성 매우 높음.
|
||||
|
||||
**Bug 12 — Whisper 모델 사전 로드 누락 (`VoiceConversationService.ts:84`)**
|
||||
- Bug 11 fix 후 STT 진입은 했지만 "모델 로딩 중, 오디오 버퍼에 적재" 에서 영원히 pending. thinking 상태 고정.
|
||||
- 원인: MeetingMode/Caption은 startRecording 시 `initialize()` 호출. VoiceConversation은 누락. 첫 transcribe가 내부 pending 큐에 쌓이지만 아무도 로드 트리거 안 함.
|
||||
- Fix: `startSession`에서 `void getLocalSTTService().initialize().catch(...)` fire-and-forget. idempotent.
|
||||
|
||||
**최종 실증**: 사용자 Mic 클릭 → 말함 → ⏹ Stop → 전사 → LLM 스트리밍 → TTS 소리(Mac say) → 자동 listening 복귀 연속 대화까지 end-to-end 통과.
|
||||
|
||||
### Part 5-C: Voice Conversation UX 개선 설계 (구현 미완)
|
||||
사용자 인터뷰(AskUserQuestion + ASCII preview)로 확정. 구현은 다음 세션으로 이월.
|
||||
|
||||
**State → UI 매트릭스**
|
||||
| state | 메시지 영역 | 텍스트 입력 | 녹음버튼 | 사운드 |
|
||||
|---|---|---|---|---|
|
||||
| idle | 메시지 리스트 | 활성 | 🎤 Mic | - |
|
||||
| listening | **몰입 패널** (9바 phosphor waveform + REC LED + 0:04 타이머 + "SPEAK NOW · PRESS ⏹ TO SEND") | 숨김 | ⏹ Stop | start + audio-level |
|
||||
| thinking | 메시지 리스트 + typing indicator 버블 | disabled "응답 대기 중…" | ❌ Cancel | stop |
|
||||
| speaking | 메시지 리스트 + 스트리밍 ▌ | disabled | ❌ Cancel | chime (recording-stop 재사용) |
|
||||
| error | 메시지 + 배너 | - | - | error |
|
||||
|
||||
**사용자 선택 결정 사항**
|
||||
- 녹음 중: **풀 몰입 계측기 모드** (listening에서만, thinking/speaking은 메시지 리스트로 복귀 → 대화 맥락 유지)
|
||||
- 연속 대화: 응답 후 자동 listening 재진입 (기존 코드 동작)
|
||||
- 사운드 4개 전부 (start/stop/chime/error)
|
||||
- chime 소싱: 기존 `recording-stop.wav` 재사용 (cancel=error 패턴과 동일)
|
||||
|
||||
**구현 작업 리스트**
|
||||
| # | 파일 | 변경 |
|
||||
|---|---|---|
|
||||
| 1 | `packages/core/src/ipc-channels.ts` | `VOICE_CONVERSATION.AUDIO_LEVEL` 신규 채널 |
|
||||
| 2 | `main/services/VoiceConversationService.ts` | 사운드 훅 4개 트리거 + `_onAudioLevel` listening 중 렌더러 forwarding |
|
||||
| 3 | `main/services/SoundEffectService.ts` | `SoundName`에 `'chime'` 추가, 매핑은 `recording-stop.wav` |
|
||||
| 4 | `main/ipc/voice-conversation-handlers.ts` 또는 Service | AudioCaptureService의 'audio-level' forwarding |
|
||||
| 5 | `preload/index.ts` | `voiceConversation.onAudioLevel(cb)` 구독 API |
|
||||
| 6 | **신규** `renderer/components/voice-conversation/VoiceRecordingPanel.tsx` | 9바 waveform 컴포넌트 (BAR_COUNT=9, cos 분포, SMOOTHING=0.5, RANDOM_FACTOR=0.35, 100ms, MIN_HEIGHT=2, MAX_HEIGHT=28 — 기존 `recording-tip/script.js` 수치 그대로 포팅) + REC LED + 타이머 + 힌트 |
|
||||
| 7 | `renderer/pages/VoiceConversationPage.tsx` | state 분기 레이아웃: listening일 때 VoiceRecordingPanel, 그 외 메시지 리스트. TextField disabled/숨김. typing indicator 버블 추가 |
|
||||
| 8 | `packages/i18n/locales/{ko,en,...}.json` | `conversation.recording.hint`, `conversation.thinking.placeholder`, `conversation.state.recording` 등 (11개 locale) |
|
||||
|
||||
**참고 — 기존 9바 waveform 로직 위치**
|
||||
- `apps/desktop/src/renderer/popups/recording-tip/script.js` (Vanilla JS, CLAUDE.md 규칙 9로 그대로 유지)
|
||||
- `docs/design/03-db-and-ui.md:428+` 에 파라미터 스펙
|
||||
- React 포팅 시 위 수치들을 컴포넌트 상수로 그대로 가져오고, `useEffect` 100ms interval + `useRef`로 currentHeights 배열 유지
|
||||
|
||||
### ASCII 와이어프레임 (참조용)
|
||||
|
||||
**listening (몰입 패널)** ⭐
|
||||
```
|
||||
╔══════════════════════════════════════════════════════╗
|
||||
║ VOICE CONVERSATION ◉ RECORDING [🗑] ║
|
||||
╠══════════════════════════════════════════════════════╣
|
||||
║ ║
|
||||
║ ◉ ● ● REC 0:04 ║
|
||||
║ ║
|
||||
║ ║ █ █ █ ║ ║
|
||||
║ ║ █ █ █ █ █ █ █ █ ║ ║
|
||||
║ ║ █ █ █ █ █ █ █ █ ║ ║
|
||||
║ ║ █ █ █ █ █ █ █ █ ║ ║
|
||||
║ 1 2 3 4 5 6 7 8 9 ║
|
||||
║ ║
|
||||
║ ─ SPEAK NOW · PRESS ⏹ TO SEND ─ ║
|
||||
║ ║
|
||||
╠══════════════════════════════════════════════════════╣
|
||||
║ [⏹] [END] ║
|
||||
╚══════════════════════════════════════════════════════╝
|
||||
```
|
||||
|
||||
**thinking / speaking (메시지 리스트 복귀)**
|
||||
```
|
||||
╔══════════════════════════════════════════════════════╗
|
||||
║ VOICE CONVERSATION ● THINKING(또는SPEAKING) ║
|
||||
╠══════════════════════════════════════════════════════╣
|
||||
║ [ 이전 assistant 응답 ] ║
|
||||
║ [ 안녕하세요 ] ║
|
||||
║ [ ● ● ● 생각 중… 또는 반갑습니다 ▌ ] ║
|
||||
╠══════════════════════════════════════════════════════╣
|
||||
║ [❌] [응답 대기 중….............. disabled ] [END] ║
|
||||
╚══════════════════════════════════════════════════════╝
|
||||
```
|
||||
|
||||
## 🚧 미해결 이슈
|
||||
|
||||
### U1 — Realtime TIMED_OUT (이전 세션부터 유지)
|
||||
블로커 아님. Phase 3.3 auto push가 대체 경로로 잘 동작.
|
||||
|
||||
### U3 — Refresh token 간헐적 소진
|
||||
Phase 5 Part 3 이월. 재현 안 됨.
|
||||
|
||||
### U4 — `package-lock.json` optional dep 정리
|
||||
Phase 5 Part 2 이월. 런타임 영향 없음.
|
||||
|
||||
### U6 — Voice Conversation UX 몰입 패널 구현 (신규, 이번 세션 설계만 완료)
|
||||
위 Part 5-C 설계 대로 다음 세션에서 구현. 예상 커밋 1~2개.
|
||||
|
||||
### U8 — Bug 13: 빈 STT 결과 피드백 부재 (신규, 세션 끝무렵 발견)
|
||||
사용자 재시연에서 "⏹ 눌러도 반응 없음" 증상. 로그 추적 결과 VAD가 전체 오디오를 무음 판정 → 빈 텍스트 → 조용히 listening 복귀. 사용자 관점에선 버튼 먹통. 원인 2개 조합:
|
||||
1. Mac 마이크 입력 볼륨/clipping 문제로 VAD가 무음 판정
|
||||
2. `finishListening`이 빈 STT 결과를 조용히 삼키고 `_startListening()`로 복귀 — 피드백 없음
|
||||
|
||||
Fix: `_emitError('stt', 'No speech detected. Check microphone.')` 또는 몰입 패널 내 힌트 텍스트. 다음 세션 U6 몰입 패널 구현과 함께 처리 권장.
|
||||
|
||||
### U7 — `AudioCaptureService.getDevices()` Mac fallback (신규, 우선순위 낮음)
|
||||
`powershell -NoProfile` 하드코딩으로 Mac에서 경고 로그 + 1개 device fallback. 런타임 지장 없음. `process.platform` 분기 필요.
|
||||
|
||||
## 🎯 다음 세션 시작 프롬프트
|
||||
|
||||
```
|
||||
D3RO-VOICE 빅뱅 Phase 5 Part 6 — Voice Conversation UX 몰입 패널 구현.
|
||||
|
||||
지난 세션(Part 5)에서 /simplify(IME 가드 8곳 helper 추출) + Voice Conversation 파이프라인
|
||||
3개 버그 복구(Bug 10.5 TTS Mac 분기 + Bug 11 finishListening 스냅샷 순서 + Bug 12 Whisper
|
||||
사전 로드)를 끝내고 기본 end-to-end는 동작. 사용자 피드백으로 UX 개선 설계까지 완료.
|
||||
|
||||
## 시작 전 반드시
|
||||
1. /session-handoff resume
|
||||
2. memory/handoff-latest.md (Part 5 전체, 특히 Part 5-C 구현 작업 리스트와 와이어프레임)
|
||||
3. memory/project_status.md SaaS [13] 섹션
|
||||
4. CLAUDE.md 강제 규칙 13개
|
||||
5. docs/design/03-db-and-ui.md:428+ (기존 recording-tip waveform 스펙)
|
||||
6. **auto memory**: `~/.claude/projects/-Users-yunchan-Documents-workspace-voice/memory/feedback_dev_autostart.md` — dev 자동 기동 규칙
|
||||
|
||||
## 첫 액션 (0번) — dev 서버/앱/웹 기동 ⭐ (사용자 고정 요구사항)
|
||||
|
||||
구현 들어가기 **전에** desktop Electron + web Next.js dev를 먼저 nohup으로 기동해서 사용자가 즉시 실측 가능한 상태로. auto memory `feedback_dev_autostart.md` 참조.
|
||||
|
||||
```bash
|
||||
# 1. 이미 살아있는지 확인
|
||||
pgrep -lf "Electron\.app|electron-vite|next dev" | head -3
|
||||
lsof -i :5173 -sTCP:LISTEN
|
||||
lsof -i :3000 -sTCP:LISTEN
|
||||
|
||||
# 2. 죽어있으면 nohup으로 기동 (반드시 nohup + disown, run_in_background 금지)
|
||||
nohup npm run dev > /tmp/d3ro-desktop.log 2>&1 & disown
|
||||
nohup npm --workspace=@d3ro/web run dev > /tmp/d3ro-web.log 2>&1 & disown
|
||||
|
||||
# 3. 기동 확인
|
||||
sleep 4
|
||||
lsof -i :5173 -sTCP:LISTEN
|
||||
lsof -i :3000 -sTCP:LISTEN
|
||||
```
|
||||
|
||||
## 첫 액션 (1번) — Voice Conversation 몰입 패널 구현
|
||||
|
||||
memory/handoff-latest.md의 "Part 5-C 구현 작업 리스트" 표를 그대로 따라:
|
||||
|
||||
1. **IPC 레이어 먼저** (1~5번 작업)
|
||||
- packages/core/src/ipc-channels.ts에 VOICE_CONVERSATION.AUDIO_LEVEL 추가
|
||||
- VoiceConversationService에서 AudioCaptureService 'audio-level' 구독해서 listening 상태일 때만
|
||||
this._sendToRenderer(VOICE_CONVERSATION.AUDIO_LEVEL, { level }) forwarding
|
||||
- SoundEffectService SoundName에 'chime' 추가 + SOUND_FILES['chime'] = 'recording-stop.wav'
|
||||
- preload에 voiceConversation.onAudioLevel 구독 API
|
||||
- VoiceConversationService startSession/finishListening/_processUserMessage TTS finished/에러 시점에
|
||||
getSoundEffectService().play(...) 훅 4개 삽입
|
||||
|
||||
2. **VoiceRecordingPanel 컴포넌트** (6번)
|
||||
- apps/desktop/src/renderer/components/voice-conversation/VoiceRecordingPanel.tsx 신규
|
||||
- 기존 apps/desktop/src/renderer/popups/recording-tip/script.js의 수치 그대로 포팅:
|
||||
BAR_COUNT=9, UPDATE_INTERVAL=100, MIN_HEIGHT=2, MAX_HEIGHT=28, SMOOTHING=0.5, RANDOM_FACTOR=0.35
|
||||
weights = cos((i - (BAR_COUNT-1)/2) / ((BAR_COUNT-1)/2) * PI/2)
|
||||
- useState currentHeights[9], useRef audioLevelRef
|
||||
- useEffect로 100ms setInterval, 매 tick마다 audioLevel * weights[i] + jitter * SMOOTHING
|
||||
- onAudioLevel 구독해서 audioLevelRef 업데이트
|
||||
- 렌더: d3roPalette.accent.phosphor(있으면) 또는 amber CSS var, PhosphorText 활용
|
||||
- REC LED (Led component, color='red', pulse), PhosphorText 타이머, "SPEAK NOW..." 힌트(t())
|
||||
- props: durationMs?: number (부모에서 관리 vs 내부 자체)
|
||||
|
||||
3. **VoiceConversationPage 레이아웃 분기** (7번)
|
||||
- 메시지 영역을 state.listening ? <VoiceRecordingPanel /> : <messages list + typing indicator>
|
||||
- TextField: state === 'idle' ? 활성 : state === 'listening' ? sx={{display:'none'}} : disabled
|
||||
- thinking/speaking에서 typing indicator 버블(.●●● 생각중 또는 ▌ streaming)
|
||||
- 기존 streaming 로직은 유지 (이미 speaking에서 잘 동작)
|
||||
|
||||
4. **i18n 키** (8번)
|
||||
- conversation.recording.hint — "말씀하세요 · ⏹로 전송" / "SPEAK NOW · PRESS ⏹ TO SEND"
|
||||
- conversation.thinking.placeholder — "응답 대기 중…" / "Waiting for response…"
|
||||
- conversation.state.recording — "RECORDING"
|
||||
- 11개 locale(ko/en/ja/zh/es/fr/de/it/pt/ru/vi) 최소 ko/en 필수, 나머지는 en fallback 허용
|
||||
|
||||
5. **typecheck + 시연**
|
||||
- desktop tsc --noEmit 통과
|
||||
- 사용자에게 "이제 몰입 패널 보이고 녹음 시작/종료 사운드 들리고 응답 완료 chime까지" 시연 요청
|
||||
|
||||
## 강제 규칙 (CLAUDE.md 13개)
|
||||
- any 금지, console.log 금지
|
||||
- 테마 SSOT: d3roPalette/d3roShadow, hex 하드코딩 금지 (theme.ts 제외)
|
||||
- i18n t() 사용
|
||||
- 커밋 단위는 작업별. push 여부는 사용자 컨펌
|
||||
- 작업 완료 즉시 memory/project_status.md 갱신 (규칙 13)
|
||||
|
||||
## 둘째 액션 (선택) — Phase 3.2 PREMIUM_LLM
|
||||
⚠️ 선행: ANTHROPIC_API_KEY / OPENAI_API_KEY supabase secrets set 필요. 빅뱅 성공 기준 8번 중 마지막 1개.
|
||||
|
||||
## 셋째 액션 (선택) — U1/U7 정리
|
||||
U1 Realtime TIMED_OUT 조사 또는 U7 AudioCaptureService.getDevices() Mac 분기.
|
||||
|
||||
자, 첫 액션부터 시작해.
|
||||
```
|
||||
|
||||
## 🔑 환경 체크 (resume 시 순서대로)
|
||||
|
||||
```bash
|
||||
# 1. git 상태
|
||||
git status
|
||||
git log --oneline -5 # 최신: handoff commit → voice conv fix → 3b77be0 IME guard
|
||||
|
||||
# 2. dev 상태 확인 (Part 5 세션에서 nohup으로 기동했음)
|
||||
pgrep -lf "Electron\.app|electron-vite|next dev" | head -3
|
||||
lsof -i :5173 -sTCP:LISTEN
|
||||
lsof -i :3000 -sTCP:LISTEN
|
||||
|
||||
# 살아있으면 재기동 불필요. 죽었으면:
|
||||
nohup npm run dev > /tmp/d3ro-desktop.log 2>&1 & disown
|
||||
# (next dev는 별도 필요시 workspace=@d3ro/web)
|
||||
|
||||
# 3. 검증
|
||||
cd apps/desktop && npx tsc --noEmit
|
||||
```
|
||||
|
||||
## ⚠️ 환경 / 주의사항
|
||||
|
||||
- **dev 기동은 반드시 nohup + disown** (run_in_background: true는 shell lifecycle 이슈로 Vite가 조기 종료됨)
|
||||
- **Electron main 변경은 HMR 안 먹음** — main/services 변경 후에는 Electron 프로세스 kill + nohup 재기동 필요 (electron-vite가 자동 restart하는 경우도 있지만 확실하지 않음)
|
||||
- **Voice Conversation 동작 확인 사용법**: Mic 아이콘 **클릭 후 떼기**(hold 아님) → 말함 → ⏹ 사각형 **클릭** → 전사 → 응답 소리. 사용자가 push-to-talk로 오해한 적 있으니 UX 개선 시 힌트 텍스트 필수.
|
||||
- **Realtime TIMED_OUT**: U1, Part 3부터 블로커 아님.
|
||||
- **SoX Mac stderr 경고 `coreaudio input clipped`**: 마이크 입력 볼륨이 너무 큰 경우 발생. 동작엔 지장 없음.
|
||||
|
||||
## 📦 의존성 / 도구
|
||||
- Node 22.22.2 / Python 3.13 / Supabase CLI 2.84.2 / Ollama qwen3:4b / Electron 33.4.11 / Next.js 15.5.14
|
||||
- macOS `/usr/bin/say`, `/usr/bin/afplay`, `sox 14.4.2`
|
||||
|
||||
## 🧪 마지막 검증 상태
|
||||
|
||||
| 게이트 | 결과 |
|
||||
|---|---|
|
||||
| desktop `tsc --noEmit` | ✅ EXIT=0 |
|
||||
| Voice Conversation Mic → Stop → 전사 → LLM → TTS | ✅ Mac 첫 성공 |
|
||||
| Mac `/usr/bin/say` 직접 호출 | ✅ 사용자 증언 |
|
||||
| IME 가드 8곳 | ✅ 사용자 실측 (2곳 대표) |
|
||||
| Realtime SUBSCRIBED | ❌ TIMED_OUT (U1) |
|
||||
| git push origin main | ⏸️ (Part 5-B/handoff 커밋 후 push 대기) |
|
||||
|
||||
## 🔗 참고 문서
|
||||
|
||||
- `memory/project_status.md` — SaaS [1]~[13] 전체 이력
|
||||
- `memory/handoff-archive/2026-04-11-2200-phase5-part5a-simplify.md` — 직전 스냅샷 (simplify만)
|
||||
- `docs/design/03-db-and-ui.md:428+` — 기존 RecordingTip waveform 스펙 (VoiceRecordingPanel 포팅 참고)
|
||||
- `apps/desktop/src/renderer/popups/recording-tip/script.js` — 기존 9바 waveform Vanilla JS 구현 (포팅 원본)
|
||||
- Supabase 대시보드: https://supabase.com/dashboard/project/llnocwyqvhgwpdjcqqyw
|
||||
Loading…
Add table
Add a link
Reference in a new issue