d3ro-voice/docs/phases/phase-12-pro-features.md
Yun Chan a31f96bbb8 Phase 10~11 전체 구현: 킬러 피처 5종 + 수익화 시스템
Phase 10 킬러 피처:
- MemoService: 태그 CRUD + 마크다운 내보내기 (memo_tags DB)
- VoiceCommandService: 키워드→명령어 매칭, 프리셋 4종
- ScreenContextService: PowerShell 활성 윈도우 + Ctrl+C 선택 텍스트
- ChainService: LLM 명령어 순차 실행 파이프라인
- CaptionService: 6초 청크 연속 전사 + 시스템 오디오 루프백

VoiceModeService 파이프라인 통합:
- 녹음 시작 → 컨텍스트 캡처 → STT → 키워드 매칭 → LLM(체인/컨텍스트 주입) → 삽입

시스템 오디오 캡처:
- setDisplayMediaRequestHandler + audio: 'loopback' (IPC 브릿지)
- electron-audio-loopback 패키지 contextIsolation 호환 불가 → 직접 구현

Phase 11 수익화:
- LicenseService: Free/Pro/Pro+ 3티어, LemonSqueezy API
- Feature Gate: requireFeature/checkFeature/consumeFeature
- 일일 쿼터: Free dictation 20/일, LLM 10/일 (SQLite daily_usage)
- LicenseModal, ProBadge, UpgradePromptModal UI

디자인 보강:
- d3roTypo(13종), d3roShadow(10종), d3roRadius(7종) 토큰 시스템
- ScreenPanel, ButtonGroup DS 컴포넌트 신규
- PhosphorText 4→13종 변형, MetalDial conic-gradient 광택
- 공유 컴포넌트: EmptyStateCard, SearchInput, PageHeader, HistoryEntryCard

기타:
- 자막 핫키 SSOT 전체 연동 (Config→Hotkey→VoiceMode→Caption→Settings)
- StatusBar 자막 LED + 효과음, 자막 로딩 UI
- LLM 상태 이벤트 전파 수정 (폴링 제거 → onStatusChanged)
- 커맨드 팝업 "선택 해제" 항목 추가
2026-04-05 21:36:09 +09:00

56 lines
2.6 KiB
Markdown

# Phase 12-13: Pro/Pro+ 킬러 피처
## Phase 12: Pro 피처 강화 (즉시 매출)
### 12.1 파일 전사 (File Transcription) — Pro+
- 오디오/비디오 파일 드래그앤드롭 → Whisper 전사
- ffmpeg(fluent-ffmpeg)로 미디어 → PCM 16kHz 변환
- 배치 처리: 큰 파일을 30초 청크로 분할 → 순차 전사
- 진행률 표시 (현재 청크/전체)
- 결과: 전체 텍스트 + 타임스탬프 세그먼트
- 히스토리에 자동 저장 (mode: 'file-transcription')
- UI: DashboardPage에 드래그 존 또는 별도 페이지
### 12.2 회의록 자동 요약 (Meeting Summary) — Pro+
- CaptionService 세션 종료 시 자동 트리거
- 전체 전사 텍스트 → Ollama 요약 프롬프트
- 출력: 3줄 요약 + 핵심 결정사항 + 할 일 목록
- 마크다운 내보내기
- 히스토리에 요약 첨부
### 12.3 딕테이션 템플릿 (Dictation Templates) — Pro+
- 템플릿 정의: 이름 + 필드 목록 + 출력 포맷
- 예: "이메일 템플릿" → 받는 사람, 제목, 본문 순서로 음성 입력
- 상태 머신: 필드 안내 TTS → 음성 입력 → 다음 필드 → 완료
- CustomInstruction과 별도 관리 (TemplateService)
## Phase 13: Pro+ 프리미엄 피처
### 13.1 음성 대화 모드 (Voice Conversation) — Pro+
- THE 킬러 피처: 로컬 ChatGPT Voice Mode
- Whisper STT → Ollama 스트리밍 → TTS 재생 → 다시 듣기
- 대화 히스토리 컨텍스트 유지 (최근 10턴)
- 문장 단위 TTS 스트리밍 (레이턴시 최적화)
- UI: 전용 대화 윈도우 또는 DashboardPage 내 패널
### 13.2 로컬 RAG (Retrieval Augmented Generation) — Pro+
- Ollama nomic-embed-text 모델로 문서 임베딩
- better-sqlite3에 임베딩 벡터 저장 (float array → blob)
- 코사인 유사도 검색 (SQLite UDF 또는 JS 계산)
- 지원 포맷: .txt, .md, .pdf (pdf-parse), .docx
- 음성 질문 → 관련 문서 검색 → LLM에 컨텍스트 주입 → 답변
- UI: Knowledge Base 페이지 (문서 목록 + 인덱싱 상태)
### 13.3 OS 자동화 (Voice Action) — Pro+
- 음성 → Ollama가 JSON 액션 플랜 생성 → 실행
- 액션 타입: 앱 열기, URL 열기, 파일 열기, 키보드 단축키, 텍스트 입력
- 안전장치: 실행 전 확인 팝업 (위험 액션)
- 사전 정의 명령: "크롬 열어", "메모장 열어", "볼륨 올려"
---
## 구현 우선순위
1. 파일 전사 (12.1) — 가장 쉬운 Pro+ 피처, ffmpeg만 추가
2. 회의록 요약 (12.2) — 자막 종료 후 LLM 호출 추가만
3. 음성 대화 모드 (13.1) — 가장 임팩트 큰 피처
4. 나머지는 Phase 11 수익 검증 후 결정