Phase 10 킬러 피처: - MemoService: 태그 CRUD + 마크다운 내보내기 (memo_tags DB) - VoiceCommandService: 키워드→명령어 매칭, 프리셋 4종 - ScreenContextService: PowerShell 활성 윈도우 + Ctrl+C 선택 텍스트 - ChainService: LLM 명령어 순차 실행 파이프라인 - CaptionService: 6초 청크 연속 전사 + 시스템 오디오 루프백 VoiceModeService 파이프라인 통합: - 녹음 시작 → 컨텍스트 캡처 → STT → 키워드 매칭 → LLM(체인/컨텍스트 주입) → 삽입 시스템 오디오 캡처: - setDisplayMediaRequestHandler + audio: 'loopback' (IPC 브릿지) - electron-audio-loopback 패키지 contextIsolation 호환 불가 → 직접 구현 Phase 11 수익화: - LicenseService: Free/Pro/Pro+ 3티어, LemonSqueezy API - Feature Gate: requireFeature/checkFeature/consumeFeature - 일일 쿼터: Free dictation 20/일, LLM 10/일 (SQLite daily_usage) - LicenseModal, ProBadge, UpgradePromptModal UI 디자인 보강: - d3roTypo(13종), d3roShadow(10종), d3roRadius(7종) 토큰 시스템 - ScreenPanel, ButtonGroup DS 컴포넌트 신규 - PhosphorText 4→13종 변형, MetalDial conic-gradient 광택 - 공유 컴포넌트: EmptyStateCard, SearchInput, PageHeader, HistoryEntryCard 기타: - 자막 핫키 SSOT 전체 연동 (Config→Hotkey→VoiceMode→Caption→Settings) - StatusBar 자막 LED + 효과음, 자막 로딩 UI - LLM 상태 이벤트 전파 수정 (폴링 제거 → onStatusChanged) - 커맨드 팝업 "선택 해제" 항목 추가
56 lines
2.6 KiB
Markdown
56 lines
2.6 KiB
Markdown
# Phase 12-13: Pro/Pro+ 킬러 피처
|
|
|
|
## Phase 12: Pro 피처 강화 (즉시 매출)
|
|
|
|
### 12.1 파일 전사 (File Transcription) — Pro+
|
|
- 오디오/비디오 파일 드래그앤드롭 → Whisper 전사
|
|
- ffmpeg(fluent-ffmpeg)로 미디어 → PCM 16kHz 변환
|
|
- 배치 처리: 큰 파일을 30초 청크로 분할 → 순차 전사
|
|
- 진행률 표시 (현재 청크/전체)
|
|
- 결과: 전체 텍스트 + 타임스탬프 세그먼트
|
|
- 히스토리에 자동 저장 (mode: 'file-transcription')
|
|
- UI: DashboardPage에 드래그 존 또는 별도 페이지
|
|
|
|
### 12.2 회의록 자동 요약 (Meeting Summary) — Pro+
|
|
- CaptionService 세션 종료 시 자동 트리거
|
|
- 전체 전사 텍스트 → Ollama 요약 프롬프트
|
|
- 출력: 3줄 요약 + 핵심 결정사항 + 할 일 목록
|
|
- 마크다운 내보내기
|
|
- 히스토리에 요약 첨부
|
|
|
|
### 12.3 딕테이션 템플릿 (Dictation Templates) — Pro+
|
|
- 템플릿 정의: 이름 + 필드 목록 + 출력 포맷
|
|
- 예: "이메일 템플릿" → 받는 사람, 제목, 본문 순서로 음성 입력
|
|
- 상태 머신: 필드 안내 TTS → 음성 입력 → 다음 필드 → 완료
|
|
- CustomInstruction과 별도 관리 (TemplateService)
|
|
|
|
## Phase 13: Pro+ 프리미엄 피처
|
|
|
|
### 13.1 음성 대화 모드 (Voice Conversation) — Pro+
|
|
- THE 킬러 피처: 로컬 ChatGPT Voice Mode
|
|
- Whisper STT → Ollama 스트리밍 → TTS 재생 → 다시 듣기
|
|
- 대화 히스토리 컨텍스트 유지 (최근 10턴)
|
|
- 문장 단위 TTS 스트리밍 (레이턴시 최적화)
|
|
- UI: 전용 대화 윈도우 또는 DashboardPage 내 패널
|
|
|
|
### 13.2 로컬 RAG (Retrieval Augmented Generation) — Pro+
|
|
- Ollama nomic-embed-text 모델로 문서 임베딩
|
|
- better-sqlite3에 임베딩 벡터 저장 (float array → blob)
|
|
- 코사인 유사도 검색 (SQLite UDF 또는 JS 계산)
|
|
- 지원 포맷: .txt, .md, .pdf (pdf-parse), .docx
|
|
- 음성 질문 → 관련 문서 검색 → LLM에 컨텍스트 주입 → 답변
|
|
- UI: Knowledge Base 페이지 (문서 목록 + 인덱싱 상태)
|
|
|
|
### 13.3 OS 자동화 (Voice Action) — Pro+
|
|
- 음성 → Ollama가 JSON 액션 플랜 생성 → 실행
|
|
- 액션 타입: 앱 열기, URL 열기, 파일 열기, 키보드 단축키, 텍스트 입력
|
|
- 안전장치: 실행 전 확인 팝업 (위험 액션)
|
|
- 사전 정의 명령: "크롬 열어", "메모장 열어", "볼륨 올려"
|
|
|
|
---
|
|
|
|
## 구현 우선순위
|
|
1. 파일 전사 (12.1) — 가장 쉬운 Pro+ 피처, ffmpeg만 추가
|
|
2. 회의록 요약 (12.2) — 자막 종료 후 LLM 호출 추가만
|
|
3. 음성 대화 모드 (13.1) — 가장 임팩트 큰 피처
|
|
4. 나머지는 Phase 11 수익 검증 후 결정
|