# Phase 12-13: Pro/Pro+ 킬러 피처 ## Phase 12: Pro 피처 강화 (즉시 매출) ### 12.1 파일 전사 (File Transcription) — Pro+ - 오디오/비디오 파일 드래그앤드롭 → Whisper 전사 - ffmpeg(fluent-ffmpeg)로 미디어 → PCM 16kHz 변환 - 배치 처리: 큰 파일을 30초 청크로 분할 → 순차 전사 - 진행률 표시 (현재 청크/전체) - 결과: 전체 텍스트 + 타임스탬프 세그먼트 - 히스토리에 자동 저장 (mode: 'file-transcription') - UI: DashboardPage에 드래그 존 또는 별도 페이지 ### 12.2 회의록 자동 요약 (Meeting Summary) — Pro+ - CaptionService 세션 종료 시 자동 트리거 - 전체 전사 텍스트 → Ollama 요약 프롬프트 - 출력: 3줄 요약 + 핵심 결정사항 + 할 일 목록 - 마크다운 내보내기 - 히스토리에 요약 첨부 ### 12.3 딕테이션 템플릿 (Dictation Templates) — Pro+ - 템플릿 정의: 이름 + 필드 목록 + 출력 포맷 - 예: "이메일 템플릿" → 받는 사람, 제목, 본문 순서로 음성 입력 - 상태 머신: 필드 안내 TTS → 음성 입력 → 다음 필드 → 완료 - CustomInstruction과 별도 관리 (TemplateService) ## Phase 13: Pro+ 프리미엄 피처 ### 13.1 음성 대화 모드 (Voice Conversation) — Pro+ - THE 킬러 피처: 로컬 ChatGPT Voice Mode - Whisper STT → Ollama 스트리밍 → TTS 재생 → 다시 듣기 - 대화 히스토리 컨텍스트 유지 (최근 10턴) - 문장 단위 TTS 스트리밍 (레이턴시 최적화) - UI: 전용 대화 윈도우 또는 DashboardPage 내 패널 ### 13.2 로컬 RAG (Retrieval Augmented Generation) — Pro+ - Ollama nomic-embed-text 모델로 문서 임베딩 - better-sqlite3에 임베딩 벡터 저장 (float array → blob) - 코사인 유사도 검색 (SQLite UDF 또는 JS 계산) - 지원 포맷: .txt, .md, .pdf (pdf-parse), .docx - 음성 질문 → 관련 문서 검색 → LLM에 컨텍스트 주입 → 답변 - UI: Knowledge Base 페이지 (문서 목록 + 인덱싱 상태) ### 13.3 OS 자동화 (Voice Action) — Pro+ - 음성 → Ollama가 JSON 액션 플랜 생성 → 실행 - 액션 타입: 앱 열기, URL 열기, 파일 열기, 키보드 단축키, 텍스트 입력 - 안전장치: 실행 전 확인 팝업 (위험 액션) - 사전 정의 명령: "크롬 열어", "메모장 열어", "볼륨 올려" --- ## 구현 우선순위 1. 파일 전사 (12.1) — 가장 쉬운 Pro+ 피처, ffmpeg만 추가 2. 회의록 요약 (12.2) — 자막 종료 후 LLM 호출 추가만 3. 음성 대화 모드 (13.1) — 가장 임팩트 큰 피처 4. 나머지는 Phase 11 수익 검증 후 결정