음성, 스크린샷, 파일에서 텍스트를 추출합니다. 실시간 음성 인식, 화면 캡처 OCR, 오디오·비디오·이미지·PDF 일괄 처리를 지원합니다.
시작하기
메인 화면에서 세 가지 모드 중 하나를 선택하세요:
- Live Transcription — 마이크에서 실시간 음성-텍스트 변환
- Capture Transcription — 스크린샷 또는 카메라로 OCR
- File Transcription — 오디오·비디오·이미지·PDF 파일 일괄 처리
Live Transcription
마이크 또는 오디오 입력 장치에서의 실시간 음성 인식입니다.
음성 엔진
| 엔진 | 유형 | 적합한 용도 |
|---|---|---|
| Google Speech | 온라인 API | 높은 정확도, 다국어 지원(기본값) |
| Whisper | 로컬 모델 | 오프라인 사용, 개인정보 보호(tiny~large 모델) |
| Vosk | 오프라인 | 가볍고 빠르며 다국어 지원 |
녹음 옵션
- 오디오 입력 장치 선택
- Audio Format: MP3 또는 WAV
- Audio Quality: low / medium / high
- 카메라 미리보기 포함 Video Capture(선택 사항)
- Speaker Classification(선택 사항, 서로 다른 화자를 식별)
Capture Transcription
스크린샷이나 카메라 캡처에서 OCR로 텍스트를 추출합니다.
- Camera capture — 카메라 장치를 선택하여 한 장 촬영
- Full screen capture — 전체 화면 캡처
- Region selection — 사각형을 그려 특정 영역 캡처
- Window capture — 특정 창 캡처
OCR 엔진: Tesseract(기본 일본어). 결과는 캡처 이미지와 함께 표시됩니다.
File Transcription
드래그 앤 드롭 또는 파일 브라우저로 파일을 일괄 처리합니다.
지원 형식
| 유형 | 형식 | 처리 방법 |
|---|---|---|
| 오디오 | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | 음성 엔진 |
| 비디오 | MP4, AVI, MOV, MKV, WMV, FLV | 오디오 추출 → 음성 엔진 |
| 이미지 | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| 문서 | 페이지 → 이미지 → OCR |
워크셋 히스토리
- 각 전사 세션은 워크셋으로 저장됩니다
- 키워드, 유형(Live/Capture/File), 상태로 필터링
- 더블 클릭하여 이전 세션 재개
- 정렬 가능한 열: 이름, 유형, 방식, 날짜, 상태
설정
| 설정 | 설명 | 기본값 |
|---|---|---|
| Recognition Model | 기본 음성 엔진 | |
| Audio Format | 녹음 형식 | WAV |
| Audio Quality | 압축 수준 | Medium |
| Video Capture | 카메라 녹화 활성화 | Off |
| Speaker Classification | 서로 다른 화자 식별 | Off |
팁
- 오프라인 전사 — Whisper 또는 Vosk를 사용하면 완전히 오프라인으로 음성 인식 가능
- 회의록 — Speaker Classification을 활성화하여 누가 무엇을 말했는지 구분
- 일괄 OCR — 스캔 문서가 들어 있는 폴더 전체를 드롭하여 일괄 처리
- PDF 추출 — PDF의 각 페이지가 이미지로 변환되어 개별적으로 OCR 처리됩니다
개인정보 보호
- Whisper 및 Vosk 엔진은 전적으로 사용자의 기기에서 실행됩니다
- Google Speech는 인식을 위해 음성을 Google 서버로 전송합니다
- 모든 전사 결과와 녹음은 로컬 디스크에만 저장됩니다
- 분석이나 추적이 없습니다