Textnizer - 가이드

음성, 스크린샷, 파일에서 텍스트를 추출합니다. 실시간 음성 인식, 화면 캡처 OCR, 오디오·비디오·이미지·PDF 일괄 처리를 지원합니다.


시작하기

메인 화면에서 세 가지 모드 중 하나를 선택하세요:

  1. Live Transcription — 마이크에서 실시간 음성-텍스트 변환
  2. Capture Transcription — 스크린샷 또는 카메라로 OCR
  3. File Transcription — 오디오·비디오·이미지·PDF 파일 일괄 처리

Live Transcription

마이크 또는 오디오 입력 장치에서의 실시간 음성 인식입니다.

음성 엔진

엔진유형적합한 용도
Google Speech온라인 API높은 정확도, 다국어 지원(기본값)
Whisper로컬 모델오프라인 사용, 개인정보 보호(tiny~large 모델)
Vosk오프라인가볍고 빠르며 다국어 지원

녹음 옵션

  • 오디오 입력 장치 선택
  • Audio Format: MP3 또는 WAV
  • Audio Quality: low / medium / high
  • 카메라 미리보기 포함 Video Capture(선택 사항)
  • Speaker Classification(선택 사항, 서로 다른 화자를 식별)

Capture Transcription

스크린샷이나 카메라 캡처에서 OCR로 텍스트를 추출합니다.

  • Camera capture — 카메라 장치를 선택하여 한 장 촬영
  • Full screen capture — 전체 화면 캡처
  • Region selection — 사각형을 그려 특정 영역 캡처
  • Window capture — 특정 창 캡처

OCR 엔진: Tesseract(기본 일본어). 결과는 캡처 이미지와 함께 표시됩니다.


File Transcription

드래그 앤 드롭 또는 파일 브라우저로 파일을 일괄 처리합니다.

지원 형식

유형형식처리 방법
오디오MP3, WAV, M4A, FLAC, AAC, OGG, WMA음성 엔진
비디오MP4, AVI, MOV, MKV, WMV, FLV오디오 추출 → 음성 엔진
이미지JPG, PNG, BMP, TIFF, GIFTesseract OCR
문서PDF페이지 → 이미지 → OCR

워크셋 히스토리

  • 각 전사 세션은 워크셋으로 저장됩니다
  • 키워드, 유형(Live/Capture/File), 상태로 필터링
  • 더블 클릭하여 이전 세션 재개
  • 정렬 가능한 열: 이름, 유형, 방식, 날짜, 상태

설정

설정설명기본값
Recognition Model기본 음성 엔진Google
Audio Format녹음 형식WAV
Audio Quality압축 수준Medium
Video Capture카메라 녹화 활성화Off
Speaker Classification서로 다른 화자 식별Off

  • 오프라인 전사 — Whisper 또는 Vosk를 사용하면 완전히 오프라인으로 음성 인식 가능
  • 회의록 — Speaker Classification을 활성화하여 누가 무엇을 말했는지 구분
  • 일괄 OCR — 스캔 문서가 들어 있는 폴더 전체를 드롭하여 일괄 처리
  • PDF 추출 — PDF의 각 페이지가 이미지로 변환되어 개별적으로 OCR 처리됩니다

개인정보 보호

  • Whisper 및 Vosk 엔진은 전적으로 사용자의 기기에서 실행됩니다
  • Google Speech는 인식을 위해 음성을 Google 서버로 전송합니다
  • 모든 전사 결과와 녹음은 로컬 디스크에만 저장됩니다
  • 분석이나 추적이 없습니다