Textnizer - 指南

從語音、螢幕截圖和檔案中擷取文字。支援即時語音辨識、螢幕擷取 OCR,以及音訊、影片、圖片和 PDF 的批次處理。


快速上手

從主畫面選擇三種模式之一:

  1. Live Transcription — 來自麥克風的即時語音轉文字
  2. Capture Transcription — 從螢幕截圖或相機進行 OCR
  3. File Transcription — 批次處理音訊、影片、圖片或 PDF 檔案

Live Transcription

來自麥克風或音訊輸入裝置的即時語音辨識。

語音引擎

引擎類型適用情境
Google Speech線上 API高準確度,多語言(預設)
Whisper本地模型離線使用、隱私保護(tiny 至 large 模型)
Vosk離線輕量、快速、多語言

錄音選項

  • 音訊輸入裝置選擇
  • Audio Format:MP3 或 WAV
  • Audio Quality:low / medium / high
  • 可選 Video Capture,附相機預覽
  • 可選 Speaker Classification(辨識不同說話人)

Capture Transcription

使用 OCR 從螢幕截圖或相機擷取中擷取文字。

  • Camera capture — 選擇相機裝置並拍攝一張照片
  • Full screen capture — 擷取整個螢幕
  • Region selection — 繪製矩形以擷取特定區域
  • Window capture — 擷取指定視窗

OCR 引擎:Tesseract(預設日文)。結果會與擷取的圖片並列顯示。


File Transcription

透過拖放或檔案瀏覽器批次處理檔案。

支援格式

類型格式處理方式
音訊MP3, WAV, M4A, FLAC, AAC, OGG, WMA語音引擎
影片MP4, AVI, MOV, MKV, WMV, FLV音訊擷取 → 語音引擎
圖片JPG, PNG, BMP, TIFF, GIFTesseract OCR
文件PDF頁面 → 圖片 → OCR

工作集歷史

  • 每次轉錄工作階段都會儲存為工作集
  • 依關鍵字、類型(Live/Capture/File)和狀態篩選
  • 按兩下重新開啟先前的工作階段
  • 可排序的欄位:名稱、類型、方式、日期、狀態

設定

設定項目說明預設值
Recognition Model預設語音引擎Google
Audio Format錄音格式WAV
Audio Quality壓縮等級Medium
Video Capture啟用相機錄製Off
Speaker Classification辨識不同說話人Off

使用技巧

  • 離線轉錄 — 使用 Whisper 或 Vosk 實現完全離線的語音辨識
  • 會議筆記 — 啟用 Speaker Classification 以區分誰說了什麼
  • 批次 OCR — 拖入整個掃描文件資料夾進行批次處理
  • PDF 擷取 — 每個 PDF 頁面都會單獨轉換為圖片並進行 OCR

隱私

  • Whisper 與 Vosk 引擎完全在您的裝置上執行
  • Google Speech 會將音訊傳送到 Google 伺服器進行辨識
  • 所有轉錄結果與錄音僅儲存於您的本機磁碟
  • 不進行任何分析或追蹤