從語音、螢幕截圖和檔案中擷取文字。支援即時語音辨識、螢幕擷取 OCR,以及音訊、影片、圖片和 PDF 的批次處理。
快速上手
從主畫面選擇三種模式之一:
- Live Transcription — 來自麥克風的即時語音轉文字
- Capture Transcription — 從螢幕截圖或相機進行 OCR
- File Transcription — 批次處理音訊、影片、圖片或 PDF 檔案
Live Transcription
來自麥克風或音訊輸入裝置的即時語音辨識。
語音引擎
| 引擎 | 類型 | 適用情境 |
|---|---|---|
| Google Speech | 線上 API | 高準確度,多語言(預設) |
| Whisper | 本地模型 | 離線使用、隱私保護(tiny 至 large 模型) |
| Vosk | 離線 | 輕量、快速、多語言 |
錄音選項
- 音訊輸入裝置選擇
- Audio Format:MP3 或 WAV
- Audio Quality:low / medium / high
- 可選 Video Capture,附相機預覽
- 可選 Speaker Classification(辨識不同說話人)
Capture Transcription
使用 OCR 從螢幕截圖或相機擷取中擷取文字。
- Camera capture — 選擇相機裝置並拍攝一張照片
- Full screen capture — 擷取整個螢幕
- Region selection — 繪製矩形以擷取特定區域
- Window capture — 擷取指定視窗
OCR 引擎:Tesseract(預設日文)。結果會與擷取的圖片並列顯示。
File Transcription
透過拖放或檔案瀏覽器批次處理檔案。
支援格式
| 類型 | 格式 | 處理方式 |
|---|---|---|
| 音訊 | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | 語音引擎 |
| 影片 | MP4, AVI, MOV, MKV, WMV, FLV | 音訊擷取 → 語音引擎 |
| 圖片 | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| 文件 | 頁面 → 圖片 → OCR |
工作集歷史
- 每次轉錄工作階段都會儲存為工作集
- 依關鍵字、類型(Live/Capture/File)和狀態篩選
- 按兩下重新開啟先前的工作階段
- 可排序的欄位:名稱、類型、方式、日期、狀態
設定
| 設定項目 | 說明 | 預設值 |
|---|---|---|
| Recognition Model | 預設語音引擎 | |
| Audio Format | 錄音格式 | WAV |
| Audio Quality | 壓縮等級 | Medium |
| Video Capture | 啟用相機錄製 | Off |
| Speaker Classification | 辨識不同說話人 | Off |
使用技巧
- 離線轉錄 — 使用 Whisper 或 Vosk 實現完全離線的語音辨識
- 會議筆記 — 啟用 Speaker Classification 以區分誰說了什麼
- 批次 OCR — 拖入整個掃描文件資料夾進行批次處理
- PDF 擷取 — 每個 PDF 頁面都會單獨轉換為圖片並進行 OCR
隱私
- Whisper 與 Vosk 引擎完全在您的裝置上執行
- Google Speech 會將音訊傳送到 Google 伺服器進行辨識
- 所有轉錄結果與錄音僅儲存於您的本機磁碟
- 不進行任何分析或追蹤