Textnizer - 指南

从语音、屏幕截图和文件中提取文本。支持实时语音识别、屏幕捕获 OCR,以及音频、视频、图像和 PDF 的批量处理。


快速上手

从主屏幕选择三种模式之一:

  1. Live Transcription — 来自麦克风的实时语音转文本
  2. Capture Transcription — 从屏幕截图或相机进行 OCR
  3. File Transcription — 批量处理音频、视频、图像或 PDF 文件

Live Transcription

来自麦克风或音频输入设备的实时语音识别。

语音引擎

引擎类型适用场景
Google Speech在线 API高准确度,多语言(默认)
Whisper本地模型离线使用、隐私保护(tiny 至 large 模型)
Vosk离线轻量、快速、多语言

录音选项

  • 音频输入设备选择
  • Audio Format:MP3 或 WAV
  • Audio Quality:low / medium / high
  • 可选 Video Capture,带相机预览
  • 可选 Speaker Classification(识别不同说话人)

Capture Transcription

使用 OCR 从屏幕截图或相机捕获中提取文本。

  • Camera capture — 选择相机设备并拍摄一张照片
  • Full screen capture — 捕获整个屏幕
  • Region selection — 绘制矩形以捕获特定区域
  • Window capture — 捕获指定窗口

OCR 引擎:Tesseract(默认日语)。结果与捕获的图像并列显示。


File Transcription

通过拖放或文件浏览器批量处理文件。

支持格式

类型格式处理方式
音频MP3, WAV, M4A, FLAC, AAC, OGG, WMA语音引擎
视频MP4, AVI, MOV, MKV, WMV, FLV音频提取 → 语音引擎
图像JPG, PNG, BMP, TIFF, GIFTesseract OCR
文档PDF页面 → 图像 → OCR

工作集历史

  • 每次转录会话都会保存为工作集
  • 按关键字、类型(Live/Capture/File)和状态筛选
  • 双击重新打开以前的会话
  • 可排序的列:名称、类型、方式、日期、状态

设置

设置项说明默认值
Recognition Model默认语音引擎Google
Audio Format录音格式WAV
Audio Quality压缩级别Medium
Video Capture启用相机录制Off
Speaker Classification识别不同说话人Off

使用技巧

  • 离线转录 — 使用 Whisper 或 Vosk 实现完全离线的语音识别
  • 会议记录 — 启用 Speaker Classification 以区分谁说了什么
  • 批量 OCR — 拖入整个扫描文档文件夹进行批量处理
  • PDF 提取 — 每个 PDF 页面都会单独转换为图像并进行 OCR

隐私

  • Whisper 和 Vosk 引擎完全在您的设备上运行
  • Google Speech 会将音频发送到 Google 服务器进行识别
  • 所有转录结果和录音仅存储在您的本地磁盘上
  • 不进行任何分析或跟踪