从语音、屏幕截图和文件中提取文本。支持实时语音识别、屏幕捕获 OCR,以及音频、视频、图像和 PDF 的批量处理。
快速上手
从主屏幕选择三种模式之一:
- Live Transcription — 来自麦克风的实时语音转文本
- Capture Transcription — 从屏幕截图或相机进行 OCR
- File Transcription — 批量处理音频、视频、图像或 PDF 文件
Live Transcription
来自麦克风或音频输入设备的实时语音识别。
语音引擎
| 引擎 | 类型 | 适用场景 |
|---|---|---|
| Google Speech | 在线 API | 高准确度,多语言(默认) |
| Whisper | 本地模型 | 离线使用、隐私保护(tiny 至 large 模型) |
| Vosk | 离线 | 轻量、快速、多语言 |
录音选项
- 音频输入设备选择
- Audio Format:MP3 或 WAV
- Audio Quality:low / medium / high
- 可选 Video Capture,带相机预览
- 可选 Speaker Classification(识别不同说话人)
Capture Transcription
使用 OCR 从屏幕截图或相机捕获中提取文本。
- Camera capture — 选择相机设备并拍摄一张照片
- Full screen capture — 捕获整个屏幕
- Region selection — 绘制矩形以捕获特定区域
- Window capture — 捕获指定窗口
OCR 引擎:Tesseract(默认日语)。结果与捕获的图像并列显示。
File Transcription
通过拖放或文件浏览器批量处理文件。
支持格式
| 类型 | 格式 | 处理方式 |
|---|---|---|
| 音频 | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | 语音引擎 |
| 视频 | MP4, AVI, MOV, MKV, WMV, FLV | 音频提取 → 语音引擎 |
| 图像 | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| 文档 | 页面 → 图像 → OCR |
工作集历史
- 每次转录会话都会保存为工作集
- 按关键字、类型(Live/Capture/File)和状态筛选
- 双击重新打开以前的会话
- 可排序的列:名称、类型、方式、日期、状态
设置
| 设置项 | 说明 | 默认值 |
|---|---|---|
| Recognition Model | 默认语音引擎 | |
| Audio Format | 录音格式 | WAV |
| Audio Quality | 压缩级别 | Medium |
| Video Capture | 启用相机录制 | Off |
| Speaker Classification | 识别不同说话人 | Off |
使用技巧
- 离线转录 — 使用 Whisper 或 Vosk 实现完全离线的语音识别
- 会议记录 — 启用 Speaker Classification 以区分谁说了什么
- 批量 OCR — 拖入整个扫描文档文件夹进行批量处理
- PDF 提取 — 每个 PDF 页面都会单独转换为图像并进行 OCR
隐私
- Whisper 和 Vosk 引擎完全在您的设备上运行
- Google Speech 会将音频发送到 Google 服务器进行识别
- 所有转录结果和录音仅存储在您的本地磁盘上
- 不进行任何分析或跟踪