Извлекайте текст из речи, снимков экрана и файлов. Поддерживаются распознавание речи в реальном времени, OCR снимков экрана и пакетная обработка аудио, видео, изображений и PDF.
Начало работы
Выберите один из трёх режимов на главном экране:
- Live Transcription — преобразование речи в текст в реальном времени с микрофона
- Capture Transcription — OCR со снимков экрана или с камеры
- File Transcription — пакетная обработка аудио-, видео-, графических или PDF-файлов
Live Transcription
Распознавание речи в реальном времени с вашего микрофона или устройства аудиоввода.
Речевые движки
| Движок | Тип | Подходит для |
|---|---|---|
| Google Speech | Онлайн-API | Высокая точность, много языков (по умолчанию) |
| Whisper | Локальная модель | Автономное использование, конфиденциальность (модели от tiny до large) |
| Vosk | Автономный | Лёгкий, быстрый, много языков |
Параметры записи
- Выбор устройства аудиоввода
- Audio Format: MP3 или WAV
- Audio Quality: низкое / среднее / высокое
- Дополнительная видеозапись с предпросмотром камеры
- Дополнительная Speaker Classification (определяет разных говорящих)
Capture Transcription
Извлекайте текст со снимков экрана или с камеры с помощью OCR.
- Camera capture — выберите камеру и сделайте один снимок
- Full screen capture — снимок всего экрана
- Region selection — нарисуйте прямоугольник, чтобы захватить определённую область
- Window capture — захват конкретного окна
Движок OCR: Tesseract (по умолчанию японский). Результаты появляются рядом с захваченным изображением.
File Transcription
Обрабатывайте файлы пакетом, перетаскивая их или используя файловый браузер.
Поддерживаемые форматы
| Тип | Форматы | Метод |
|---|---|---|
| Аудио | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Речевой движок |
| Видео | MP4, AVI, MOV, MKV, WMV, FLV | Извлечение аудио → речевой движок |
| Изображение | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Документ | Страница → изображение → OCR |
История worksets
- Каждая сессия транскрипции сохраняется как workset
- Фильтрация по ключевому слову, типу (Live/Capture/File) и статусу
- Двойной клик, чтобы повторно открыть предыдущую сессию
- Сортируемые столбцы: имя, тип, метод, дата, статус
Настройки
| Параметр | Описание | По умолчанию |
|---|---|---|
| Recognition Model | Речевой движок по умолчанию | |
| Audio Format | Формат записи | WAV |
| Audio Quality | Уровень сжатия | Medium |
| Video Capture | Включить запись с камеры | Off |
| Speaker Classification | Определять разных говорящих | Off |
Советы
- Автономная транскрипция — Используйте Whisper или Vosk для полностью автономного распознавания речи
- Заметки на встречах — Включите Speaker Classification, чтобы различать, кто что сказал
- Пакетный OCR — Перетащите целую папку отсканированных документов для пакетной обработки
- Извлечение из PDF — Каждая страница PDF преобразуется в изображение и отдельно обрабатывается OCR
Конфиденциальность
- Движки Whisper и Vosk полностью работают на вашем устройстве
- Google Speech отправляет аудио на серверы Google для распознавания
- Все результаты транскрипции и записи сохраняются только на вашем локальном диске
- Без аналитики и отслеживания