Видобувайте текст із мовлення, знімків екрана та файлів. Підтримує розпізнавання голосу в реальному часі, OCR знімків екрана та пакетну обробку аудіо-, відео-, графічних і PDF-файлів.
Перші кроки
Оберіть один із трьох режимів на головному екрані:
- Live Transcription — перетворення мовлення на текст у реальному часі з мікрофона
- Capture Transcription — OCR зі знімків екрана або камери
- File Transcription — пакетна обробка аудіо-, відео-, графічних або PDF-файлів
Live Transcription
Розпізнавання мовлення в реальному часі з мікрофона або пристрою аудіовходу.
Мовні рушії
| Рушій | Тип | Найкраще для |
|---|---|---|
| Google Speech | Online API | Висока точність, багато мов (за замовчуванням) |
| Whisper | Локальна модель | Автономна робота, конфіденційність (моделі від tiny до large) |
| Vosk | Offline | Легкий, швидкий, багато мов |
Параметри запису
- Вибір пристрою аудіовходу
- Audio Format: MP3 або WAV
- Audio Quality: low / medium / high
- Опційний відеозапис із попереднім переглядом камери
- Опційна Speaker Classification (розпізнає різних мовців)
Capture Transcription
Видобувайте текст зі знімків екрана або знімків з камери за допомогою OCR.
- Camera capture — оберіть пристрій камери, зробіть один знімок
- Full screen capture — захопіть увесь екран
- Region selection — намалюйте прямокутник, щоб захопити певну область
- Window capture — захопіть конкретне вікно
OCR-рушій: Tesseract (за замовчуванням японська). Результати з’являються поряд із захопленим зображенням.
File Transcription
Обробляйте файли пакетно, перетягуючи їх або через провідник файлів.
Підтримувані формати
| Тип | Формати | Метод |
|---|---|---|
| Аудіо | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Мовний рушій |
| Відео | MP4, AVI, MOV, MKV, WMV, FLV | Видобуття звуку → мовний рушій |
| Зображення | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Документ | Сторінка → зображення → OCR |
Workset History
- Кожен сеанс транскрипції зберігається як workset
- Фільтруйте за ключовим словом, типом (Live/Capture/File) та статусом
- Двічі клацніть, щоб знову відкрити попередній сеанс
- Сортовані стовпці: назва, тип, метод, дата, статус
Налаштування
| Налаштування | Опис | За замовчуванням |
|---|---|---|
| Recognition Model | Мовний рушій за замовчуванням | |
| Audio Format | Формат запису | WAV |
| Audio Quality | Рівень стиснення | Medium |
| Video Capture | Увімкнути запис із камери | Off |
| Speaker Classification | Ідентифікація різних мовців | Off |
Поради
- Автономна транскрипція — Використовуйте Whisper або Vosk для повністю автономного розпізнавання мовлення
- Нотатки нарад — Увімкніть Speaker Classification, щоб розрізнити, хто що сказав
- Пакетний OCR — Перетягніть цілу теку зі сканованими документами для пакетної обробки
- Видобуття PDF — Кожна сторінка PDF перетворюється на зображення й обробляється OCR окремо
Конфіденційність
- Рушії Whisper і Vosk працюють повністю на вашому пристрої
- Google Speech надсилає аудіо на сервери Google для розпізнавання
- Усі результати транскрипції та записи зберігаються лише на вашому локальному диску
- Без аналітики чи відстеження