Textnizer - Руководство

Извлекайте текст из речи, снимков экрана и файлов. Поддерживаются распознавание речи в реальном времени, OCR снимков экрана и пакетная обработка аудио, видео, изображений и PDF.


Начало работы

Выберите один из трёх режимов на главном экране:

  1. Live Transcription — преобразование речи в текст в реальном времени с микрофона
  2. Capture Transcription — OCR со снимков экрана или с камеры
  3. File Transcription — пакетная обработка аудио-, видео-, графических или PDF-файлов

Live Transcription

Распознавание речи в реальном времени с вашего микрофона или устройства аудиоввода.

Речевые движки

ДвижокТипПодходит для
Google SpeechОнлайн-APIВысокая точность, много языков (по умолчанию)
WhisperЛокальная модельАвтономное использование, конфиденциальность (модели от tiny до large)
VoskАвтономныйЛёгкий, быстрый, много языков

Параметры записи

  • Выбор устройства аудиоввода
  • Audio Format: MP3 или WAV
  • Audio Quality: низкое / среднее / высокое
  • Дополнительная видеозапись с предпросмотром камеры
  • Дополнительная Speaker Classification (определяет разных говорящих)

Capture Transcription

Извлекайте текст со снимков экрана или с камеры с помощью OCR.

  • Camera capture — выберите камеру и сделайте один снимок
  • Full screen capture — снимок всего экрана
  • Region selection — нарисуйте прямоугольник, чтобы захватить определённую область
  • Window capture — захват конкретного окна

Движок OCR: Tesseract (по умолчанию японский). Результаты появляются рядом с захваченным изображением.


File Transcription

Обрабатывайте файлы пакетом, перетаскивая их или используя файловый браузер.

Поддерживаемые форматы

ТипФорматыМетод
АудиоMP3, WAV, M4A, FLAC, AAC, OGG, WMAРечевой движок
ВидеоMP4, AVI, MOV, MKV, WMV, FLVИзвлечение аудио → речевой движок
ИзображениеJPG, PNG, BMP, TIFF, GIFTesseract OCR
ДокументPDFСтраница → изображение → OCR

История worksets

  • Каждая сессия транскрипции сохраняется как workset
  • Фильтрация по ключевому слову, типу (Live/Capture/File) и статусу
  • Двойной клик, чтобы повторно открыть предыдущую сессию
  • Сортируемые столбцы: имя, тип, метод, дата, статус

Настройки

ПараметрОписаниеПо умолчанию
Recognition ModelРечевой движок по умолчаниюGoogle
Audio FormatФормат записиWAV
Audio QualityУровень сжатияMedium
Video CaptureВключить запись с камерыOff
Speaker ClassificationОпределять разных говорящихOff

Советы

  • Автономная транскрипция — Используйте Whisper или Vosk для полностью автономного распознавания речи
  • Заметки на встречах — Включите Speaker Classification, чтобы различать, кто что сказал
  • Пакетный OCR — Перетащите целую папку отсканированных документов для пакетной обработки
  • Извлечение из PDF — Каждая страница PDF преобразуется в изображение и отдельно обрабатывается OCR

Конфиденциальность

  • Движки Whisper и Vosk полностью работают на вашем устройстве
  • Google Speech отправляет аудио на серверы Google для распознавания
  • Все результаты транскрипции и записи сохраняются только на вашем локальном диске
  • Без аналитики и отслеживания