Textnizer - Przewodnik

Wyodrębniaj tekst z mowy, zrzutów ekranu i plików. Obsługuje rozpoznawanie głosu w czasie rzeczywistym, OCR przechwyconych zrzutów ekranu oraz przetwarzanie wsadowe plików audio, wideo, obrazów i PDF.


Pierwsze kroki

Wybierz jeden z trzech trybów na ekranie głównym:

  1. Live Transcription — zamiana mowy na tekst w czasie rzeczywistym z mikrofonu
  2. Capture Transcription — OCR ze zrzutów ekranu lub kamery
  3. File Transcription — wsadowe przetwarzanie plików audio, wideo, obrazów lub PDF

Live Transcription

Rozpoznawanie mowy w czasie rzeczywistym z mikrofonu lub urządzenia wejścia audio.

Silniki rozpoznawania mowy

SilnikTypNajlepszy do
Google SpeechAPI onlineWysoka dokładność, wiele języków (domyślny)
WhisperModel lokalnyPraca offline, prywatność (modele od tiny do large)
VoskOfflineLekki, szybki, wiele języków

Opcje nagrywania

  • Wybór urządzenia wejścia audio
  • Audio Format: MP3 lub WAV
  • Audio Quality: low / medium / high
  • Opcjonalne nagrywanie wideo z podglądem kamery
  • Opcjonalna Speaker Classification (rozpoznawanie różnych mówców)

Capture Transcription

Wyodrębniaj tekst ze zrzutów ekranu lub zdjęć z kamery przy użyciu OCR.

  • Camera capture — wybierz urządzenie kamery, zrób pojedyncze zdjęcie
  • Full screen capture — przechwyć cały ekran
  • Region selection — narysuj prostokąt, aby uchwycić określony obszar
  • Window capture — przechwyć określone okno

Silnik OCR: Tesseract (domyślnie japoński). Wyniki pojawiają się obok zrobionego zrzutu.


File Transcription

Przetwarzaj pliki wsadowo, przeciągając je i upuszczając lub korzystając z przeglądarki plików.

Obsługiwane formaty

TypFormatyMetoda
AudioMP3, WAV, M4A, FLAC, AAC, OGG, WMASilnik mowy
WideoMP4, AVI, MOV, MKV, WMV, FLVEkstrakcja audio → silnik mowy
ObrazJPG, PNG, BMP, TIFF, GIFTesseract OCR
DokumentPDFStrona → obraz → OCR

Workset History

  • Każda sesja transkrypcji jest zapisywana jako workset
  • Filtruj według słowa kluczowego, typu (Live/Capture/File) i statusu
  • Kliknij dwukrotnie, aby ponownie otworzyć poprzednią sesję
  • Sortowalne kolumny: nazwa, typ, metoda, data, status

Ustawienia

UstawienieOpisDomyślnie
Recognition ModelDomyślny silnik rozpoznawania mowyGoogle
Audio FormatFormat nagrywaniaWAV
Audio QualityPoziom kompresjiMedium
Video CaptureWłącz nagrywanie z kameryOff
Speaker ClassificationIdentyfikacja różnych mówcówOff

Wskazówki

  • Transkrypcja offline — Użyj Whisper lub Vosk dla całkowicie offline rozpoznawania mowy
  • Notatki ze spotkań — Włącz Speaker Classification, aby rozróżnić, kto co powiedział
  • Wsadowy OCR — Upuść cały folder skanowanych dokumentów do przetwarzania wsadowego
  • Ekstrakcja PDF — Każda strona PDF jest zamieniana na obraz i przetwarzana przez OCR osobno

Prywatność

  • Silniki Whisper i Vosk działają w całości na Twoim urządzeniu
  • Google Speech wysyła audio na serwery Google w celu rozpoznania
  • Wszystkie wyniki transkrypcji i nagrania są przechowywane wyłącznie na lokalnym dysku
  • Brak analityki ani śledzenia