Textnizer - Průvodce

Extrahujte text z řeči, snímků obrazovky a souborů. Podporuje rozpoznávání řeči v reálném čase, OCR snímků obrazovky a dávkové zpracování zvuku, videa, obrázků a PDF.


Začínáme

Vyberte jeden ze tří režimů na hlavní obrazovce:

  1. Live Transcription — převod řeči na text v reálném čase z mikrofonu
  2. Capture Transcription — OCR ze snímků obrazovky nebo kamery
  3. File Transcription — dávkové zpracování zvukových, video, obrázkových nebo PDF souborů

Live Transcription

Rozpoznávání řeči v reálném čase z mikrofonu nebo audio vstupního zařízení.

Hlasové moduly

ModulTypNejlepší pro
Google SpeechOnline APIVysoká přesnost, mnoho jazyků (výchozí)
WhisperLokální modelOffline použití, soukromí (modely tiny až large)
VoskOfflineLehký, rychlý, mnoho jazyků

Možnosti nahrávání

  • Výběr audio vstupního zařízení
  • Audio Format: MP3 nebo WAV
  • Audio Quality: low / medium / high
  • Volitelné nahrávání videa s náhledem kamery
  • Volitelná Speaker Classification (rozlišuje různé mluvčí)

Capture Transcription

Extrahujte text ze snímků obrazovky nebo z kamery pomocí OCR.

  • Camera capture — vyberte zařízení kamery, pořiďte jednotlivý snímek
  • Full screen capture — zachyťte celou obrazovku
  • Region selection — nakreslete obdélník pro zachycení konkrétní oblasti
  • Window capture — zachyťte konkrétní okno

OCR modul: Tesseract (výchozí japonština). Výsledky se zobrazují vedle zachyceného obrázku.


File Transcription

Zpracovávejte soubory dávkově přetažením nebo pomocí prohlížeče souborů.

Podporované formáty

TypFormátyMetoda
AudioMP3, WAV, M4A, FLAC, AAC, OGG, WMAHlasový modul
VideoMP4, AVI, MOV, MKV, WMV, FLVExtrakce zvuku → hlasový modul
ObrázekJPG, PNG, BMP, TIFF, GIFTesseract OCR
DokumentPDFStránka → obrázek → OCR

Workset History

  • Každá relace přepisu se ukládá jako workset
  • Filtrujte podle klíčového slova, typu (Live/Capture/File) a stavu
  • Dvojklikem znovu otevřete předchozí relaci
  • Tříditelné sloupce: název, typ, metoda, datum, stav

Nastavení

NastaveníPopisVýchozí
Recognition ModelVýchozí hlasový modulGoogle
Audio FormatFormát nahráváníWAV
Audio QualityÚroveň kompreseMedium
Video CapturePovolit nahrávání z kameryOff
Speaker ClassificationIdentifikace různých mluvčíchOff

Tipy

  • Offline přepis — Použijte Whisper nebo Vosk pro plně offline rozpoznávání řeči
  • Poznámky ze schůzek — Zapněte Speaker Classification pro rozlišení, kdo co řekl
  • Dávkové OCR — Přetáhněte celou složku skenovaných dokumentů pro dávkové zpracování
  • Extrakce PDF — Každá stránka PDF je převedena na obrázek a OCR zpracována samostatně

Soukromí

  • Moduly Whisper a Vosk běží zcela na vašem zařízení
  • Google Speech odesílá zvuk na servery Google k rozpoznání
  • Všechny výsledky přepisu a nahrávky jsou uloženy pouze na vašem lokálním disku
  • Žádná analytika ani sledování