Textnizer - Ghid

Extrageți text din vorbire, capturi de ecran și fișiere. Acceptă recunoașterea vocii în timp real, OCR pentru capturi de ecran și procesare în lot a fișierelor audio, video, imagine și PDF.


Primii pași

Alegeți unul dintre cele trei moduri de pe ecranul principal:

  1. Live Transcription — conversie vorbire-text în timp real de la microfon
  2. Capture Transcription — OCR din capturi de ecran sau cameră
  3. File Transcription — procesare în lot a fișierelor audio, video, imagine sau PDF

Live Transcription

Recunoaștere a vorbirii în timp real de la microfon sau dispozitiv de intrare audio.

Motoare vocale

MotorTipCel mai potrivit pentru
Google SpeechAPI onlinePrecizie ridicată, multe limbi (implicit)
WhisperModel localUtilizare offline, confidențialitate (modele tiny–large)
VoskOfflineUșor, rapid, multe limbi

Opțiuni de înregistrare

  • Selectarea dispozitivului de intrare audio
  • Audio Format: MP3 sau WAV
  • Audio Quality: low / medium / high
  • Înregistrare video opțională cu previzualizare a camerei
  • Speaker Classification opțional (identifică diferiți vorbitori)

Capture Transcription

Extrageți text din capturi de ecran sau capturi de cameră folosind OCR.

  • Camera capture — selectați un dispozitiv cameră, faceți o singură captură
  • Full screen capture — capturați întregul ecran
  • Region selection — desenați un dreptunghi pentru a captura o zonă specifică
  • Window capture — capturați o anumită fereastră

Motor OCR: Tesseract (japoneză implicit). Rezultatele apar lângă imaginea capturată.


File Transcription

Procesați fișiere în lot prin glisare și plasare sau folosind exploratorul de fișiere.

Formate acceptate

TipFormateMetodă
AudioMP3, WAV, M4A, FLAC, AAC, OGG, WMAMotor vocal
VideoMP4, AVI, MOV, MKV, WMV, FLVExtragere audio → motor vocal
ImagineJPG, PNG, BMP, TIFF, GIFTesseract OCR
DocumentPDFPagină → imagine → OCR

Workset History

  • Fiecare sesiune de transcriere se salvează ca workset
  • Filtrați după cuvânt-cheie, tip (Live/Capture/File) și stare
  • Faceți dublu clic pentru a redeschide o sesiune anterioară
  • Coloane sortabile: nume, tip, metodă, dată, stare

Setări

SetareDescriereImplicit
Recognition ModelMotor vocal implicitGoogle
Audio FormatFormat de înregistrareWAV
Audio QualityNivel de compresieMedium
Video CaptureActivează înregistrarea camereiOff
Speaker ClassificationIdentifică diferiți vorbitoriOff

Sfaturi

  • Transcriere offline — Folosiți Whisper sau Vosk pentru recunoaștere a vorbirii complet offline
  • Notițe de ședință — Activați Speaker Classification pentru a distinge cine ce a spus
  • OCR în lot — Plasați un întreg folder cu documente scanate pentru procesare în lot
  • Extragere PDF — Fiecare pagină PDF este convertită în imagine și OCR-ată individual

Confidențialitate

  • Motoarele Whisper și Vosk rulează în întregime pe dispozitivul dvs.
  • Google Speech trimite audio către serverele Google pentru recunoaștere
  • Toate rezultatele transcrierii și înregistrările sunt stocate doar pe discul local
  • Fără analize sau urmărire