Textnizer - Guia

Extreu text de la veu, captures de pantalla i fitxers. Admet reconeixement de veu en temps real, OCR de captura de pantalla i processament per lots d’àudio, vídeo, imatges i PDF.


Primers passos

Tria un dels tres modes a la pantalla principal:

  1. Live Transcription — conversió de veu a text en temps real des del teu micròfon
  2. Capture Transcription — OCR a partir de captures de pantalla o de càmera
  3. File Transcription — processa per lots fitxers d’àudio, vídeo, imatge o PDF

Live Transcription

Reconeixement de veu en temps real des del teu micròfon o dispositiu d’entrada d’àudio.

Motors de veu

MotorTipusIdeal per a
Google SpeechAPI en líniaAlta precisió, moltes llengües (per defecte)
WhisperModel localÚs sense connexió, privadesa (models de tiny a large)
VoskSense connexióLleuger, ràpid, moltes llengües

Opcions de gravació

  • Selecció del dispositiu d’entrada d’àudio
  • Audio Format: MP3 o WAV
  • Audio Quality: baixa / mitjana / alta
  • Captura de vídeo opcional amb previsualització de la càmera
  • Speaker Classification opcional (identifica diferents parlants)

Capture Transcription

Extreu text de captures de pantalla o de la càmera mitjançant OCR.

  • Camera capture — selecciona un dispositiu de càmera i fes una sola fotografia
  • Full screen capture — captura tota la pantalla
  • Region selection — dibuixa un rectangle per capturar una àrea específica
  • Window capture — captura una finestra específica

Motor d’OCR: Tesseract (japonès per defecte). Els resultats apareixen al costat de la imatge capturada.


File Transcription

Processa fitxers per lots arrossegant i deixant anar o utilitzant el navegador de fitxers.

Formats admesos

TipusFormatsMètode
ÀudioMP3, WAV, M4A, FLAC, AAC, OGG, WMAMotor de veu
VídeoMP4, AVI, MOV, MKV, WMV, FLVExtracció d’àudio → motor de veu
ImatgeJPG, PNG, BMP, TIFF, GIFTesseract OCR
DocumentPDFPàgina → imatge → OCR

Historial de worksets

  • Cada sessió de transcripció es desa com a workset
  • Filtra per paraula clau, tipus (Live/Capture/File) i estat
  • Fes doble clic per reobrir una sessió anterior
  • Columnes ordenables: nom, tipus, mètode, data, estat

Configuració

ParàmetreDescripcióPer defecte
Recognition ModelMotor de veu predeterminatGoogle
Audio FormatFormat de gravacióWAV
Audio QualityNivell de compressióMedium
Video CaptureActiva la gravació amb càmeraOff
Speaker ClassificationIdentifica diferents parlantsOff

Consells

  • Transcripció sense connexió — Utilitza Whisper o Vosk per a un reconeixement de veu totalment sense connexió
  • Notes de reunió — Activa Speaker Classification per distingir qui ha dit què
  • OCR per lots — Deixa anar una carpeta sencera de documents escanejats per processar-los per lots
  • Extracció de PDF — Cada pàgina del PDF es converteix en imatge i es processa individualment amb OCR

Privadesa

  • Els motors Whisper i Vosk s’executen totalment al teu dispositiu
  • Google Speech envia àudio als servidors de Google per al reconeixement
  • Tots els resultats de transcripció i enregistraments es desen només al teu disc local
  • Sense analítica ni seguiment