Textnizer - Guia

Extraia texto a partir de fala, capturas de tela e arquivos. Suporta reconhecimento de voz em tempo real, OCR de captura de tela e processamento em lote de áudio, vídeo, imagens e PDFs.


Primeiros passos

Escolha um dos três modos na tela principal:

  1. Live Transcription — conversão de fala em texto em tempo real a partir do seu microfone
  2. Capture Transcription — OCR a partir de capturas de tela ou câmera
  3. File Transcription — processa em lote arquivos de áudio, vídeo, imagem ou PDF

Live Transcription

Reconhecimento de voz em tempo real a partir do seu microfone ou dispositivo de entrada de áudio.

Mecanismos de fala

MecanismoTipoIdeal para
Google SpeechAPI on-lineAlta precisão, vários idiomas (padrão)
WhisperModelo localUso off-line, privacidade (modelos de tiny a large)
VoskOff-lineLeve, rápido, vários idiomas

Opções de gravação

  • Seleção do dispositivo de entrada de áudio
  • Audio Format: MP3 ou WAV
  • Audio Quality: baixa / média / alta
  • Captura de vídeo opcional com pré-visualização da câmera
  • Speaker Classification opcional (identifica diferentes falantes)

Capture Transcription

Extraia texto de capturas de tela ou da câmera usando OCR.

  • Camera capture — selecione um dispositivo de câmera e tire uma única foto
  • Full screen capture — captura a tela inteira
  • Region selection — desenhe um retângulo para capturar uma área específica
  • Window capture — captura uma janela específica

Mecanismo de OCR: Tesseract (japonês por padrão). Os resultados aparecem ao lado da imagem capturada.


File Transcription

Processe arquivos em lote arrastando e soltando ou usando o navegador de arquivos.

Formatos suportados

TipoFormatosMétodo
ÁudioMP3, WAV, M4A, FLAC, AAC, OGG, WMAMecanismo de fala
VídeoMP4, AVI, MOV, MKV, WMV, FLVExtração de áudio → mecanismo de fala
ImagemJPG, PNG, BMP, TIFF, GIFTesseract OCR
DocumentoPDFPágina → imagem → OCR

Histórico de worksets

  • Cada sessão de transcrição é salva como um workset
  • Filtre por palavra-chave, tipo (Live/Capture/File) e status
  • Clique duas vezes para reabrir uma sessão anterior
  • Colunas ordenáveis: nome, tipo, método, data, status

Configurações

ConfiguraçãoDescriçãoPadrão
Recognition ModelMecanismo de fala padrãoGoogle
Audio FormatFormato de gravaçãoWAV
Audio QualityNível de compressãoMedium
Video CaptureHabilitar gravação pela câmeraOff
Speaker ClassificationIdentificar diferentes falantesOff

Dicas

  • Transcrição off-line — Use Whisper ou Vosk para reconhecimento de voz totalmente off-line
  • Notas de reunião — Habilite Speaker Classification para distinguir quem disse o quê
  • OCR em lote — Solte uma pasta inteira de documentos digitalizados para processamento em lote
  • Extração de PDF — Cada página do PDF é convertida em imagem e processada individualmente por OCR

Privacidade

  • Os mecanismos Whisper e Vosk são executados inteiramente no seu dispositivo
  • O Google Speech envia áudio aos servidores do Google para reconhecimento
  • Todos os resultados de transcrição e gravações são armazenados apenas no seu disco local
  • Sem analytics ou rastreamento