Extraia texto a partir de fala, capturas de tela e arquivos. Suporta reconhecimento de voz em tempo real, OCR de captura de tela e processamento em lote de áudio, vídeo, imagens e PDFs.
Primeiros passos
Escolha um dos três modos na tela principal:
- Live Transcription — conversão de fala em texto em tempo real a partir do seu microfone
- Capture Transcription — OCR a partir de capturas de tela ou câmera
- File Transcription — processa em lote arquivos de áudio, vídeo, imagem ou PDF
Live Transcription
Reconhecimento de voz em tempo real a partir do seu microfone ou dispositivo de entrada de áudio.
Mecanismos de fala
| Mecanismo | Tipo | Ideal para |
|---|---|---|
| Google Speech | API on-line | Alta precisão, vários idiomas (padrão) |
| Whisper | Modelo local | Uso off-line, privacidade (modelos de tiny a large) |
| Vosk | Off-line | Leve, rápido, vários idiomas |
Opções de gravação
- Seleção do dispositivo de entrada de áudio
- Audio Format: MP3 ou WAV
- Audio Quality: baixa / média / alta
- Captura de vídeo opcional com pré-visualização da câmera
- Speaker Classification opcional (identifica diferentes falantes)
Capture Transcription
Extraia texto de capturas de tela ou da câmera usando OCR.
- Camera capture — selecione um dispositivo de câmera e tire uma única foto
- Full screen capture — captura a tela inteira
- Region selection — desenhe um retângulo para capturar uma área específica
- Window capture — captura uma janela específica
Mecanismo de OCR: Tesseract (japonês por padrão). Os resultados aparecem ao lado da imagem capturada.
File Transcription
Processe arquivos em lote arrastando e soltando ou usando o navegador de arquivos.
Formatos suportados
| Tipo | Formatos | Método |
|---|---|---|
| Áudio | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Mecanismo de fala |
| Vídeo | MP4, AVI, MOV, MKV, WMV, FLV | Extração de áudio → mecanismo de fala |
| Imagem | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Documento | Página → imagem → OCR |
Histórico de worksets
- Cada sessão de transcrição é salva como um workset
- Filtre por palavra-chave, tipo (Live/Capture/File) e status
- Clique duas vezes para reabrir uma sessão anterior
- Colunas ordenáveis: nome, tipo, método, data, status
Configurações
| Configuração | Descrição | Padrão |
|---|---|---|
| Recognition Model | Mecanismo de fala padrão | |
| Audio Format | Formato de gravação | WAV |
| Audio Quality | Nível de compressão | Medium |
| Video Capture | Habilitar gravação pela câmera | Off |
| Speaker Classification | Identificar diferentes falantes | Off |
Dicas
- Transcrição off-line — Use Whisper ou Vosk para reconhecimento de voz totalmente off-line
- Notas de reunião — Habilite Speaker Classification para distinguir quem disse o quê
- OCR em lote — Solte uma pasta inteira de documentos digitalizados para processamento em lote
- Extração de PDF — Cada página do PDF é convertida em imagem e processada individualmente por OCR
Privacidade
- Os mecanismos Whisper e Vosk são executados inteiramente no seu dispositivo
- O Google Speech envia áudio aos servidores do Google para reconhecimento
- Todos os resultados de transcrição e gravações são armazenados apenas no seu disco local
- Sem analytics ou rastreamento