Extrae texto de voz, capturas de pantalla y archivos. Compatible con reconocimiento de voz en tiempo real, OCR de captura de pantalla y procesamiento por lotes de audio, vídeo, imágenes y PDFs.
Primeros pasos
Elige uno de los tres modos en la pantalla principal:
- Live Transcription — conversión de voz a texto en tiempo real desde tu micrófono
- Capture Transcription — OCR a partir de capturas de pantalla o de la cámara
- File Transcription — procesa por lotes archivos de audio, vídeo, imagen o PDF
Live Transcription
Reconocimiento de voz en tiempo real desde tu micrófono o dispositivo de entrada de audio.
Motores de voz
| Motor | Tipo | Ideal para |
|---|---|---|
| Google Speech | API en línea | Alta precisión, muchos idiomas (predeterminado) |
| Whisper | Modelo local | Uso sin conexión, privacidad (modelos de tiny a large) |
| Vosk | Sin conexión | Ligero, rápido, muchos idiomas |
Opciones de grabación
- Selección del dispositivo de entrada de audio
- Audio Format: MP3 o WAV
- Audio Quality: baja / media / alta
- Captura de vídeo opcional con vista previa de la cámara
- Speaker Classification opcional (identifica a los distintos hablantes)
Capture Transcription
Extrae texto de capturas de pantalla o de la cámara mediante OCR.
- Camera capture — selecciona un dispositivo de cámara y toma una sola foto
- Full screen capture — captura toda la pantalla
- Region selection — dibuja un rectángulo para capturar un área específica
- Window capture — captura una ventana específica
Motor de OCR: Tesseract (japonés por defecto). Los resultados aparecen junto a la imagen capturada.
File Transcription
Procesa archivos por lotes arrastrando y soltando o usando el navegador de archivos.
Formatos compatibles
| Tipo | Formatos | Método |
|---|---|---|
| Audio | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Motor de voz |
| Vídeo | MP4, AVI, MOV, MKV, WMV, FLV | Extracción de audio → motor de voz |
| Imagen | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Documento | Página → imagen → OCR |
Historial de worksets
- Cada sesión de transcripción se guarda como un workset
- Filtra por palabra clave, tipo (Live/Capture/File) y estado
- Haz doble clic para reabrir una sesión anterior
- Columnas ordenables: nombre, tipo, método, fecha, estado
Configuración
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Recognition Model | Motor de voz predeterminado | |
| Audio Format | Formato de grabación | WAV |
| Audio Quality | Nivel de compresión | Medium |
| Video Capture | Habilitar grabación con cámara | Off |
| Speaker Classification | Identificar a los distintos hablantes | Off |
Consejos
- Transcripción sin conexión — Usa Whisper o Vosk para un reconocimiento de voz completamente sin conexión
- Notas de reunión — Habilita Speaker Classification para distinguir quién dijo qué
- OCR por lotes — Suelta una carpeta entera de documentos escaneados para procesarlos por lotes
- Extracción de PDF — Cada página del PDF se convierte en imagen y se procesa individualmente con OCR
Privacidad
- Los motores Whisper y Vosk se ejecutan totalmente en tu dispositivo
- Google Speech envía audio a los servidores de Google para el reconocimiento
- Todos los resultados de transcripción y las grabaciones se almacenan únicamente en tu disco local
- Sin analítica ni seguimiento