Textnizer - Guía

Extrae texto de voz, capturas de pantalla y archivos. Compatible con reconocimiento de voz en tiempo real, OCR de captura de pantalla y procesamiento por lotes de audio, vídeo, imágenes y PDFs.


Primeros pasos

Elige uno de los tres modos en la pantalla principal:

  1. Live Transcription — conversión de voz a texto en tiempo real desde tu micrófono
  2. Capture Transcription — OCR a partir de capturas de pantalla o de la cámara
  3. File Transcription — procesa por lotes archivos de audio, vídeo, imagen o PDF

Live Transcription

Reconocimiento de voz en tiempo real desde tu micrófono o dispositivo de entrada de audio.

Motores de voz

MotorTipoIdeal para
Google SpeechAPI en líneaAlta precisión, muchos idiomas (predeterminado)
WhisperModelo localUso sin conexión, privacidad (modelos de tiny a large)
VoskSin conexiónLigero, rápido, muchos idiomas

Opciones de grabación

  • Selección del dispositivo de entrada de audio
  • Audio Format: MP3 o WAV
  • Audio Quality: baja / media / alta
  • Captura de vídeo opcional con vista previa de la cámara
  • Speaker Classification opcional (identifica a los distintos hablantes)

Capture Transcription

Extrae texto de capturas de pantalla o de la cámara mediante OCR.

  • Camera capture — selecciona un dispositivo de cámara y toma una sola foto
  • Full screen capture — captura toda la pantalla
  • Region selection — dibuja un rectángulo para capturar un área específica
  • Window capture — captura una ventana específica

Motor de OCR: Tesseract (japonés por defecto). Los resultados aparecen junto a la imagen capturada.


File Transcription

Procesa archivos por lotes arrastrando y soltando o usando el navegador de archivos.

Formatos compatibles

TipoFormatosMétodo
AudioMP3, WAV, M4A, FLAC, AAC, OGG, WMAMotor de voz
VídeoMP4, AVI, MOV, MKV, WMV, FLVExtracción de audio → motor de voz
ImagenJPG, PNG, BMP, TIFF, GIFTesseract OCR
DocumentoPDFPágina → imagen → OCR

Historial de worksets

  • Cada sesión de transcripción se guarda como un workset
  • Filtra por palabra clave, tipo (Live/Capture/File) y estado
  • Haz doble clic para reabrir una sesión anterior
  • Columnas ordenables: nombre, tipo, método, fecha, estado

Configuración

AjusteDescripciónPredeterminado
Recognition ModelMotor de voz predeterminadoGoogle
Audio FormatFormato de grabaciónWAV
Audio QualityNivel de compresiónMedium
Video CaptureHabilitar grabación con cámaraOff
Speaker ClassificationIdentificar a los distintos hablantesOff

Consejos

  • Transcripción sin conexión — Usa Whisper o Vosk para un reconocimiento de voz completamente sin conexión
  • Notas de reunión — Habilita Speaker Classification para distinguir quién dijo qué
  • OCR por lotes — Suelta una carpeta entera de documentos escaneados para procesarlos por lotes
  • Extracción de PDF — Cada página del PDF se convierte en imagen y se procesa individualmente con OCR

Privacidad

  • Los motores Whisper y Vosk se ejecutan totalmente en tu dispositivo
  • Google Speech envía audio a los servidores de Google para el reconocimiento
  • Todos los resultados de transcripción y las grabaciones se almacenan únicamente en tu disco local
  • Sin analítica ni seguimiento