Extreu text de la veu, captures de pantalla i fitxers. Admet reconeixement de veu en temps real, OCR de captura de pantalla i processament per lots d’àudio, vídeo, imatges i PDF.
Primers passos
Tria un dels tres modes a la pantalla principal:
- Live Transcription — conversió de veu a text en temps real des del teu micròfon
- Capture Transcription — OCR a partir de captures de pantalla o de càmera
- File Transcription — processa per lots fitxers d’àudio, vídeo, imatge o PDF
Live Transcription
Reconeixement de veu en temps real des del teu micròfon o dispositiu d’entrada d’àudio.
Motors de veu
| Motor | Tipus | Ideal per a |
|---|---|---|
| Google Speech | API en línia | Alta precisió, moltes llengües (per defecte) |
| Whisper | Model local | Ús sense connexió, privadesa (models de tiny a large) |
| Vosk | Sense connexió | Lleuger, ràpid, moltes llengües |
Opcions de gravació
- Selecció del dispositiu d’entrada d’àudio
- Audio Format: MP3 o WAV
- Audio Quality: baixa / mitjana / alta
- Captura de vídeo opcional amb previsualització de la càmera
- Speaker Classification opcional (identifica diferents parlants)
Capture Transcription
Extreu text de captures de pantalla o de la càmera mitjançant OCR.
- Camera capture — selecciona un dispositiu de càmera i fes una sola fotografia
- Full screen capture — captura tota la pantalla
- Region selection — dibuixa un rectangle per capturar una àrea específica
- Window capture — captura una finestra específica
Motor d’OCR: Tesseract (japonès per defecte). Els resultats apareixen al costat de la imatge capturada.
File Transcription
Processa fitxers per lots arrossegant i deixant anar o utilitzant el navegador de fitxers.
Formats admesos
| Tipus | Formats | Mètode |
|---|---|---|
| Àudio | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Motor de veu |
| Vídeo | MP4, AVI, MOV, MKV, WMV, FLV | Extracció d’àudio → motor de veu |
| Imatge | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Document | Pàgina → imatge → OCR |
Historial de worksets
- Cada sessió de transcripció es desa com a workset
- Filtra per paraula clau, tipus (Live/Capture/File) i estat
- Fes doble clic per reobrir una sessió anterior
- Columnes ordenables: nom, tipus, mètode, data, estat
Configuració
| Paràmetre | Descripció | Per defecte |
|---|---|---|
| Recognition Model | Motor de veu predeterminat | |
| Audio Format | Format de gravació | WAV |
| Audio Quality | Nivell de compressió | Medium |
| Video Capture | Activa la gravació amb càmera | Off |
| Speaker Classification | Identifica diferents parlants | Off |
Consells
- Transcripció sense connexió — Utilitza Whisper o Vosk per a un reconeixement de veu totalment sense connexió
- Notes de reunió — Activa Speaker Classification per distingir qui ha dit què
- OCR per lots — Deixa anar una carpeta sencera de documents escanejats per processar-los per lots
- Extracció de PDF — Cada pàgina del PDF es converteix en imatge i es processa individualment amb OCR
Privadesa
- Els motors Whisper i Vosk s’executen totalment al teu dispositiu
- Google Speech envia àudio als servidors de Google per al reconeixement
- Tots els resultats de transcripció i enregistraments es desen només al teu disc local
- Sense analítica ni seguiment