Nyerjen ki szöveget beszédből, képernyőképekből és fájlokból. Támogatja a valós idejű hangfelismerést, képernyő OCR-jét és a hang-, videó-, kép- és PDF-fájlok kötegelt feldolgozását.
Első lépések
Válassza ki a három mód egyikét a főképernyőn:
- Live Transcription — valós idejű beszéd-szöveg átalakítás mikrofonról
- Capture Transcription — OCR képernyőképekből vagy kamerából
- File Transcription — hang-, videó-, kép- vagy PDF-fájlok kötegelt feldolgozása
Live Transcription
Valós idejű beszédfelismerés mikrofonról vagy hangbemeneti eszközről.
Beszédmotorok
| Motor | Típus | Legjobb erre |
|---|---|---|
| Google Speech | Online API | Magas pontosság, sok nyelv (alapértelmezett) |
| Whisper | Helyi modell | Offline használat, adatvédelem (tiny–large modellek) |
| Vosk | Offline | Könnyű, gyors, sok nyelv |
Felvételi beállítások
- Hangbemeneti eszköz kiválasztása
- Audio Format: MP3 vagy WAV
- Audio Quality: low / medium / high
- Opcionális videofelvétel kamera-előnézettel
- Opcionális Speaker Classification (megkülönbözteti a beszélőket)
Capture Transcription
Nyerjen ki szöveget képernyőképekből vagy kamerafelvételekből OCR-rel.
- Camera capture — válasszon kameraeszközt, készítsen egyetlen képet
- Full screen capture — rögzítse a teljes képernyőt
- Region selection — rajzoljon téglalapot egy adott terület rögzítéséhez
- Window capture — rögzítsen egy adott ablakot
OCR-motor: Tesseract (alapértelmezetten japán). Az eredmények a rögzített kép mellett jelennek meg.
File Transcription
Dolgozza fel a fájlokat kötegelten húzással és ejtéssel vagy a fájlböngésző segítségével.
Támogatott formátumok
| Típus | Formátumok | Módszer |
|---|---|---|
| Hang | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Beszédmotor |
| Videó | MP4, AVI, MOV, MKV, WMV, FLV | Hangkivonás → beszédmotor |
| Kép | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Dokumentum | Oldal → kép → OCR |
Workset History
- Minden átírási munkamenet worksetként mentődik
- Szűrjön kulcsszó, típus (Live/Capture/File) és állapot szerint
- Dupla kattintással újra megnyithatja a korábbi munkamenetet
- Rendezhető oszlopok: név, típus, módszer, dátum, állapot
Beállítások
| Beállítás | Leírás | Alapértelmezett |
|---|---|---|
| Recognition Model | Alapértelmezett beszédmotor | |
| Audio Format | Felvételi formátum | WAV |
| Audio Quality | Tömörítési szint | Medium |
| Video Capture | Kamerafelvétel engedélyezése | Off |
| Speaker Classification | Különböző beszélők azonosítása | Off |
Tippek
- Offline átírás — Használja a Whispert vagy Voskot teljesen offline beszédfelismeréshez
- Értekezleti jegyzetek — Engedélyezze a Speaker Classification funkciót, hogy megkülönböztethető legyen, ki mit mondott
- Kötegelt OCR — Ejtsen be egy egész mappa szkennelt dokumentumot kötegelt feldolgozásra
- PDF-kinyerés — Minden PDF-oldal képpé alakul és külön-külön OCR-feldolgozásra kerül
Adatvédelem
- A Whisper és Vosk motorok teljes egészében az Ön eszközén futnak
- A Google Speech a hangot felismerés céljából a Google szervereire küldi
- Minden átírási eredmény és felvétel kizárólag a helyi lemezen tárolódik
- Nincs analitika vagy követés