Ekstrak teks daripada pertuturan, tangkapan skrin dan fail. Menyokong pengecaman suara masa nyata, OCR tangkapan skrin dan pemprosesan kelompok audio, video, imej dan PDF.
Bermula
Pilih salah satu daripada tiga mod daripada skrin utama:
- Live Transcription — pertuturan-ke-teks masa nyata daripada mikrofon anda
- Capture Transcription — OCR daripada tangkapan skrin atau kamera
- File Transcription — memproses fail audio, video, imej atau PDF secara berkelompok
Live Transcription
Pengecaman pertuturan masa nyata daripada mikrofon atau peranti input audio anda.
Enjin Pertuturan
| Enjin | Jenis | Sesuai untuk |
|---|---|---|
| Google Speech | API Dalam Talian | Ketepatan tinggi, banyak bahasa (default) |
| Whisper | Model tempatan | Penggunaan luar talian, privasi (model dari tiny hingga large) |
| Vosk | Luar talian | Ringan, pantas, banyak bahasa |
Pilihan Rakaman
- Pemilihan peranti input audio
- Audio Format: MP3 atau WAV
- Audio Quality: low / medium / high
- Video Capture pilihan dengan pratonton kamera
- Speaker Classification pilihan (mengenal pasti penutur berbeza)
Capture Transcription
Ekstrak teks daripada tangkapan skrin atau tangkapan kamera menggunakan OCR.
- Tangkapan kamera — pilih peranti kamera, ambil satu tangkapan
- Tangkapan skrin penuh — tangkap keseluruhan skrin
- Pemilihan kawasan — lukis segi empat tepat untuk menangkap kawasan tertentu
- Tangkapan tetingkap — tangkap tetingkap tertentu
Enjin OCR: Tesseract (Jepun secara lalai). Keputusan muncul di sebelah imej yang ditangkap.
File Transcription
Proses fail secara berkelompok dengan menyeret dan menjatuhkan atau menggunakan penyemak imbas fail.
Format yang Disokong
| Jenis | Format | Kaedah |
|---|---|---|
| Audio | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Enjin pertuturan |
| Video | MP4, AVI, MOV, MKV, WMV, FLV | Pengekstrakan audio → enjin pertuturan |
| Imej | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Dokumen | Halaman → imej → OCR |
Sejarah Workset
- Setiap sesi transkripsi disimpan sebagai workset
- Tapis mengikut kata kunci, jenis (Live/Capture/File), dan status
- Klik dua kali untuk membuka semula sesi sebelumnya
- Lajur yang boleh diisih: nama, jenis, kaedah, tarikh, status
Tetapan
| Tetapan | Penerangan | Lalai |
|---|---|---|
| Recognition Model | Enjin pertuturan lalai | |
| Audio Format | Format rakaman | WAV |
| Audio Quality | Tahap mampatan | Medium |
| Video Capture | Dayakan rakaman kamera | Off |
| Speaker Classification | Kenal pasti penutur berbeza | Off |
Petua
- Transkripsi luar talian — Gunakan Whisper atau Vosk untuk pengecaman pertuturan luar talian sepenuhnya
- Nota mesyuarat — Dayakan Speaker Classification untuk membezakan siapa berkata apa
- OCR Berkelompok — Lepaskan seluruh folder dokumen yang diimbas untuk pemprosesan berkelompok
- Pengekstrakan PDF — Setiap halaman PDF ditukar kepada imej dan diOCR secara berasingan
Privasi
- Enjin Whisper dan Vosk dijalankan sepenuhnya pada peranti anda
- Google Speech menghantar audio ke pelayan Google untuk pengecaman
- Semua keputusan transkripsi dan rakaman disimpan hanya pada cakera tempatan anda
- Tiada analitik atau penjejakan