Textnizer - Panduan

Ekstrak teks daripada pertuturan, tangkapan skrin dan fail. Menyokong pengecaman suara masa nyata, OCR tangkapan skrin dan pemprosesan kelompok audio, video, imej dan PDF.


Bermula

Pilih salah satu daripada tiga mod daripada skrin utama:

  1. Live Transcription — pertuturan-ke-teks masa nyata daripada mikrofon anda
  2. Capture Transcription — OCR daripada tangkapan skrin atau kamera
  3. File Transcription — memproses fail audio, video, imej atau PDF secara berkelompok

Live Transcription

Pengecaman pertuturan masa nyata daripada mikrofon atau peranti input audio anda.

Enjin Pertuturan

EnjinJenisSesuai untuk
Google SpeechAPI Dalam TalianKetepatan tinggi, banyak bahasa (default)
WhisperModel tempatanPenggunaan luar talian, privasi (model dari tiny hingga large)
VoskLuar talianRingan, pantas, banyak bahasa

Pilihan Rakaman

  • Pemilihan peranti input audio
  • Audio Format: MP3 atau WAV
  • Audio Quality: low / medium / high
  • Video Capture pilihan dengan pratonton kamera
  • Speaker Classification pilihan (mengenal pasti penutur berbeza)

Capture Transcription

Ekstrak teks daripada tangkapan skrin atau tangkapan kamera menggunakan OCR.

  • Tangkapan kamera — pilih peranti kamera, ambil satu tangkapan
  • Tangkapan skrin penuh — tangkap keseluruhan skrin
  • Pemilihan kawasan — lukis segi empat tepat untuk menangkap kawasan tertentu
  • Tangkapan tetingkap — tangkap tetingkap tertentu

Enjin OCR: Tesseract (Jepun secara lalai). Keputusan muncul di sebelah imej yang ditangkap.


File Transcription

Proses fail secara berkelompok dengan menyeret dan menjatuhkan atau menggunakan penyemak imbas fail.

Format yang Disokong

JenisFormatKaedah
AudioMP3, WAV, M4A, FLAC, AAC, OGG, WMAEnjin pertuturan
VideoMP4, AVI, MOV, MKV, WMV, FLVPengekstrakan audio → enjin pertuturan
ImejJPG, PNG, BMP, TIFF, GIFTesseract OCR
DokumenPDFHalaman → imej → OCR

Sejarah Workset

  • Setiap sesi transkripsi disimpan sebagai workset
  • Tapis mengikut kata kunci, jenis (Live/Capture/File), dan status
  • Klik dua kali untuk membuka semula sesi sebelumnya
  • Lajur yang boleh diisih: nama, jenis, kaedah, tarikh, status

Tetapan

TetapanPeneranganLalai
Recognition ModelEnjin pertuturan lalaiGoogle
Audio FormatFormat rakamanWAV
Audio QualityTahap mampatanMedium
Video CaptureDayakan rakaman kameraOff
Speaker ClassificationKenal pasti penutur berbezaOff

Petua

  • Transkripsi luar talian — Gunakan Whisper atau Vosk untuk pengecaman pertuturan luar talian sepenuhnya
  • Nota mesyuarat — Dayakan Speaker Classification untuk membezakan siapa berkata apa
  • OCR Berkelompok — Lepaskan seluruh folder dokumen yang diimbas untuk pemprosesan berkelompok
  • Pengekstrakan PDF — Setiap halaman PDF ditukar kepada imej dan diOCR secara berasingan

Privasi

  • Enjin Whisper dan Vosk dijalankan sepenuhnya pada peranti anda
  • Google Speech menghantar audio ke pelayan Google untuk pengecaman
  • Semua keputusan transkripsi dan rakaman disimpan hanya pada cakera tempatan anda
  • Tiada analitik atau penjejakan