Textnizer - Hướng dẫn

Trích xuất văn bản từ giọng nói, ảnh chụp màn hình và tệp. Hỗ trợ nhận dạng giọng nói thời gian thực, OCR ảnh chụp màn hình và xử lý hàng loạt âm thanh, video, hình ảnh và PDF.


Bắt đầu

Chọn một trong ba chế độ từ màn hình chính:

  1. Live Transcription — chuyển giọng nói thành văn bản theo thời gian thực từ micrô của bạn
  2. Capture Transcription — OCR từ ảnh chụp màn hình hoặc camera
  3. File Transcription — xử lý hàng loạt tệp âm thanh, video, hình ảnh hoặc PDF

Live Transcription

Nhận dạng giọng nói thời gian thực từ micrô hoặc thiết bị đầu vào âm thanh của bạn.

Công cụ giọng nói

Công cụLoạiPhù hợp nhất cho
Google SpeechAPI trực tuyếnĐộ chính xác cao, nhiều ngôn ngữ (default)
WhisperMô hình cục bộSử dụng ngoại tuyến, quyền riêng tư (mô hình từ tiny đến large)
VoskNgoại tuyếnNhẹ, nhanh, nhiều ngôn ngữ

Tùy chọn ghi âm

  • Lựa chọn thiết bị đầu vào âm thanh
  • Audio Format: MP3 hoặc WAV
  • Audio Quality: low / medium / high
  • Video Capture tùy chọn với xem trước camera
  • Speaker Classification tùy chọn (nhận dạng các người nói khác nhau)

Capture Transcription

Trích xuất văn bản từ ảnh chụp màn hình hoặc ảnh chụp camera bằng cách sử dụng OCR.

  • Chụp camera — chọn thiết bị camera, chụp một ảnh
  • Chụp toàn màn hình — chụp toàn bộ màn hình
  • Chọn vùng — vẽ một hình chữ nhật để chụp một khu vực cụ thể
  • Chụp cửa sổ — chụp một cửa sổ cụ thể

Công cụ OCR: Tesseract (mặc định là tiếng Nhật). Kết quả xuất hiện bên cạnh hình ảnh đã chụp.


File Transcription

Xử lý hàng loạt tệp bằng cách kéo và thả hoặc sử dụng trình duyệt tệp.

Định dạng được hỗ trợ

LoạiĐịnh dạngPhương pháp
Âm thanhMP3, WAV, M4A, FLAC, AAC, OGG, WMACông cụ giọng nói
VideoMP4, AVI, MOV, MKV, WMV, FLVTrích xuất âm thanh → công cụ giọng nói
Hình ảnhJPG, PNG, BMP, TIFF, GIFTesseract OCR
Tài liệuPDFTrang → hình ảnh → OCR

Lịch sử Workset

  • Mỗi phiên phiên âm được lưu thành một workset
  • Lọc theo từ khóa, loại (Live/Capture/File) và trạng thái
  • Nhấp đúp để mở lại một phiên trước đó
  • Các cột có thể sắp xếp: tên, loại, phương pháp, ngày, trạng thái

Cài đặt

Cài đặtMô tảMặc định
Recognition ModelCông cụ giọng nói mặc địnhGoogle
Audio FormatĐịnh dạng ghi âmWAV
Audio QualityMức nénMedium
Video CaptureBật ghi cameraOff
Speaker ClassificationNhận dạng các người nói khác nhauOff

Mẹo

  • Phiên âm ngoại tuyến — Sử dụng Whisper hoặc Vosk để nhận dạng giọng nói hoàn toàn ngoại tuyến
  • Ghi chú cuộc họp — Bật Speaker Classification để phân biệt ai đã nói gì
  • OCR hàng loạt — Thả toàn bộ thư mục tài liệu đã quét để xử lý hàng loạt
  • Trích xuất PDF — Mỗi trang PDF được chuyển đổi thành hình ảnh và được OCR riêng

Quyền riêng tư

  • Công cụ Whisper và Vosk chạy hoàn toàn trên thiết bị của bạn
  • Google Speech gửi âm thanh đến máy chủ của Google để nhận dạng
  • Tất cả kết quả phiên âm và bản ghi chỉ được lưu trữ trên đĩa cục bộ của bạn
  • Không có phân tích hoặc theo dõi