Trích xuất văn bản từ giọng nói, ảnh chụp màn hình và tệp. Hỗ trợ nhận dạng giọng nói thời gian thực, OCR ảnh chụp màn hình và xử lý hàng loạt âm thanh, video, hình ảnh và PDF.
Bắt đầu
Chọn một trong ba chế độ từ màn hình chính:
- Live Transcription — chuyển giọng nói thành văn bản theo thời gian thực từ micrô của bạn
- Capture Transcription — OCR từ ảnh chụp màn hình hoặc camera
- File Transcription — xử lý hàng loạt tệp âm thanh, video, hình ảnh hoặc PDF
Live Transcription
Nhận dạng giọng nói thời gian thực từ micrô hoặc thiết bị đầu vào âm thanh của bạn.
Công cụ giọng nói
| Công cụ | Loại | Phù hợp nhất cho |
|---|---|---|
| Google Speech | API trực tuyến | Độ chính xác cao, nhiều ngôn ngữ (default) |
| Whisper | Mô hình cục bộ | Sử dụng ngoại tuyến, quyền riêng tư (mô hình từ tiny đến large) |
| Vosk | Ngoại tuyến | Nhẹ, nhanh, nhiều ngôn ngữ |
Tùy chọn ghi âm
- Lựa chọn thiết bị đầu vào âm thanh
- Audio Format: MP3 hoặc WAV
- Audio Quality: low / medium / high
- Video Capture tùy chọn với xem trước camera
- Speaker Classification tùy chọn (nhận dạng các người nói khác nhau)
Capture Transcription
Trích xuất văn bản từ ảnh chụp màn hình hoặc ảnh chụp camera bằng cách sử dụng OCR.
- Chụp camera — chọn thiết bị camera, chụp một ảnh
- Chụp toàn màn hình — chụp toàn bộ màn hình
- Chọn vùng — vẽ một hình chữ nhật để chụp một khu vực cụ thể
- Chụp cửa sổ — chụp một cửa sổ cụ thể
Công cụ OCR: Tesseract (mặc định là tiếng Nhật). Kết quả xuất hiện bên cạnh hình ảnh đã chụp.
File Transcription
Xử lý hàng loạt tệp bằng cách kéo và thả hoặc sử dụng trình duyệt tệp.
Định dạng được hỗ trợ
| Loại | Định dạng | Phương pháp |
|---|---|---|
| Âm thanh | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Công cụ giọng nói |
| Video | MP4, AVI, MOV, MKV, WMV, FLV | Trích xuất âm thanh → công cụ giọng nói |
| Hình ảnh | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Tài liệu | Trang → hình ảnh → OCR |
Lịch sử Workset
- Mỗi phiên phiên âm được lưu thành một workset
- Lọc theo từ khóa, loại (Live/Capture/File) và trạng thái
- Nhấp đúp để mở lại một phiên trước đó
- Các cột có thể sắp xếp: tên, loại, phương pháp, ngày, trạng thái
Cài đặt
| Cài đặt | Mô tả | Mặc định |
|---|---|---|
| Recognition Model | Công cụ giọng nói mặc định | |
| Audio Format | Định dạng ghi âm | WAV |
| Audio Quality | Mức nén | Medium |
| Video Capture | Bật ghi camera | Off |
| Speaker Classification | Nhận dạng các người nói khác nhau | Off |
Mẹo
- Phiên âm ngoại tuyến — Sử dụng Whisper hoặc Vosk để nhận dạng giọng nói hoàn toàn ngoại tuyến
- Ghi chú cuộc họp — Bật Speaker Classification để phân biệt ai đã nói gì
- OCR hàng loạt — Thả toàn bộ thư mục tài liệu đã quét để xử lý hàng loạt
- Trích xuất PDF — Mỗi trang PDF được chuyển đổi thành hình ảnh và được OCR riêng
Quyền riêng tư
- Công cụ Whisper và Vosk chạy hoàn toàn trên thiết bị của bạn
- Google Speech gửi âm thanh đến máy chủ của Google để nhận dạng
- Tất cả kết quả phiên âm và bản ghi chỉ được lưu trữ trên đĩa cục bộ của bạn
- Không có phân tích hoặc theo dõi