Wyodrębniaj tekst z mowy, zrzutów ekranu i plików. Obsługuje rozpoznawanie głosu w czasie rzeczywistym, OCR przechwyconych zrzutów ekranu oraz przetwarzanie wsadowe plików audio, wideo, obrazów i PDF.
Pierwsze kroki
Wybierz jeden z trzech trybów na ekranie głównym:
- Live Transcription — zamiana mowy na tekst w czasie rzeczywistym z mikrofonu
- Capture Transcription — OCR ze zrzutów ekranu lub kamery
- File Transcription — wsadowe przetwarzanie plików audio, wideo, obrazów lub PDF
Live Transcription
Rozpoznawanie mowy w czasie rzeczywistym z mikrofonu lub urządzenia wejścia audio.
Silniki rozpoznawania mowy
| Silnik | Typ | Najlepszy do |
|---|---|---|
| Google Speech | API online | Wysoka dokładność, wiele języków (domyślny) |
| Whisper | Model lokalny | Praca offline, prywatność (modele od tiny do large) |
| Vosk | Offline | Lekki, szybki, wiele języków |
Opcje nagrywania
- Wybór urządzenia wejścia audio
- Audio Format: MP3 lub WAV
- Audio Quality: low / medium / high
- Opcjonalne nagrywanie wideo z podglądem kamery
- Opcjonalna Speaker Classification (rozpoznawanie różnych mówców)
Capture Transcription
Wyodrębniaj tekst ze zrzutów ekranu lub zdjęć z kamery przy użyciu OCR.
- Camera capture — wybierz urządzenie kamery, zrób pojedyncze zdjęcie
- Full screen capture — przechwyć cały ekran
- Region selection — narysuj prostokąt, aby uchwycić określony obszar
- Window capture — przechwyć określone okno
Silnik OCR: Tesseract (domyślnie japoński). Wyniki pojawiają się obok zrobionego zrzutu.
File Transcription
Przetwarzaj pliki wsadowo, przeciągając je i upuszczając lub korzystając z przeglądarki plików.
Obsługiwane formaty
| Typ | Formaty | Metoda |
|---|---|---|
| Audio | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Silnik mowy |
| Wideo | MP4, AVI, MOV, MKV, WMV, FLV | Ekstrakcja audio → silnik mowy |
| Obraz | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Dokument | Strona → obraz → OCR |
Workset History
- Każda sesja transkrypcji jest zapisywana jako workset
- Filtruj według słowa kluczowego, typu (Live/Capture/File) i statusu
- Kliknij dwukrotnie, aby ponownie otworzyć poprzednią sesję
- Sortowalne kolumny: nazwa, typ, metoda, data, status
Ustawienia
| Ustawienie | Opis | Domyślnie |
|---|---|---|
| Recognition Model | Domyślny silnik rozpoznawania mowy | |
| Audio Format | Format nagrywania | WAV |
| Audio Quality | Poziom kompresji | Medium |
| Video Capture | Włącz nagrywanie z kamery | Off |
| Speaker Classification | Identyfikacja różnych mówców | Off |
Wskazówki
- Transkrypcja offline — Użyj Whisper lub Vosk dla całkowicie offline rozpoznawania mowy
- Notatki ze spotkań — Włącz Speaker Classification, aby rozróżnić, kto co powiedział
- Wsadowy OCR — Upuść cały folder skanowanych dokumentów do przetwarzania wsadowego
- Ekstrakcja PDF — Każda strona PDF jest zamieniana na obraz i przetwarzana przez OCR osobno
Prywatność
- Silniki Whisper i Vosk działają w całości na Twoim urządzeniu
- Google Speech wysyła audio na serwery Google w celu rozpoznania
- Wszystkie wyniki transkrypcji i nagrania są przechowywane wyłącznie na lokalnym dysku
- Brak analityki ani śledzenia