Konuşma, ekran görüntüleri ve dosyalardan metin çıkarın. Gerçek zamanlı ses tanıma, ekran görüntüsü OCR ve ses, video, görüntü ve PDF'lerin toplu işlemesini destekler.
Başlarken
Ana ekrandan üç moddan birini seçin:
- Live Transcription — mikrofonunuzdan gerçek zamanlı konuşmadan metne
- Capture Transcription — ekran görüntülerinden veya kameradan OCR
- File Transcription — ses, video, görüntü veya PDF dosyalarını toplu işleme
Live Transcription
Mikrofonunuzdan veya ses giriş aygıtınızdan gerçek zamanlı konuşma tanıma.
Konuşma motorları
| Motor | Tür | En uygun kullanım |
|---|---|---|
| Google Speech | Çevrimiçi API | Yüksek doğruluk, birçok dil (default) |
| Whisper | Yerel model | Çevrimdışı kullanım, gizlilik (tiny ile large arası modeller) |
| Vosk | Çevrimdışı | Hafif, hızlı, birçok dil |
Kayıt seçenekleri
- Ses giriş aygıtı seçimi
- Audio Format: MP3 veya WAV
- Audio Quality: low / medium / high
- Kamera önizlemeli isteğe bağlı Video Capture
- İsteğe bağlı Speaker Classification (farklı konuşmacıları tanımlar)
Capture Transcription
OCR kullanarak ekran görüntülerinden veya kamera çekimlerinden metin çıkarın.
- Kamera çekimi — bir kamera aygıtı seçin, tek bir çekim alın
- Tam ekran çekimi — tüm ekranı yakalayın
- Bölge seçimi — belirli bir alanı yakalamak için bir dikdörtgen çizin
- Pencere çekimi — belirli bir pencereyi yakalayın
OCR motoru: Tesseract (varsayılan olarak Japonca). Sonuçlar yakalanan görüntünün yanında görünür.
File Transcription
Sürükle ve bırakarak veya dosya tarayıcısını kullanarak dosyaları toplu olarak işleyin.
Desteklenen formatlar
| Tür | Formatlar | Yöntem |
|---|---|---|
| Ses | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Konuşma motoru |
| Video | MP4, AVI, MOV, MKV, WMV, FLV | Ses çıkarma → konuşma motoru |
| Görüntü | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Belge | Sayfa → görüntü → OCR |
Workset geçmişi
- Her transkripsiyon oturumu bir workset olarak kaydedilir
- Anahtar kelime, tür (Live/Capture/File) ve duruma göre filtreleyin
- Önceki bir oturumu yeniden açmak için çift tıklayın
- Sıralanabilir sütunlar: ad, tür, yöntem, tarih, durum
Ayarlar
| Ayar | Açıklama | Varsayılan |
|---|---|---|
| Recognition Model | Varsayılan konuşma motoru | |
| Audio Format | Kayıt formatı | WAV |
| Audio Quality | Sıkıştırma seviyesi | Medium |
| Video Capture | Kamera kaydını etkinleştir | Off |
| Speaker Classification | Farklı konuşmacıları tanımla | Off |
İpuçları
- Çevrimdışı transkripsiyon — Tamamen çevrimdışı konuşma tanıma için Whisper veya Vosk kullanın
- Toplantı notları — Kimin ne söylediğini ayırt etmek için Speaker Classification'ı etkinleştirin
- Toplu OCR — Toplu işleme için taranmış belgelerin tüm bir klasörünü bırakın
- PDF çıkarma — Her PDF sayfası bir görüntüye dönüştürülür ve ayrı ayrı OCR'lanır
Gizlilik
- Whisper ve Vosk motorları tamamen cihazınızda çalışır
- Google Speech, tanıma için sesi Google sunucularına gönderir
- Tüm transkripsiyon sonuçları ve kayıtlar yalnızca yerel diskinizde saklanır
- Analitik veya izleme yok