Textnizer - Rehber

Konuşma, ekran görüntüleri ve dosyalardan metin çıkarın. Gerçek zamanlı ses tanıma, ekran görüntüsü OCR ve ses, video, görüntü ve PDF'lerin toplu işlemesini destekler.


Başlarken

Ana ekrandan üç moddan birini seçin:

  1. Live Transcription — mikrofonunuzdan gerçek zamanlı konuşmadan metne
  2. Capture Transcription — ekran görüntülerinden veya kameradan OCR
  3. File Transcription — ses, video, görüntü veya PDF dosyalarını toplu işleme

Live Transcription

Mikrofonunuzdan veya ses giriş aygıtınızdan gerçek zamanlı konuşma tanıma.

Konuşma motorları

MotorTürEn uygun kullanım
Google SpeechÇevrimiçi APIYüksek doğruluk, birçok dil (default)
WhisperYerel modelÇevrimdışı kullanım, gizlilik (tiny ile large arası modeller)
VoskÇevrimdışıHafif, hızlı, birçok dil

Kayıt seçenekleri

  • Ses giriş aygıtı seçimi
  • Audio Format: MP3 veya WAV
  • Audio Quality: low / medium / high
  • Kamera önizlemeli isteğe bağlı Video Capture
  • İsteğe bağlı Speaker Classification (farklı konuşmacıları tanımlar)

Capture Transcription

OCR kullanarak ekran görüntülerinden veya kamera çekimlerinden metin çıkarın.

  • Kamera çekimi — bir kamera aygıtı seçin, tek bir çekim alın
  • Tam ekran çekimi — tüm ekranı yakalayın
  • Bölge seçimi — belirli bir alanı yakalamak için bir dikdörtgen çizin
  • Pencere çekimi — belirli bir pencereyi yakalayın

OCR motoru: Tesseract (varsayılan olarak Japonca). Sonuçlar yakalanan görüntünün yanında görünür.


File Transcription

Sürükle ve bırakarak veya dosya tarayıcısını kullanarak dosyaları toplu olarak işleyin.

Desteklenen formatlar

TürFormatlarYöntem
SesMP3, WAV, M4A, FLAC, AAC, OGG, WMAKonuşma motoru
VideoMP4, AVI, MOV, MKV, WMV, FLVSes çıkarma → konuşma motoru
GörüntüJPG, PNG, BMP, TIFF, GIFTesseract OCR
BelgePDFSayfa → görüntü → OCR

Workset geçmişi

  • Her transkripsiyon oturumu bir workset olarak kaydedilir
  • Anahtar kelime, tür (Live/Capture/File) ve duruma göre filtreleyin
  • Önceki bir oturumu yeniden açmak için çift tıklayın
  • Sıralanabilir sütunlar: ad, tür, yöntem, tarih, durum

Ayarlar

AyarAçıklamaVarsayılan
Recognition ModelVarsayılan konuşma motoruGoogle
Audio FormatKayıt formatıWAV
Audio QualitySıkıştırma seviyesiMedium
Video CaptureKamera kaydını etkinleştirOff
Speaker ClassificationFarklı konuşmacıları tanımlaOff

İpuçları

  • Çevrimdışı transkripsiyon — Tamamen çevrimdışı konuşma tanıma için Whisper veya Vosk kullanın
  • Toplantı notları — Kimin ne söylediğini ayırt etmek için Speaker Classification'ı etkinleştirin
  • Toplu OCR — Toplu işleme için taranmış belgelerin tüm bir klasörünü bırakın
  • PDF çıkarma — Her PDF sayfası bir görüntüye dönüştürülür ve ayrı ayrı OCR'lanır

Gizlilik

  • Whisper ve Vosk motorları tamamen cihazınızda çalışır
  • Google Speech, tanıma için sesi Google sunucularına gönderir
  • Tüm transkripsiyon sonuçları ve kayıtlar yalnızca yerel diskinizde saklanır
  • Analitik veya izleme yok