Textnizer - Útmutató

Nyerjen ki szöveget beszédből, képernyőképekből és fájlokból. Támogatja a valós idejű hangfelismerést, képernyő OCR-jét és a hang-, videó-, kép- és PDF-fájlok kötegelt feldolgozását.


Első lépések

Válassza ki a három mód egyikét a főképernyőn:

  1. Live Transcription — valós idejű beszéd-szöveg átalakítás mikrofonról
  2. Capture Transcription — OCR képernyőképekből vagy kamerából
  3. File Transcription — hang-, videó-, kép- vagy PDF-fájlok kötegelt feldolgozása

Live Transcription

Valós idejű beszédfelismerés mikrofonról vagy hangbemeneti eszközről.

Beszédmotorok

MotorTípusLegjobb erre
Google SpeechOnline APIMagas pontosság, sok nyelv (alapértelmezett)
WhisperHelyi modellOffline használat, adatvédelem (tiny–large modellek)
VoskOfflineKönnyű, gyors, sok nyelv

Felvételi beállítások

  • Hangbemeneti eszköz kiválasztása
  • Audio Format: MP3 vagy WAV
  • Audio Quality: low / medium / high
  • Opcionális videofelvétel kamera-előnézettel
  • Opcionális Speaker Classification (megkülönbözteti a beszélőket)

Capture Transcription

Nyerjen ki szöveget képernyőképekből vagy kamerafelvételekből OCR-rel.

  • Camera capture — válasszon kameraeszközt, készítsen egyetlen képet
  • Full screen capture — rögzítse a teljes képernyőt
  • Region selection — rajzoljon téglalapot egy adott terület rögzítéséhez
  • Window capture — rögzítsen egy adott ablakot

OCR-motor: Tesseract (alapértelmezetten japán). Az eredmények a rögzített kép mellett jelennek meg.


File Transcription

Dolgozza fel a fájlokat kötegelten húzással és ejtéssel vagy a fájlböngésző segítségével.

Támogatott formátumok

TípusFormátumokMódszer
HangMP3, WAV, M4A, FLAC, AAC, OGG, WMABeszédmotor
VideóMP4, AVI, MOV, MKV, WMV, FLVHangkivonás → beszédmotor
KépJPG, PNG, BMP, TIFF, GIFTesseract OCR
DokumentumPDFOldal → kép → OCR

Workset History

  • Minden átírási munkamenet worksetként mentődik
  • Szűrjön kulcsszó, típus (Live/Capture/File) és állapot szerint
  • Dupla kattintással újra megnyithatja a korábbi munkamenetet
  • Rendezhető oszlopok: név, típus, módszer, dátum, állapot

Beállítások

BeállításLeírásAlapértelmezett
Recognition ModelAlapértelmezett beszédmotorGoogle
Audio FormatFelvételi formátumWAV
Audio QualityTömörítési szintMedium
Video CaptureKamerafelvétel engedélyezéseOff
Speaker ClassificationKülönböző beszélők azonosításaOff

Tippek

  • Offline átírás — Használja a Whispert vagy Voskot teljesen offline beszédfelismeréshez
  • Értekezleti jegyzetek — Engedélyezze a Speaker Classification funkciót, hogy megkülönböztethető legyen, ki mit mondott
  • Kötegelt OCR — Ejtsen be egy egész mappa szkennelt dokumentumot kötegelt feldolgozásra
  • PDF-kinyerés — Minden PDF-oldal képpé alakul és külön-külön OCR-feldolgozásra kerül

Adatvédelem

  • A Whisper és Vosk motorok teljes egészében az Ön eszközén futnak
  • A Google Speech a hangot felismerés céljából a Google szervereire küldi
  • Minden átírási eredmény és felvétel kizárólag a helyi lemezen tárolódik
  • Nincs analitika vagy követés