Textnizer - Opas

Poimi tekstiä puheesta, kuvakaappauksista ja tiedostoista. Tukee reaaliaikaista puheentunnistusta, näyttökaappausten OCR-tunnistusta ja äänen, videon, kuvien ja PDF-tiedostojen eräkäsittelyä.


Aloittaminen

Valitse päänäytöltä yksi kolmesta tilasta:

  1. Live Transcription — reaaliaikainen puheen muunto tekstiksi mikrofonista
  2. Capture Transcription — OCR kuvakaappauksista tai kamerasta
  3. File Transcription — ääni-, video-, kuva- tai PDF-tiedostojen eräkäsittely

Live Transcription

Reaaliaikainen puheentunnistus mikrofonistasi tai äänen syöttölaitteesta.

Puhemoottorit

MoottoriTyyppiSopii erityisesti
Google SpeechOnline-APIKorkea tarkkuus, monia kieliä (default)
WhisperPaikallinen malliOffline-käyttö, yksityisyys (mallit pienestä suureen)
VoskOfflineKevyt, nopea, monia kieliä

Tallennusasetukset

  • Äänen syöttölaitteen valinta
  • Audio Format: MP3 tai WAV
  • Audio Quality: low / medium / high
  • Valinnainen Video Capture kameran esikatselulla
  • Valinnainen Speaker Classification (tunnistaa eri puhujat)

Capture Transcription

Poimi tekstiä kuvakaappauksista tai kamerakuvista OCR:n avulla.

  • Kamerakaappaus — valitse kameralaite, ota yksittäinen kuva
  • Koko näytön kaappaus — kaappaa koko näyttö
  • Alueen valinta — piirrä suorakulmio kaapataksesi tietyn alueen
  • Ikkunan kaappaus — kaappaa tietty ikkuna

OCR-moottori: Tesseract (oletuksena japani). Tulokset näkyvät kaapatun kuvan vieressä.


File Transcription

Käsittele tiedostoja eränä vetämällä ja pudottamalla tai tiedostoselaimen avulla.

Tuetut muodot

TyyppiMuodotMenetelmä
ÄäniMP3, WAV, M4A, FLAC, AAC, OGG, WMAPuhemoottori
VideoMP4, AVI, MOV, MKV, WMV, FLVÄänen erotus → puhemoottori
KuvaJPG, PNG, BMP, TIFF, GIFTesseract OCR
AsiakirjaPDFSivu → kuva → OCR

Worksetien historia

  • Jokainen litterointi-istunto tallennetaan worksetinä
  • Suodata avainsanan, tyypin (Live/Capture/File) ja tilan mukaan
  • Kaksoisnapsauta avataksesi aiemman istunnon uudelleen
  • Lajiteltavat sarakkeet: nimi, tyyppi, menetelmä, päivämäärä, tila

Asetukset

AsetusKuvausOletus
Recognition ModelOletuspuhemoottoriGoogle
Audio FormatTallennusmuotoWAV
Audio QualityPakkaustasoMedium
Video CaptureOta kameran tallennus käyttöönOff
Speaker ClassificationTunnista eri puhujatOff

Vinkkejä

  • Offline-litterointi — Käytä Whisperiä tai Voskia täysin offline-puheentunnistukseen
  • Kokousmuistiinpanot — Ota Speaker Classification käyttöön erottaaksesi kuka sanoi mitä
  • Erä-OCR — Pudota kokonainen kansio skannattuja asiakirjoja eräkäsittelyä varten
  • PDF-poiminta — Jokainen PDF-sivu muunnetaan kuvaksi ja käsitellään OCR:llä erikseen

Yksityisyys

  • Whisper- ja Vosk-moottorit toimivat täysin laitteellasi
  • Google Speech lähettää äänen Googlen palvelimille tunnistusta varten
  • Kaikki litterointitulokset ja tallenteet säilyvät vain paikallisella levylläsi
  • Ei analytiikkaa eikä seurantaa