Textnizer - Anleitung

Extrahieren Sie Text aus Sprache, Screenshots und Dateien. Unterstützt Spracherkennung in Echtzeit, OCR von Bildschirmaufnahmen sowie Stapelverarbeitung von Audio-, Video-, Bild- und PDF-Dateien.


Erste Schritte

Wählen Sie auf dem Hauptbildschirm einen der drei Modi:

  1. Live Transcription — Sprache-zu-Text in Echtzeit über Ihr Mikrofon
  2. Capture Transcription — OCR aus Screenshots oder Kameraaufnahmen
  3. File Transcription — Stapelverarbeitung von Audio-, Video-, Bild- oder PDF-Dateien

Live Transcription

Spracherkennung in Echtzeit über Ihr Mikrofon oder Audio-Eingabegerät.

Sprach-Engines

EngineTypGeeignet für
Google SpeechOnline-APIHohe Genauigkeit, viele Sprachen (Standard)
WhisperLokales ModellOffline-Nutzung, Datenschutz (Modelle von tiny bis large)
VoskOfflineLeichtgewichtig, schnell, viele Sprachen

Aufnahmeoptionen

  • Auswahl des Audio-Eingabegeräts
  • Audio Format: MP3 oder WAV
  • Audio Quality: niedrig / mittel / hoch
  • Optionale Videoaufnahme mit Kameravorschau
  • Optionale Speaker Classification (erkennt verschiedene Sprecher)

Capture Transcription

Extrahieren Sie Text aus Screenshots oder Kameraaufnahmen mithilfe von OCR.

  • Camera capture — wählen Sie ein Kameragerät und nehmen Sie ein einzelnes Foto auf
  • Full screen capture — nimmt den gesamten Bildschirm auf
  • Region selection — ziehen Sie ein Rechteck, um einen bestimmten Bereich aufzunehmen
  • Window capture — nimmt ein bestimmtes Fenster auf

OCR-Engine: Tesseract (standardmäßig Japanisch). Die Ergebnisse erscheinen neben dem aufgenommenen Bild.


File Transcription

Verarbeiten Sie Dateien per Stapel, indem Sie sie per Drag-and-drop hineinziehen oder den Datei-Browser verwenden.

Unterstützte Formate

TypFormateMethode
AudioMP3, WAV, M4A, FLAC, AAC, OGG, WMASprach-Engine
VideoMP4, AVI, MOV, MKV, WMV, FLVAudioextraktion → Sprach-Engine
BildJPG, PNG, BMP, TIFF, GIFTesseract OCR
DokumentPDFSeite → Bild → OCR

Workset-Verlauf

  • Jede Transkriptionssitzung wird als Workset gespeichert
  • Filtern nach Stichwort, Typ (Live/Capture/File) und Status
  • Mit Doppelklick eine frühere Sitzung erneut öffnen
  • Sortierbare Spalten: Name, Typ, Methode, Datum, Status

Einstellungen

EinstellungBeschreibungStandard
Recognition ModelStandard-Sprach-EngineGoogle
Audio FormatAufnahmeformatWAV
Audio QualityKomprimierungsstufeMedium
Video CaptureKameraaufnahme aktivierenOff
Speaker ClassificationVerschiedene Sprecher erkennenOff

Tipps

  • Offline-Transkription — Verwenden Sie Whisper oder Vosk für vollständig offline ausgeführte Spracherkennung
  • Besprechungsnotizen — Aktivieren Sie Speaker Classification, um zu unterscheiden, wer was gesagt hat
  • Stapel-OCR — Legen Sie einen ganzen Ordner mit gescannten Dokumenten ab, um sie per Stapel zu verarbeiten
  • PDF-Extraktion — Jede PDF-Seite wird in ein Bild umgewandelt und einzeln per OCR verarbeitet

Datenschutz

  • Die Whisper- und Vosk-Engines werden vollständig auf Ihrem Gerät ausgeführt
  • Google Speech sendet Audio zur Erkennung an Google-Server
  • Alle Transkriptionsergebnisse und Aufnahmen werden ausschließlich auf Ihrer lokalen Festplatte gespeichert
  • Keine Analyse oder Tracking