Extrahieren Sie Text aus Sprache, Screenshots und Dateien. Unterstützt Spracherkennung in Echtzeit, OCR von Bildschirmaufnahmen sowie Stapelverarbeitung von Audio-, Video-, Bild- und PDF-Dateien.
Erste Schritte
Wählen Sie auf dem Hauptbildschirm einen der drei Modi:
- Live Transcription — Sprache-zu-Text in Echtzeit über Ihr Mikrofon
- Capture Transcription — OCR aus Screenshots oder Kameraaufnahmen
- File Transcription — Stapelverarbeitung von Audio-, Video-, Bild- oder PDF-Dateien
Live Transcription
Spracherkennung in Echtzeit über Ihr Mikrofon oder Audio-Eingabegerät.
Sprach-Engines
| Engine | Typ | Geeignet für |
|---|---|---|
| Google Speech | Online-API | Hohe Genauigkeit, viele Sprachen (Standard) |
| Whisper | Lokales Modell | Offline-Nutzung, Datenschutz (Modelle von tiny bis large) |
| Vosk | Offline | Leichtgewichtig, schnell, viele Sprachen |
Aufnahmeoptionen
- Auswahl des Audio-Eingabegeräts
- Audio Format: MP3 oder WAV
- Audio Quality: niedrig / mittel / hoch
- Optionale Videoaufnahme mit Kameravorschau
- Optionale Speaker Classification (erkennt verschiedene Sprecher)
Capture Transcription
Extrahieren Sie Text aus Screenshots oder Kameraaufnahmen mithilfe von OCR.
- Camera capture — wählen Sie ein Kameragerät und nehmen Sie ein einzelnes Foto auf
- Full screen capture — nimmt den gesamten Bildschirm auf
- Region selection — ziehen Sie ein Rechteck, um einen bestimmten Bereich aufzunehmen
- Window capture — nimmt ein bestimmtes Fenster auf
OCR-Engine: Tesseract (standardmäßig Japanisch). Die Ergebnisse erscheinen neben dem aufgenommenen Bild.
File Transcription
Verarbeiten Sie Dateien per Stapel, indem Sie sie per Drag-and-drop hineinziehen oder den Datei-Browser verwenden.
Unterstützte Formate
| Typ | Formate | Methode |
|---|---|---|
| Audio | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | Sprach-Engine |
| Video | MP4, AVI, MOV, MKV, WMV, FLV | Audioextraktion → Sprach-Engine |
| Bild | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| Dokument | Seite → Bild → OCR |
Workset-Verlauf
- Jede Transkriptionssitzung wird als Workset gespeichert
- Filtern nach Stichwort, Typ (Live/Capture/File) und Status
- Mit Doppelklick eine frühere Sitzung erneut öffnen
- Sortierbare Spalten: Name, Typ, Methode, Datum, Status
Einstellungen
| Einstellung | Beschreibung | Standard |
|---|---|---|
| Recognition Model | Standard-Sprach-Engine | |
| Audio Format | Aufnahmeformat | WAV |
| Audio Quality | Komprimierungsstufe | Medium |
| Video Capture | Kameraaufnahme aktivieren | Off |
| Speaker Classification | Verschiedene Sprecher erkennen | Off |
Tipps
- Offline-Transkription — Verwenden Sie Whisper oder Vosk für vollständig offline ausgeführte Spracherkennung
- Besprechungsnotizen — Aktivieren Sie Speaker Classification, um zu unterscheiden, wer was gesagt hat
- Stapel-OCR — Legen Sie einen ganzen Ordner mit gescannten Dokumenten ab, um sie per Stapel zu verarbeiten
- PDF-Extraktion — Jede PDF-Seite wird in ein Bild umgewandelt und einzeln per OCR verarbeitet
Datenschutz
- Die Whisper- und Vosk-Engines werden vollständig auf Ihrem Gerät ausgeführt
- Google Speech sendet Audio zur Erkennung an Google-Server
- Alle Transkriptionsergebnisse und Aufnahmen werden ausschließlich auf Ihrer lokalen Festplatte gespeichert
- Keine Analyse oder Tracking