音声・スクリーンショット・ファイルからテキストを抽出します。リアルタイム音声認識、画面キャプチャ OCR、音声・動画・画像・PDF の一括処理に対応しています。
はじめに
メイン画面から 3 つのモードのいずれかを選びます:
- Live Transcription — マイクからのリアルタイム音声テキスト変換
- Capture Transcription — スクリーンショットやカメラからの OCR
- File Transcription — 音声・動画・画像・PDF ファイルの一括処理
Live Transcription
マイクや音声入力デバイスからのリアルタイム音声認識です。
音声エンジン
| エンジン | 種別 | 適した用途 |
|---|---|---|
| Google Speech | オンライン API | 高精度、多言語対応(デフォルト) |
| Whisper | ローカルモデル | オフライン利用、プライバシー(tiny〜large モデル) |
| Vosk | オフライン | 軽量・高速・多言語対応 |
録音オプション
- 音声入力デバイスの選択
- Audio Format: MP3 または WAV
- Audio Quality: low / medium / high
- カメラプレビュー付きの Video Capture(任意)
- Speaker Classification(任意・話者を識別)
Capture Transcription
スクリーンショットやカメラ撮影から OCR でテキストを抽出します。
- Camera capture — カメラデバイスを選択し、1 枚撮影
- Full screen capture — 画面全体をキャプチャ
- Region selection — 矩形を描画して特定領域をキャプチャ
- Window capture — 特定のウィンドウをキャプチャ
OCR エンジン: Tesseract(デフォルトは日本語)。結果はキャプチャ画像と並べて表示されます。
File Transcription
ドラッグ&ドロップまたはファイルブラウザでファイルを一括処理します。
対応フォーマット
| 種別 | フォーマット | 処理方法 |
|---|---|---|
| 音声 | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | 音声エンジン |
| 動画 | MP4, AVI, MOV, MKV, WMV, FLV | 音声抽出 → 音声エンジン |
| 画像 | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| ドキュメント | ページ → 画像 → OCR |
ワークセット履歴
- 各文字起こしセッションはワークセットとして保存されます
- キーワード、種別(Live / Capture / File)、ステータスでフィルタ可能
- ダブルクリックで過去のセッションを再開
- 並べ替え可能な列: 名前、種別、方式、日付、ステータス
設定
| 設定項目 | 説明 | デフォルト |
|---|---|---|
| Recognition Model | デフォルトの音声エンジン | |
| Audio Format | 録音フォーマット | WAV |
| Audio Quality | 圧縮レベル | Medium |
| Video Capture | カメラ録画を有効化 | Off |
| Speaker Classification | 話者を識別 | Off |
ヒント
- オフライン文字起こし — Whisper または Vosk を使えば完全オフラインで音声認識が可能
- 会議メモ — Speaker Classification を有効にすると、誰が何を話したかを区別できます
- 一括 OCR — スキャン文書のフォルダ全体をドロップして一括処理
- PDF 抽出 — PDF の各ページは画像に変換され、個別に OCR されます
プライバシー
- Whisper および Vosk エンジンは完全に端末上で動作します
- Google Speech は認識のため音声を Google のサーバーへ送信します
- すべての文字起こし結果と録音はローカルディスクのみに保存されます
- 解析やトラッキングは行いません