Textnizer - ガイド

音声・スクリーンショット・ファイルからテキストを抽出します。リアルタイム音声認識、画面キャプチャ OCR、音声・動画・画像・PDF の一括処理に対応しています。


はじめに

メイン画面から 3 つのモードのいずれかを選びます:

  1. Live Transcription — マイクからのリアルタイム音声テキスト変換
  2. Capture Transcription — スクリーンショットやカメラからの OCR
  3. File Transcription — 音声・動画・画像・PDF ファイルの一括処理

Live Transcription

マイクや音声入力デバイスからのリアルタイム音声認識です。

音声エンジン

エンジン種別適した用途
Google Speechオンライン API高精度、多言語対応(デフォルト)
Whisperローカルモデルオフライン利用、プライバシー(tiny〜large モデル)
Voskオフライン軽量・高速・多言語対応

録音オプション

  • 音声入力デバイスの選択
  • Audio Format: MP3 または WAV
  • Audio Quality: low / medium / high
  • カメラプレビュー付きの Video Capture(任意)
  • Speaker Classification(任意・話者を識別)

Capture Transcription

スクリーンショットやカメラ撮影から OCR でテキストを抽出します。

  • Camera capture — カメラデバイスを選択し、1 枚撮影
  • Full screen capture — 画面全体をキャプチャ
  • Region selection — 矩形を描画して特定領域をキャプチャ
  • Window capture — 特定のウィンドウをキャプチャ

OCR エンジン: Tesseract(デフォルトは日本語)。結果はキャプチャ画像と並べて表示されます。


File Transcription

ドラッグ&ドロップまたはファイルブラウザでファイルを一括処理します。

対応フォーマット

種別フォーマット処理方法
音声MP3, WAV, M4A, FLAC, AAC, OGG, WMA音声エンジン
動画MP4, AVI, MOV, MKV, WMV, FLV音声抽出 → 音声エンジン
画像JPG, PNG, BMP, TIFF, GIFTesseract OCR
ドキュメントPDFページ → 画像 → OCR

ワークセット履歴

  • 各文字起こしセッションはワークセットとして保存されます
  • キーワード、種別(Live / Capture / File)、ステータスでフィルタ可能
  • ダブルクリックで過去のセッションを再開
  • 並べ替え可能な列: 名前、種別、方式、日付、ステータス

設定

設定項目説明デフォルト
Recognition Modelデフォルトの音声エンジンGoogle
Audio Format録音フォーマットWAV
Audio Quality圧縮レベルMedium
Video Captureカメラ録画を有効化Off
Speaker Classification話者を識別Off

ヒント

  • オフライン文字起こし — Whisper または Vosk を使えば完全オフラインで音声認識が可能
  • 会議メモ — Speaker Classification を有効にすると、誰が何を話したかを区別できます
  • 一括 OCR — スキャン文書のフォルダ全体をドロップして一括処理
  • PDF 抽出 — PDF の各ページは画像に変換され、個別に OCR されます

プライバシー

  • Whisper および Vosk エンジンは完全に端末上で動作します
  • Google Speech は認識のため音声を Google のサーバーへ送信します
  • すべての文字起こし結果と録音はローカルディスクのみに保存されます
  • 解析やトラッキングは行いません