Textnizer - คู่มือ

ดึงข้อความจากเสียง ภาพหน้าจอ และไฟล์ รองรับการรู้จำเสียงแบบเรียลไทม์, OCR จากการจับภาพหน้าจอ และการประมวลผลไฟล์เสียง วิดีโอ ภาพ และ PDF เป็นชุด


เริ่มต้นใช้งาน

เลือกโหมดใดโหมดหนึ่งจากสามโหมดในหน้าจอหลัก:

  1. Live Transcription — การแปลงเสียงเป็นข้อความแบบเรียลไทม์จากไมโครโฟน
  2. Capture Transcription — OCR จากภาพหน้าจอหรือกล้อง
  3. File Transcription — การประมวลผลไฟล์เสียง วิดีโอ ภาพ หรือ PDF เป็นชุด

Live Transcription

การรู้จำเสียงแบบเรียลไทม์จากไมโครโฟนหรืออุปกรณ์อินพุตเสียง

เครื่องมือเสียง

เครื่องมือประเภทเหมาะสำหรับ
Google SpeechAPI ออนไลน์ความแม่นยำสูง รองรับหลายภาษา (ค่าเริ่มต้น)
Whisperโมเดลในเครื่องใช้งานออฟไลน์ ความเป็นส่วนตัว (โมเดล tiny ถึง large)
Voskออฟไลน์เบา รวดเร็ว รองรับหลายภาษา

ตัวเลือกการบันทึก

  • การเลือกอุปกรณ์อินพุตเสียง
  • Audio Format: MP3 หรือ WAV
  • Audio Quality: low / medium / high
  • Video Capture แบบเลือกได้ พร้อมพรีวิวกล้อง
  • Speaker Classification แบบเลือกได้ (ระบุผู้พูดที่แตกต่างกัน)

Capture Transcription

ดึงข้อความจากภาพหน้าจอหรือภาพจากกล้องโดยใช้ OCR

  • Camera capture — เลือกอุปกรณ์กล้อง ถ่ายภาพหนึ่งภาพ
  • Full screen capture — จับภาพทั้งหน้าจอ
  • Region selection — วาดสี่เหลี่ยมเพื่อจับภาพพื้นที่ที่ต้องการ
  • Window capture — จับภาพหน้าต่างใดหน้าต่างหนึ่ง

เครื่องมือ OCR: Tesseract (ค่าเริ่มต้นเป็นภาษาญี่ปุ่น) ผลลัพธ์จะปรากฏข้างภาพที่จับมา


File Transcription

ประมวลผลไฟล์เป็นชุดด้วยการลากและวางหรือใช้เบราว์เซอร์ไฟล์

รูปแบบที่รองรับ

ประเภทรูปแบบวิธีการ
เสียงMP3, WAV, M4A, FLAC, AAC, OGG, WMAเครื่องมือเสียง
วิดีโอMP4, AVI, MOV, MKV, WMV, FLVดึงเสียง → เครื่องมือเสียง
ภาพJPG, PNG, BMP, TIFF, GIFTesseract OCR
เอกสารPDFหน้า → ภาพ → OCR

ประวัติชุดงาน

  • ทุกครั้งที่ถอดความจะถูกบันทึกเป็นชุดงาน
  • กรองตามคำสำคัญ ประเภท (Live/Capture/File) และสถานะ
  • ดับเบิลคลิกเพื่อเปิดเซสชันก่อนหน้าอีกครั้ง
  • คอลัมน์ที่จัดเรียงได้: ชื่อ ประเภท วิธีการ วันที่ สถานะ

การตั้งค่า

การตั้งค่าคำอธิบายค่าเริ่มต้น
Recognition Modelเครื่องมือเสียงเริ่มต้นGoogle
Audio FormatรูปแบบการบันทึกWAV
Audio QualityระดับการบีบอัดMedium
Video Captureเปิดใช้การบันทึกด้วยกล้องOff
Speaker Classificationระบุผู้พูดที่แตกต่างกันOff

เคล็ดลับ

  • การถอดความแบบออฟไลน์ — ใช้ Whisper หรือ Vosk เพื่อรู้จำเสียงแบบออฟไลน์อย่างสมบูรณ์
  • บันทึกการประชุม — เปิด Speaker Classification เพื่อแยกแยะว่าใครพูดอะไร
  • OCR เป็นชุด — วางทั้งโฟลเดอร์ของเอกสารสแกนเพื่อประมวลผลเป็นชุด
  • การดึงข้อมูลจาก PDF — แต่ละหน้า PDF จะถูกแปลงเป็นภาพและทำ OCR ทีละหน้า

ความเป็นส่วนตัว

  • เครื่องมือ Whisper และ Vosk ทำงานภายในอุปกรณ์ของคุณทั้งหมด
  • Google Speech ส่งเสียงไปยังเซิร์ฟเวอร์ของ Google เพื่อทำการรู้จำ
  • ผลการถอดความและการบันทึกทั้งหมดจะถูกเก็บไว้บนดิสก์ในเครื่องเท่านั้น
  • ไม่มีการวิเคราะห์หรือติดตาม