ดึงข้อความจากเสียง ภาพหน้าจอ และไฟล์ รองรับการรู้จำเสียงแบบเรียลไทม์, OCR จากการจับภาพหน้าจอ และการประมวลผลไฟล์เสียง วิดีโอ ภาพ และ PDF เป็นชุด
เริ่มต้นใช้งาน
เลือกโหมดใดโหมดหนึ่งจากสามโหมดในหน้าจอหลัก:
- Live Transcription — การแปลงเสียงเป็นข้อความแบบเรียลไทม์จากไมโครโฟน
- Capture Transcription — OCR จากภาพหน้าจอหรือกล้อง
- File Transcription — การประมวลผลไฟล์เสียง วิดีโอ ภาพ หรือ PDF เป็นชุด
Live Transcription
การรู้จำเสียงแบบเรียลไทม์จากไมโครโฟนหรืออุปกรณ์อินพุตเสียง
เครื่องมือเสียง
| เครื่องมือ | ประเภท | เหมาะสำหรับ |
|---|---|---|
| Google Speech | API ออนไลน์ | ความแม่นยำสูง รองรับหลายภาษา (ค่าเริ่มต้น) |
| Whisper | โมเดลในเครื่อง | ใช้งานออฟไลน์ ความเป็นส่วนตัว (โมเดล tiny ถึง large) |
| Vosk | ออฟไลน์ | เบา รวดเร็ว รองรับหลายภาษา |
ตัวเลือกการบันทึก
- การเลือกอุปกรณ์อินพุตเสียง
- Audio Format: MP3 หรือ WAV
- Audio Quality: low / medium / high
- Video Capture แบบเลือกได้ พร้อมพรีวิวกล้อง
- Speaker Classification แบบเลือกได้ (ระบุผู้พูดที่แตกต่างกัน)
Capture Transcription
ดึงข้อความจากภาพหน้าจอหรือภาพจากกล้องโดยใช้ OCR
- Camera capture — เลือกอุปกรณ์กล้อง ถ่ายภาพหนึ่งภาพ
- Full screen capture — จับภาพทั้งหน้าจอ
- Region selection — วาดสี่เหลี่ยมเพื่อจับภาพพื้นที่ที่ต้องการ
- Window capture — จับภาพหน้าต่างใดหน้าต่างหนึ่ง
เครื่องมือ OCR: Tesseract (ค่าเริ่มต้นเป็นภาษาญี่ปุ่น) ผลลัพธ์จะปรากฏข้างภาพที่จับมา
File Transcription
ประมวลผลไฟล์เป็นชุดด้วยการลากและวางหรือใช้เบราว์เซอร์ไฟล์
รูปแบบที่รองรับ
| ประเภท | รูปแบบ | วิธีการ |
|---|---|---|
| เสียง | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | เครื่องมือเสียง |
| วิดีโอ | MP4, AVI, MOV, MKV, WMV, FLV | ดึงเสียง → เครื่องมือเสียง |
| ภาพ | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| เอกสาร | หน้า → ภาพ → OCR |
ประวัติชุดงาน
- ทุกครั้งที่ถอดความจะถูกบันทึกเป็นชุดงาน
- กรองตามคำสำคัญ ประเภท (Live/Capture/File) และสถานะ
- ดับเบิลคลิกเพื่อเปิดเซสชันก่อนหน้าอีกครั้ง
- คอลัมน์ที่จัดเรียงได้: ชื่อ ประเภท วิธีการ วันที่ สถานะ
การตั้งค่า
| การตั้งค่า | คำอธิบาย | ค่าเริ่มต้น |
|---|---|---|
| Recognition Model | เครื่องมือเสียงเริ่มต้น | |
| Audio Format | รูปแบบการบันทึก | WAV |
| Audio Quality | ระดับการบีบอัด | Medium |
| Video Capture | เปิดใช้การบันทึกด้วยกล้อง | Off |
| Speaker Classification | ระบุผู้พูดที่แตกต่างกัน | Off |
เคล็ดลับ
- การถอดความแบบออฟไลน์ — ใช้ Whisper หรือ Vosk เพื่อรู้จำเสียงแบบออฟไลน์อย่างสมบูรณ์
- บันทึกการประชุม — เปิด Speaker Classification เพื่อแยกแยะว่าใครพูดอะไร
- OCR เป็นชุด — วางทั้งโฟลเดอร์ของเอกสารสแกนเพื่อประมวลผลเป็นชุด
- การดึงข้อมูลจาก PDF — แต่ละหน้า PDF จะถูกแปลงเป็นภาพและทำ OCR ทีละหน้า
ความเป็นส่วนตัว
- เครื่องมือ Whisper และ Vosk ทำงานภายในอุปกรณ์ของคุณทั้งหมด
- Google Speech ส่งเสียงไปยังเซิร์ฟเวอร์ของ Google เพื่อทำการรู้จำ
- ผลการถอดความและการบันทึกทั้งหมดจะถูกเก็บไว้บนดิสก์ในเครื่องเท่านั้น
- ไม่มีการวิเคราะห์หรือติดตาม