חלצו טקסט מדיבור, מצילומי מסך ומקבצים. תומך בזיהוי קולי בזמן אמת, ב-OCR של צילומי מסך ובעיבוד אצווה של קבצי שמע, וידאו, תמונות ו-PDF.
תחילת עבודה
בחרו אחד משלושה מצבים מהמסך הראשי:
- Live Transcription — המרת דיבור לטקסט בזמן אמת מהמיקרופון
- Capture Transcription — OCR מצילומי מסך או מצלמה
- File Transcription — עיבוד אצווה של קבצי שמע, וידאו, תמונה או PDF
Live Transcription
זיהוי קולי בזמן אמת מהמיקרופון או ממכשיר קלט שמע.
מנועי דיבור
| מנוע | סוג | מתאים ל |
|---|---|---|
| Google Speech | API מקוון | דיוק גבוה, שפות רבות (ברירת מחדל) |
| Whisper | מודל מקומי | שימוש לא מקוון, פרטיות (מודלים מ-tiny ועד large) |
| Vosk | לא מקוון | קל ומהיר, תומך בשפות רבות |
אפשרויות הקלטה
- בחירת מכשיר קלט שמע
- Audio Format: MP3 או WAV
- Audio Quality: low / medium / high
- Video Capture אופציונלי עם תצוגה מקדימה של המצלמה
- Speaker Classification אופציונלי (מזהה דוברים שונים)
Capture Transcription
חלצו טקסט מצילומי מסך או מצילומי מצלמה באמצעות OCR.
- Camera capture — בחרו מכשיר מצלמה וצלמו תמונה אחת
- Full screen capture — צלמו את המסך כולו
- Region selection — ציירו מלבן ללכידת אזור מסוים
- Window capture — לכדו חלון מסוים
מנוע OCR: Tesseract (יפנית כברירת מחדל). התוצאות מופיעות לצד התמונה שצולמה.
File Transcription
עיבוד אצווה של קבצים על-ידי גרירה ושחרור או באמצעות דפדפן הקבצים.
תבניות נתמכות
| סוג | תבניות | שיטה |
|---|---|---|
| שמע | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | מנוע דיבור |
| וידאו | MP4, AVI, MOV, MKV, WMV, FLV | חילוץ שמע → מנוע דיבור |
| תמונה | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| מסמך | עמוד → תמונה → OCR |
היסטוריית ערכות עבודה
- כל פעולת תמלול נשמרת כערכת עבודה
- סינון לפי מילת מפתח, סוג (Live/Capture/File) וסטטוס
- לחיצה כפולה לפתיחה מחדש של פעולה קודמת
- עמודות הניתנות למיון: שם, סוג, שיטה, תאריך, סטטוס
הגדרות
| הגדרה | תיאור | ברירת מחדל |
|---|---|---|
| Recognition Model | מנוע דיבור ברירת מחדל | |
| Audio Format | תבנית הקלטה | WAV |
| Audio Quality | רמת דחיסה | Medium |
| Video Capture | הפעלת הקלטה במצלמה | Off |
| Speaker Classification | זיהוי דוברים שונים | Off |
טיפים
- תמלול לא מקוון — השתמשו ב-Whisper או ב-Vosk לזיהוי קולי לא מקוון לחלוטין
- סיכומי פגישות — הפעילו Speaker Classification כדי להבחין מי אמר מה
- OCR אצווה — שחררו תיקייה שלמה של מסמכים סרוקים לעיבוד אצווה
- חילוץ PDF — כל עמוד ב-PDF מומר לתמונה ועובר OCR בנפרד
פרטיות
- מנועי Whisper ו-Vosk רצים כולם על המכשיר שלכם
- Google Speech שולח שמע לשרתי Google לצורך זיהוי
- כל תוצאות התמלול וההקלטות נשמרות אך ורק בדיסק המקומי
- אין אנליטיקה או מעקב