भाषण, स्क्रीनशॉट और फ़ाइलों से टेक्स्ट निकालें। रीयल-टाइम वॉइस पहचान, स्क्रीन कैप्चर OCR, और ऑडियो, वीडियो, छवियों तथा PDF के बैच प्रसंस्करण का समर्थन करता है।
शुरुआत करना
मुख्य स्क्रीन से तीन मोड्स में से एक चुनें:
- Live Transcription — आपके माइक्रोफ़ोन से रीयल-टाइम स्पीच-टू-टेक्स्ट
- Capture Transcription — स्क्रीनशॉट या कैमरे से OCR
- File Transcription — ऑडियो, वीडियो, छवि या PDF फ़ाइलों का बैच प्रसंस्करण
Live Transcription
आपके माइक्रोफ़ोन या ऑडियो इनपुट डिवाइस से रीयल-टाइम स्पीच पहचान।
स्पीच इंजन
| इंजन | प्रकार | सर्वोत्तम उपयोग |
|---|---|---|
| Google Speech | ऑनलाइन API | उच्च सटीकता, कई भाषाएँ (डिफ़ॉल्ट) |
| Whisper | स्थानीय मॉडल | ऑफ़लाइन उपयोग, गोपनीयता (tiny से large मॉडल) |
| Vosk | ऑफ़लाइन | हल्का, तेज़, कई भाषाओं का समर्थन |
रिकॉर्डिंग विकल्प
- ऑडियो इनपुट डिवाइस का चयन
- Audio Format: MP3 या WAV
- Audio Quality: low / medium / high
- कैमरा प्रीव्यू के साथ वैकल्पिक Video Capture
- वैकल्पिक Speaker Classification (विभिन्न वक्ताओं की पहचान करता है)
Capture Transcription
OCR का उपयोग करके स्क्रीनशॉट या कैमरा कैप्चर से टेक्स्ट निकालें।
- Camera capture — एक कैमरा डिवाइस चुनें, एक तस्वीर लें
- Full screen capture — पूरी स्क्रीन कैप्चर करें
- Region selection — किसी विशिष्ट क्षेत्र को कैप्चर करने के लिए एक आयत बनाएँ
- Window capture — किसी विशिष्ट विंडो को कैप्चर करें
OCR इंजन: Tesseract (डिफ़ॉल्ट रूप से जापानी)। परिणाम कैप्चर की गई छवि के साथ दिखाई देते हैं।
File Transcription
खींचने और छोड़ने या फ़ाइल ब्राउज़र का उपयोग करके फ़ाइलों का बैच प्रसंस्करण करें।
समर्थित प्रारूप
| प्रकार | प्रारूप | विधि |
|---|---|---|
| ऑडियो | MP3, WAV, M4A, FLAC, AAC, OGG, WMA | स्पीच इंजन |
| वीडियो | MP4, AVI, MOV, MKV, WMV, FLV | ऑडियो निष्कर्षण → स्पीच इंजन |
| छवि | JPG, PNG, BMP, TIFF, GIF | Tesseract OCR |
| दस्तावेज़ | पृष्ठ → छवि → OCR |
वर्कसेट इतिहास
- प्रत्येक ट्रांसक्रिप्शन सत्र को वर्कसेट के रूप में सहेजा जाता है
- कीवर्ड, प्रकार (Live/Capture/File) और स्थिति के आधार पर फ़िल्टर करें
- पिछले सत्र को फिर से खोलने के लिए डबल-क्लिक करें
- क्रमबद्ध स्तंभ: नाम, प्रकार, विधि, दिनांक, स्थिति
सेटिंग्स
| सेटिंग | विवरण | डिफ़ॉल्ट |
|---|---|---|
| Recognition Model | डिफ़ॉल्ट स्पीच इंजन | |
| Audio Format | रिकॉर्डिंग प्रारूप | WAV |
| Audio Quality | संपीड़न स्तर | Medium |
| Video Capture | कैमरा रिकॉर्डिंग सक्षम करें | Off |
| Speaker Classification | विभिन्न वक्ताओं की पहचान करें | Off |
सुझाव
- ऑफ़लाइन ट्रांसक्रिप्शन — पूरी तरह से ऑफ़लाइन स्पीच पहचान के लिए Whisper या Vosk का उपयोग करें
- मीटिंग नोट्स — यह पहचानने के लिए Speaker Classification सक्षम करें कि किसने क्या कहा
- बैच OCR — बैच प्रसंस्करण के लिए स्कैन किए गए दस्तावेज़ों का पूरा फ़ोल्डर ड्रॉप करें
- PDF निष्कर्षण — प्रत्येक PDF पृष्ठ को एक छवि में परिवर्तित किया जाता है और अलग-अलग OCR किया जाता है
गोपनीयता
- Whisper और Vosk इंजन पूरी तरह से आपके डिवाइस पर चलते हैं
- Google Speech पहचान के लिए ऑडियो को Google सर्वर पर भेजता है
- सभी ट्रांसक्रिप्शन परिणाम और रिकॉर्डिंग केवल आपकी स्थानीय डिस्क पर संग्रहीत होते हैं
- कोई एनालिटिक्स या ट्रैकिंग नहीं