Textnizer - गाइड

भाषण, स्क्रीनशॉट और फ़ाइलों से टेक्स्ट निकालें। रीयल-टाइम वॉइस पहचान, स्क्रीन कैप्चर OCR, और ऑडियो, वीडियो, छवियों तथा PDF के बैच प्रसंस्करण का समर्थन करता है।


शुरुआत करना

मुख्य स्क्रीन से तीन मोड्स में से एक चुनें:

  1. Live Transcription — आपके माइक्रोफ़ोन से रीयल-टाइम स्पीच-टू-टेक्स्ट
  2. Capture Transcription — स्क्रीनशॉट या कैमरे से OCR
  3. File Transcription — ऑडियो, वीडियो, छवि या PDF फ़ाइलों का बैच प्रसंस्करण

Live Transcription

आपके माइक्रोफ़ोन या ऑडियो इनपुट डिवाइस से रीयल-टाइम स्पीच पहचान।

स्पीच इंजन

इंजनप्रकारसर्वोत्तम उपयोग
Google Speechऑनलाइन APIउच्च सटीकता, कई भाषाएँ (डिफ़ॉल्ट)
Whisperस्थानीय मॉडलऑफ़लाइन उपयोग, गोपनीयता (tiny से large मॉडल)
Voskऑफ़लाइनहल्का, तेज़, कई भाषाओं का समर्थन

रिकॉर्डिंग विकल्प

  • ऑडियो इनपुट डिवाइस का चयन
  • Audio Format: MP3 या WAV
  • Audio Quality: low / medium / high
  • कैमरा प्रीव्यू के साथ वैकल्पिक Video Capture
  • वैकल्पिक Speaker Classification (विभिन्न वक्ताओं की पहचान करता है)

Capture Transcription

OCR का उपयोग करके स्क्रीनशॉट या कैमरा कैप्चर से टेक्स्ट निकालें।

  • Camera capture — एक कैमरा डिवाइस चुनें, एक तस्वीर लें
  • Full screen capture — पूरी स्क्रीन कैप्चर करें
  • Region selection — किसी विशिष्ट क्षेत्र को कैप्चर करने के लिए एक आयत बनाएँ
  • Window capture — किसी विशिष्ट विंडो को कैप्चर करें

OCR इंजन: Tesseract (डिफ़ॉल्ट रूप से जापानी)। परिणाम कैप्चर की गई छवि के साथ दिखाई देते हैं।


File Transcription

खींचने और छोड़ने या फ़ाइल ब्राउज़र का उपयोग करके फ़ाइलों का बैच प्रसंस्करण करें।

समर्थित प्रारूप

प्रकारप्रारूपविधि
ऑडियोMP3, WAV, M4A, FLAC, AAC, OGG, WMAस्पीच इंजन
वीडियोMP4, AVI, MOV, MKV, WMV, FLVऑडियो निष्कर्षण → स्पीच इंजन
छविJPG, PNG, BMP, TIFF, GIFTesseract OCR
दस्तावेज़PDFपृष्ठ → छवि → OCR

वर्कसेट इतिहास

  • प्रत्येक ट्रांसक्रिप्शन सत्र को वर्कसेट के रूप में सहेजा जाता है
  • कीवर्ड, प्रकार (Live/Capture/File) और स्थिति के आधार पर फ़िल्टर करें
  • पिछले सत्र को फिर से खोलने के लिए डबल-क्लिक करें
  • क्रमबद्ध स्तंभ: नाम, प्रकार, विधि, दिनांक, स्थिति

सेटिंग्स

सेटिंगविवरणडिफ़ॉल्ट
Recognition Modelडिफ़ॉल्ट स्पीच इंजनGoogle
Audio Formatरिकॉर्डिंग प्रारूपWAV
Audio Qualityसंपीड़न स्तरMedium
Video Captureकैमरा रिकॉर्डिंग सक्षम करेंOff
Speaker Classificationविभिन्न वक्ताओं की पहचान करेंOff

सुझाव

  • ऑफ़लाइन ट्रांसक्रिप्शन — पूरी तरह से ऑफ़लाइन स्पीच पहचान के लिए Whisper या Vosk का उपयोग करें
  • मीटिंग नोट्स — यह पहचानने के लिए Speaker Classification सक्षम करें कि किसने क्या कहा
  • बैच OCR — बैच प्रसंस्करण के लिए स्कैन किए गए दस्तावेज़ों का पूरा फ़ोल्डर ड्रॉप करें
  • PDF निष्कर्षण — प्रत्येक PDF पृष्ठ को एक छवि में परिवर्तित किया जाता है और अलग-अलग OCR किया जाता है

गोपनीयता

  • Whisper और Vosk इंजन पूरी तरह से आपके डिवाइस पर चलते हैं
  • Google Speech पहचान के लिए ऑडियो को Google सर्वर पर भेजता है
  • सभी ट्रांसक्रिप्शन परिणाम और रिकॉर्डिंग केवल आपकी स्थानीय डिस्क पर संग्रहीत होते हैं
  • कोई एनालिटिक्स या ट्रैकिंग नहीं