Le modèle de parole n'est pas prêt
Ouvrir Paramètres et laisser Desktop terminer le téléchargement et le chargement du modèle local avant de réessayer.
Créez des transcriptions TXT et des sous-titres SRT à partir de vidéos téléchargées sur votre propre ordinateur. Desktop prépare l'audio avec FFmpeg et exécute le modèle de reconnaissance vocale sans télécharger le média.
Desktop prépare l'audio à 16 kHz avec FFmpeg, détecte la parole, puis reconnaît un segment à la fois avec le modèle local.
Chaque étape correspond à un contrôle ou un état de tâche dans l'application de bureau montrée ci-dessus.
Activer TXT + SRT avant de commencer le téléchargement d'une vidéo compatible.
Lors de la première utilisation, confirmer la configuration et attendre que Paramètres indique Activé ou Prêt.
Desktop télécharge la vidéo, prépare l'audio et traite la transcription de manière séquentielle.
Trouver les fichiers .txt et .srt correspondants à côté du média téléchargé.
Les échecs restent attachés à leur tâche afin que les éléments terminés dans la même file restent disponibles.
Ouvrir Paramètres et laisser Desktop terminer le téléchargement et le chargement du modèle local avant de réessayer.
Confirmer que la vidéo contient un discours audible. Les fichiers uniquement musicaux, silencieux ou extrêmement bruyants peuvent produire des fichiers vides.
Garder la vidéo téléchargée disponible et réessayer. Un fichier endommagé ou non pris en charge peut empêcher FFmpeg de préparer l'audio.
Choisissez le paquet actuel pour votre ordinateur. Les cartes de version apparaissent uniquement lorsque ce paquet est disponible.
Gratuit: 10 analyses de vidéos simples réussies par jour ; pas d'extraction de profil. Desktop Pro: 9,90 $/mois ou 79,90 $/an pour un parsing illimité et l'extraction de profil prise en charge. Comparer les plans.
Non. La préparation de l'audio et la reconnaissance vocale s'exécutent localement sur l'ordinateur.
L'écran Paramètres actuel liste le mandarin, le cantonais, l'anglais, le japonais et le coréen.
Non. Les résultats dépendent de la langue, de la clarté de la parole, du bruit de fond, du chevauchement et de l'enregistrement source.