Passer au contenu principal
SPEECH-TO-TEXT LOCAL

Transcription vidéo locale sur Windows et macOS

Créez des transcriptions TXT et des sous-titres SRT à partir de vidéos téléchargées sur votre propre ordinateur. Desktop prépare l'audio avec FFmpeg et exécute le modèle de reconnaissance vocale sans télécharger le média.

  • Reconnaissance vocale locale
  • TXT + SRT avec horodatages
  • Aucun téléchargement de média
Fenêtre de paramètres réelle de SnapVideoTools Desktop pour la reconnaissance vocale locale
Fenêtre de paramètres réelle de Desktop 1.0.1 sur macOS montrant la reconnaissance vocale locale activée et ses langues.
Support et limites

Ce que la transcription hors ligne gère

Desktop prépare l'audio à 16 kHz avec FFmpeg, détecte la parole, puis reconnaît un segment à la fois avec le modèle local.

Entrée prise en charge
Une tâche de vidéo téléchargée avec l'option "Extraire texte et sous-titres" sélectionnée. Les langues prises en charge incluent le mandarin, le cantonais, l'anglais, le japonais et le coréen.
Gratuit
Disponible pour les tâches vidéo téléchargées compatibles ; la version gratuite permet 10 analyses vidéo uniques réussies par jour et aucune extraction de profil.
Desktop Pro
Analyse illimitée de vidéos uniques et extraction de profils ; la transcription s'exécute toujours sur l'appareil.
Pagination des profils
La transcription n'a pas de pagination. Dans un lot de profils Pro, seules les tâches vidéo en file d'attente accessibles peuvent être transcrites.
Sorties
Les fichiers TXT en UTF-8 et les fichiers SRT horodatés sont écrits à côté du média téléchargé compatible.
Systèmes
Windows 64 bits ; macOS Apple Silicon et Intel. La vitesse dépend du processeur local et de la durée du média.
Flux de travail réel

Comment créer des transcriptions locales

Chaque étape correspond à un contrôle ou un état de tâche dans l'application de bureau montrée ci-dessus.

  1. 01

    Sélectionner Extraire le texte et les sous-titres

    Activer TXT + SRT avant de commencer le téléchargement d'une vidéo compatible.

  2. 02

    Activer le modèle local

    Lors de la première utilisation, confirmer la configuration et attendre que Paramètres indique Activé ou Prêt.

  3. 03

    Laisser la tâche se terminer

    Desktop télécharge la vidéo, prépare l'audio et traite la transcription de manière séquentielle.

  4. 04

    Ouvrir les sorties

    Trouver les fichiers .txt et .srt correspondants à côté du média téléchargé.

Lorsque qu'une tâche s'arrête

Raisons courantes d'échec

Les échecs restent attachés à leur tâche afin que les éléments terminés dans la même file restent disponibles.

Le modèle de parole n'est pas prêt

Ouvrir Paramètres et laisser Desktop terminer le téléchargement et le chargement du modèle local avant de réessayer.

Aucun discours détecté

Confirmer que la vidéo contient un discours audible. Les fichiers uniquement musicaux, silencieux ou extrêmement bruyants peuvent produire des fichiers vides.

La préparation de l'audio échoue

Garder la vidéo téléchargée disponible et réessayer. Un fichier endommagé ou non pris en charge peut empêcher FFmpeg de préparer l'audio.

Windows · macOS

Obtenir SnapVideoTools Desktop

Choisissez le paquet actuel pour votre ordinateur. Les cartes de version apparaissent uniquement lorsque ce paquet est disponible.

Gratuit: 10 analyses de vidéos simples réussies par jour ; pas d'extraction de profil. Desktop Pro: 9,90 $/mois ou 79,90 $/an pour un parsing illimité et l'extraction de profil prise en charge. Comparer les plans.

FAQ

Questions sur ce flux de travail

La vidéo est-elle téléchargée pour la transcription ?

Non. La préparation de l'audio et la reconnaissance vocale s'exécutent localement sur l'ordinateur.

Quelles langues sont prises en charge ?

L'écran Paramètres actuel liste le mandarin, le cantonais, l'anglais, le japonais et le coréen.

La précision est-elle garantie ?

Non. Les résultats dépendent de la langue, de la clarté de la parole, du bruit de fond, du chevauchement et de l'enregistrement source.