Das Sprachmodell ist noch nicht bereit
Öffne die Einstellungen und lass den Desktop das lokale Modell herunterladen und laden, bevor du es erneut versuchst.
Erstelle TXT-Transkripte und SRT-Untertitel aus heruntergeladenen Videos auf deinem eigenen Computer. Desktop bereitet Audio mit FFmpeg vor und führt das Sprachmodell aus, ohne die Medien hochzuladen.
Desktop bereitet 16 kHz Audio mit FFmpeg vor, erkennt Sprache und transkribiert dann jeweils ein Segment mit dem lokalen Modell.
Jeder Schritt entspricht einer Steuerung oder einem Aufgabenstatus in der oben gezeigten Desktop-Anwendung.
Aktiviere TXT + SRT, bevor du einen kompatiblen Video-Download startest.
Beim ersten Gebrauch bestätigen Sie die Einrichtung und warten Sie, bis die Einstellungen als aktiviert oder bereit angezeigt werden.
Der Desktop lädt das Video herunter, bereitet Audio vor und verarbeitet die Transkription seriell.
Finde die passenden .txt und .srt Dateien neben den heruntergeladenen Medien.
Fehler bleiben an ihre Aufgabe gebunden, sodass abgeschlossene Elemente in derselben Warteschlange verfügbar bleiben.
Öffne die Einstellungen und lass den Desktop das lokale Modell herunterladen und laden, bevor du es erneut versuchst.
Bestätigen Sie, dass das Video hörbare Sprache enthält. Reine Musik, stummes oder extrem lautes Audio kann leere Dateien erzeugen.
Halten Sie das heruntergeladene Video verfügbar und versuchen Sie es erneut. Eine beschädigte oder nicht unterstützte Datei kann FFmpeg daran hindern, Audio vorzubereiten.
Wählen Sie das aktuelle Paket für Ihren Computer. Freigabekarten erscheinen nur, wenn dieses Paket verfügbar ist.
Kostenlos: 10 erfolgreiche Einzelvideo-Analysen pro Tag; keine Profilextraktion. Desktop Pro: $9,90/Monat oder $79,90/Jahr für unbegrenzte Analysen und unterstützte Profilextraktion. Pläne vergleichen.
Nein. Die Audio-Vorbereitung und Spracherkennung erfolgen lokal auf dem Computer.
Der aktuelle Einstellungsbildschirm listet Mandarin, Kantonesisch, Englisch, Japanisch und Koreanisch auf.
Nein. Die Ergebnisse hängen von der Sprache, der Sprachklarheit, dem Hintergrundgeräusch, Überlappungen und der Ausgangsaufnahme ab.