Przejdź do głównej treści
LOKALNE ROZPOZNAWANIE MOWY

Lokalna transkrypcja wideo na Windows i macOS

Twórz transkrypcje TXT i napisy SRT z pobranego wideo na własnym komputerze. Desktop przygotowuje dźwięk za pomocą FFmpeg i uruchamia model mowy bez przesyłania mediów.

  • Lokalne rozpoznawanie mowy
  • TXT + napisy SRT z oznaczeniem czasowym
  • Brak przesyłania mediów
Aktualne okno ustawień lokalnego rozpoznawania mowy w SnapVideoTools Desktop
Aktualne okno ustawień Desktop 1.0.1 na macOS pokazujące włączone lokalne rozpoznawanie mowy i jego języki.
Wsparcie i ograniczenia

Co obsługuje transkrypcja offline

Desktop przygotowuje dźwięk w 16 kHz za pomocą FFmpeg, wykrywa mowę, następnie rozpoznaje jeden segment na raz przy użyciu lokalnego modelu.

Obsługiwane wejście
Zadanie z pobranym wideo z zaznaczoną opcją Wyodrębnij tekst i napisy. Obsługiwana mowa obejmuje mandaryński, kantoński, angielski, japoński i koreański.
Darmowa
Dostępne dla zgodnych zadań wideo do pobrania; wersja darmowa umożliwia 10 udanych analiz pojedynczego wideo dziennie i nie oferuje ekstrakcji profilu.
Desktop Pro
Nieograniczona analiza pojedynczych wideo oraz ekstrakcja profilu; transkrypcja wciąż działa na urządzeniu.
Stronicowanie profilu
Transkrypcja nie ma stronicowania. W partii profili Pro możliwe jest transkrybowanie tylko dostępnych zadań wideo w kolejce.
Wyniki
Zarówno pliki TXT w UTF-8, jak i SRT z oznaczeniami czasowymi są zapisywane obok zgodnych pobranych materiałów.
Systemy
Windows 64-bit; macOS Apple Silicon oraz Intel. Szybkość zależy od lokalnego procesora i długości materiału.
Rzeczywisty przebieg pracy

Jak tworzyć lokalne transkrypcje

Każdy krok odpowiada kontrolce lub stanowi zadania w aplikacji Desktop pokazanej powyżej.

  1. 01

    Wybierz Wyodrębnij tekst i napisy

    Włącz TXT + SRT przed rozpoczęciem pobierania zgodnego wideo.

  2. 02

    Włącz lokalny model

    Przy pierwszym użyciu potwierdź konfigurację i poczekaj, aż w Ustawieniach pojawi się raport Włączony lub Gotowy.

  3. 03

    Poczekaj na zakończenie zadania

    Desktop pobiera wideo, przygotowuje audio i przetwarza transkrypcję kolejno.

  4. 04

    Otwórz wyniki

    Znajdź odpowiadające pliki .txt i .srt obok pobranego materiału.

Gdy zadanie zatrzymuje się

Typowe przyczyny niepowodzeń

Niepowodzenia pozostają przypisane do swojego zadania, więc ukończone elementy w tej samej kolejce pozostają dostępne.

Model mowy nie jest gotowy

Otwórz Ustawienia i pozwól Desktopowi zakończyć pobieranie i ładowanie lokalnego modelu przed ponowną próbą.

Nie wykryto mowy

Upewnij się, że wideo zawiera słyszalną mowę. Materiał muzyczny, cichy lub o bardzo hałaśliwym dźwięku może skutkować pustymi plikami.

Przygotowanie audio nie powiodło się

Zachowaj pobrane wideo i spróbuj ponownie. Uszkodzony lub nieobsługiwany plik może uniemożliwić FFmpeg przygotowanie audio.

Windows · macOS

Pobierz SnapVideoTools Desktop

Wybierz aktualny pakiet dla swojego komputera. Karty wydania pojawiają się tylko wtedy, gdy pakiet jest dostępny.

Darmowy: 10 udanych analiz pojedynczych wideo dziennie; brak ekstrakcji profilu. Desktop Pro: 9,90 USD/miesiąc lub 79,90 USD/rok za nieograniczoną analizę i obsługiwaną ekstrakcję profilu. Porównaj plany.

FAQ

Pytania dotyczące tego przebiegu pracy

Czy wideo zostało przesłane do transkrypcji?

Nie. Przygotowanie audio i rozpoznawanie mowy odbywa się lokalnie na komputerze.

Jakie języki są obsługiwane?

Aktualny ekran ustawień wymienia mandaryński, kantoński, angielski, japoński i koreański.

Czy dokładność jest gwarantowana?

Nie. Wyniki zależą od języka, wyrazistości mowy, szumów tła, nakładania się dźwięków i nagrania źródłowego.