Generator napisów — SRT i VTT automatycznie

Prześlij wideo lub audio i odbierz plik napisów. Pierwsze 5 minut przetranskrybujesz niżej, bez konta.

5 minut bez konta · pliki do 200 MBSRT / VTT / TXT · 80 znaków i 7 s na cue99 języków

Przeciągnij i upuść plik audio lub wideo

albo kliknij, aby wybrać

Audio: MP3 · WAV · M4A · FLAC · OGG · AAC · AIFF · WMA · AMR · OPUS

Wideo: MP4 · MOV · AVI · MKV · WebM · FLV · WMV

Do 200 MB · pierwsze 5 minut za darmo, bez konta

Darmowy podgląd 5 minut · bez konta · pliki do 200 MB · zarejestruj się za darmo po 30 minut i pliki do 5 GB

Co to jest generator napisów i jak działa?

Generator napisów VexaScribe zamienia plik audio lub wideo w napisy w formacie SRT, VTT albo TXT — ze znacznikami czasu na poziomie pojedynczego słowa, w 99 językach. Pierwsze 5 minut przetranskrybujesz powyżej bez zakładania konta; darmowe konto daje 30 minut, a plany płatne idą od 2 $/miesiąc za 200 minut do 20 $/miesiąc za 6000 minut — czyli od około 0,20 $ do 0,60 $ za godzinę wideo, zależnie od planu. Podgląd bez konta przyjmuje pliki do 200 MB; po rejestracji limit rośnie do 5 GB. Wydajemy plik napisów, nie przetworzone wideo: napisów wtopionych w obraz nie renderujemy.

Który silnik przetworzy Twój plik

Przy każdym wgrywanym pliku wybierasz jakość transkrypcji, a za tym wyborem stoją dwa różne silniki rozpoznawania mowy — nie dwa ustawienia tego samego. Większość stron z napisami podaje jedną nazwę modelu i na tym kończy. My podajemy oba, bo wybór należy do Ciebie i ma swoją cenę w minutach.

JakośćSilnikKoszt w minutachKiedy wybrać
StandardOpenAI Whisper Large-v31 minuta na minutę audioCzysty dźwięk, jeden lub dwóch mówców, nagranie z mikrofonu
Premiummodel Premium2 minuty na minutę audioCichy, głośny lub akcentowany dźwięk, nakładające się głosy
Podgląd bez kontamodel PremiumPierwsze 5 minut za darmoNarzędzie na górze tej strony

Polski obsługują oba silniki, więc wybór nie jest za Ciebie podjęty. Jeden szczegół wart uwagi: darmowy podgląd na tej stronie korzysta z modelu Premium, a nie z Whispera. Jeśli założysz konto i wgrasz ten sam plik na planie Standard, wynik może różnić się w szczegółach — to inny model, nie ta sama transkrypcja w innym opakowaniu.

Nie powiemy Ci, który z nich jest lepszy po polsku, bo tego nie zmierzyliśmy. Dostawca modelu Premium opisuje go jako konkurencyjny wobec Whispera w głównych językach europejskich, ale publikowane liczby obu dostawców pochodzą z różnych zbiorów testowych i nie da się ich porównać wprost. Nie mamy własnego pomiaru dla polskiego — nie mamy polskiego nagrania z referencyjną transkrypcją, na którym można by go zrobić. Praktyczna rada bez udawania precyzji: zacznij od Standardu, a jeśli wynik rozjeżdża się na akcencie, szumie tła albo nakładających się głosach, przepuść ten sam plik przez Premium i porównaj.

Jak dzielimy mowę na cue

To jest różnica między napisami, które da się czytać, a takimi, za którymi widz nie nadąża. Poniższe wartości są tymi, których faktycznie używa nasz eksporter — możesz je sprawdzić, generując plik i licząc znaki.

ParametrWartość
Maksimum znaków na cue80
Minimum znaków na cue20 (próg miękki)
Maksymalny czas cue7 sekund
Minimalny czas cue1 sekunda
Sufit po korekcie czytelności10 sekund

Kolejność cięcia ma znaczenie większe, niż się wydaje. Algorytm szuka po kolei: pauzy trwającej co najmniej 0,4 sekundy, potem końca zdania, potem przecinka, a dopiero na końcu ostatniej granicy wyrazu mieszczącej się w limicie znaków. Pauza wyprzedza interpunkcję celowo: mówiący nie stawia kropek, tylko oddycha, a cztery dziesiąte sekundy ciszy wyznaczają jednostkę sensu lepiej niż przecinek wstawiony przez transkrypcję.

Po pierwszym cięciu plik przechodzi jeszcze kilka korekt: cue zbyt gęste tekstowo są wydłużane w stronę ciszy do tempa 15 znaków na sekundę; przerwy między 83 a 500 ms są domykane do 83 ms (dwie klatki przy 24 fps), bo krótsza dziura powoduje miganie napisu zamiast zmiany; a sąsiadujące, bardzo krótkie cue są łączone, jeśli wynik mieści się w limitach.

Jak działa generator napisów

1

1. Prześlij wideo lub audio

Plik metodą przeciągnij i upuść: MP3, WAV, M4A, FLAC (audio) lub MP4, MOV, MKV, WebM (wideo) do 5 GB. Przy wideo ścieżka dźwiękowa zostanie automatycznie wyodrębniona.

2

2. AI rozpoznaje mowę i mierzy czas cues

Whisper Large-v3 automatycznie wykrywa polski i produkuje znaczniki czasu na poziomie pojedynczego słowa. Przetwarzanie zajmuje zwykle 10–20 % długości nagrania.

3

3. Edytuj napisy online

W edytorze napisów online popraw literówki, przyklej mówców do właściwych osób, podziel długie cues, dodaj znaczniki nieverbalne — wszystko z podglądem wideo w czasie rzeczywistym.

4

4. Pobierz SRT, VTT lub TXT

SRT dla YouTube, Vimeo i edytorów wideo. VTT dla odtwarzaczy HTML5. TXT, jeśli potrzebujesz samego tekstu. Wydajemy plik napisów — nie renderujemy ich wewnątrz obrazu.

Dodaj napisy do filmu automatycznie

Automatyczne napisy do filmu to najszybszy sposób, by udostępnić treści niesłyszącym widzom, widzom oglądającym bez dźwięku oraz odbiorcom zagranicznym. Zamiast ręcznie ustawiać każdy cue w programie takim jak Aegisub, prześlij plik do VexaScribe — AI napisy do filmu wygenerują się w kilka minut z dokładnymi znacznikami czasu na poziomie słowa.

Nasz generator napisów AI obsługuje wszystkie popularne formaty wideo: MP4, MOV, MKV, WebM, a także konwersję mp4 na srt oraz mp4 to srt jednym kliknięciem. Napisy do filmu AI zapisujemy w UTF-8, więc polskie znaki diakrytyczne (ą, ę, ć, ń, ó, ś, ź, ż, ł) są kodowane poprawnie w każdym edytorze — od Premiere Pro po DaVinci Resolve i VLC.

Chcesz dodać napisy do filmu na YouTube? Wgraj wyeksportowany plik SRT w YouTube Studio → Napisy → Prześlij plik. Rolki i shorty są inną sprawą: tam napisy muszą być wtopione w obraz, a tego nie robimy — jak to obejść, opisujemy w sekcji o platformach poniżej.

Napisy do filmu online — darmowy edytor

VexaScribe to napisy do filmu online — całość działa w przeglądarce, nic nie instalujesz. Napisy do filmu za darmo dostajesz w ramach 30-minutowego pakietu startowego, a płatne plany zaczynają się od 2 $/miesiąc. Jeśli szukałeś „napisy do filmu program” do pobrania, warto spróbować rozwiązania webowego — jest szybsze, nie wymaga aktualizacji i działa na Windows, macOS oraz Linux.

Edytor napisów online pokazuje wideo w podglądzie po lewej, a lista cues z możliwością edycji — po prawej. Kliknij dowolne słowo, aby przejść do jego znacznika czasu. Popraw literówki jednym kliknięciem, zmień etykiety mówców, podziel lub połącz cues, dodaj notacje nieverbalne (np. [muzyka], [oklaski]) dla dostępności zgodnej z WCAG 2.1.

Godzina materiału, która w klasycznym programie do napisów zajmuje 5–8 godzin ręcznego ustawiania cue, u nas sprowadza się do kilku minut przetwarzania i krótkiej korekty w edytorze — realnie kwadrans, jeśli nagranie jest czyste.

Przykład: napisy SRT i VTT po polsku

Tak wygląda wyeksportowany plik napisów z polskiego nagrania — znaczniki czasu w formacie SRT (sekundy,milisekundy), kodowanie UTF-8, gotowe do wgrania w YouTube Studio, Premiere Pro, DaVinci Resolve i VLC.

Formaty eksportu:
TXTDOCXSRT
1
00:00:00,000 --> 00:00:05,000
Witamy z powrotem w podcaście. Dziś rozmawiamy o napisach generowanych przez AI.
2
00:00:05,000 --> 00:00:10,000
Właśnie — automatyczne napisy w ostatnich latach ogromnie się poprawiły.
3
00:00:10,000 --> 00:00:15,000
Whisper Large-v3 osiąga dla polskiego około pięć i cztery dziesiąte procent współczynnika błędów.
4
00:00:15,000 --> 00:00:20,000
To bardzo blisko wyników transkrybentów-ludzi.
5
00:00:20,000 --> 00:00:25,000
Dla kanałów w social media zwykle wystarczy bez dodatkowej korekty.
6
00:00:25,000 --> 00:00:30,000
A dla wiadomości albo prelekcji specjalistycznych warto zrobić krótki przegląd w edytorze.

Format napisów — SRT, VTT, TXT

VexaScribe eksportuje napisy w trzech formatach. Poniższa tabela pomaga wybrać właściwy do konkretnego zastosowania.

FormatRozszerzeniePlatformyStylowanieNajlepsze do
SRT.srtYouTube, Vimeo, Premiere Pro, DaVinci, Final Cut, VLCPodstawowe (tekst + czas)Longform, edycja wideo, LMS
VTT.vttHTML5, YouTube, Vimeo, nowoczesne odtwarzacze weboweKolor, pozycja, klasa CSSOsadzanie na stronie WWW, dostępność WCAG
TXT.txtKażdy edytor tekstu, notatki podcastówBrak znaczników czasuShow notes, artykuły, streszczenia

SRT (SubRip) i VTT (W3C WebVTT) to dwa najczęściej używane standardy napisów w internecie. Konwerter SRT ↔ VTT działa w naszym edytorze bezstratnie — te same znaczniki czasu, inny nagłówek pliku.

Platformy — YouTube, TikTok, Instagram Reels, LinkedIn, Vimeo

Każda platforma obsługuje napisy inaczej, a dwie z nich w ogóle nie przyjmą naszego pliku. Instagram Reels i YouTube Shorts wymagają napisów wtopionych w obraz, czego nie robimy — w tych dwóch wierszach tabela mówi, co z tym zrobić, zamiast udawać, że mamy rozwiązanie. Longform i platformy desktopowe przyjmują SRT bez problemu.

PlatformaFormat dostarczeniaUwaga
YouTube (longform)SRTUpload w YouTube Studio → Napisy. VTT też jest akceptowany.
YouTube ShortsNapisy wtopione w obraz (nie u nas)Pionowy interfejs przycina napisy z pliku SRT. Nasz SRT wczytasz do edytora, który je zrenderuje.
Instagram ReelsNapisy wtopione w obraz (nie u nas)Instagram nie przyjmuje pliku SRT dla rolek. Wygeneruj SRT u nas, renderuj w edytorze.
TikTokSRT jako podstawaEdytor TikToka przyjmuje plik SRT i pozwala dopracować wygląd po wczytaniu.
LinkedIn VideoSRTUpload SRT w edytorze wideo LinkedIn.
Facebook VideoSRTWgraj w Creator Studio → Napisy.
VimeoSRT lub VTTOdtwarzacz Vimeo obsługuje oba formaty; SRT jest najprostsze.
Platformy podcastoweTXTTXT do show notes i transkryptów odcinków (Apple Podcasts, Spotify).
Firmowe LMSSRT lub VTTWiększość LMS (Cornerstone, Docebo, Canvas) akceptuje oba. VTT w razie potrzeby pozycjonowania.

Wiersze dotyczące Instagram Reels, YouTube Shorts i TikToka poprawione 3 października 2026, po potwierdzeniu, że nie renderujemy napisów wewnątrz obrazu. Pozostałe wiersze opierają się na oficjalnych stronach pomocy YouTube, LinkedIn i Vimeo, sprawdzonych 23 sierpnia 2026.

Wyodrębnij napisy z filmu

Chcesz wyciągnąć napisy z filmu MP4, MOV lub WebM? Prześlij plik do VexaScribe — AI rozpozna mowę i wygeneruje plik SRT/VTT ze znacznikami czasu. Przetwarzanie zajmuje zwykle 10–20 % długości nagrania. Jeśli plik już zawiera wpalone napisy (burn-in), są one częścią obrazu i nie da się ich wyodrębnić jako tekst — trzeba wygenerować nowe z warstwy dźwiękowej.

Jeśli chcesz pobrać istniejące napisy z filmu na YouTube (bez ponownej transkrypcji), skorzystaj z naszej dedykowanej strony transkrypcja YouTube — pobierze dostępne napisy z filmu w formacie SRT lub TXT.

Program vs aplikacja online — porównanie podejść

Klasyczny program do napisów (Aegisub, Subtitle Edit, Subtitle Workshop) instalujesz lokalnie i pracujesz offline. Aplikacja do napisów online i strona do napisów, taka jak VexaScribe, działają w przeglądarce — bez instalacji, bez aktualizacji, na dowolnym systemie.

KryteriumProgram lokalnyAplikacja online
AutomatyzacjaRęczne cue-timingAI generuje w kilka minut
InstalacjaWymaganaNie
Praca offlineTakNie
99 językówZależy od modeluTak (Whisper Large-v3)
Czas dla 1 h wideo5–8 godzin10–20 minut

Precyzja napisów po polsku

Poniższa tabela pokazuje współczynnik błędów słów (WER) na benchmarku FLEURS — im niżej, tym lepiej. Zanim ją przeczytasz, jedna rzecz, o której większość stron milczy: te liczby opisują Whispera, czyli nasz plan Standard. Premium korzysta z innego modelu, której ta tabela nie dotyczy, podobnie jak darmowego podglądu na górze strony.

JęzykWER (FLEURS, Whisper large-v2)
Hiszpański3,0 %
Włoski4,0 %
Angielski4,2 %
Portugalski4,3 %
Niemiecki4,5 %
Japoński5,3 %
Polski (FLEURS)5,4 %
Niderlandzki6,7 %
Francuski8,3 %
Turecki8,4 %
Chiński (mandaryński)14,7 %
Arabski16,0 %

Źródło: Radford i in., Robust Speech Recognition via Large-Scale Weak Supervision, arXiv:2212.04356, sekcja D.2.4 (FLEURS). Wartości zmierzone dla modelu large-v2 na czytanym, studyjnym nagraniu. Nasz plan Standard uruchamia Large-v3 — nowszy model tej samej rodziny, ale nie ten, który zmierzył artykuł — a Premium zupełnie inny silnik. Traktuj więc te liczby jako sufit możliwości, nie jako opis tego, co dostaniesz: własnego pomiaru dla polskiego nie publikujemy, bo go nie zrobiliśmy. Nagrania z szumem tła, silnym akcentem, nakładającymi się głosami albo terminologią specjalistyczną wypadają wyraźnie słabiej niż czytany tekst z benchmarku.

Edytor napisów online — jak edytować SRT

Edytor napisów SRT w VexaScribe otwiera plik bezpośrednio w przeglądarce — nie potrzebujesz Subtitle Edit ani innego programu. Pracujesz z tekstem cue po cue, a zmiany zapisują się natychmiast. Można też przekonwertować SRT online do VTT lub TXT bez ponownej transkrypcji — nasz konwerter SRT działa bezstratnie.

  • • Popraw słowa jednym kliknięciem: znaczniki czasu automatycznie się dopasowują.
  • • Podziel lub połącz cues: na granicach wyrazów, dla lepszej czytelności.
  • • Zmień etykiety mówców: np. „Prowadzący”, „Gość 1” — labele zostają w eksporcie SRT.
  • • Dostosuj czas trwania cue: uwzględnij dramatyczne pauzy lub szybki dialog.
  • • Video SRT preview: synchroniczne odtwarzanie wideo obok listy cues.
  • • Eksport na nowo: SRT, VTT lub TXT — bez ponownej transkrypcji.

Video SRT działa w naszym edytorze w przeglądarce — nic nie musisz instalować.

Co jeszcze warto sprawdzić

Żadna automatyczna transkrypcja nie jest niezawodna, a miejsca, w których się potyka, są przewidywalne. Warto o nich wiedzieć przed publikacją, a nie po pierwszym komentarzu pod filmem.

  • • Nazwy własne i marki. Nazwiska, nazwy firm i produktów wypadają najgorzej, bo model zgaduje je ze samego brzmienia. Polska odmiana dokłada drugi problem: nawet gdy model rozpozna „Kowalski”, formy odmienione — „Kowalskiemu”, „z Kowalskim” — potrafi zapisać niekonsekwentnie w obrębie jednego pliku, więc sprawdź nazwisko w każdym wystąpieniu, nie tylko w pierwszym.
  • • Homofony. „lud” i „lód”, „Bóg” i „Buk”, „morze” i „może” — w polskim „ó” i „u” czyta się tak samo, podobnie „rz” i „ż”, więc model słyszy jedno, a zapisać musi jedno z dwóch. Rozstrzyga o tym kontekst, który dopiero Ty znasz.
  • • Nakładające się głosy. Kiedy dwie osoby mówią jednocześnie, rozdzielenie mówców i sam tekst tracą dokładność jednocześnie. To typowe dla dyskusji panelowych i luźnych rozmów w podcastach.
  • • Tekst pod muzyką. Śpiew i mowa w podkładzie muzycznym wypadają znacznie słabiej niż czysty dialog.
  • • Liczby i jednostki. Zapis słowny kontra cyfrowy („dwa tysiące” czy „2000”) bywa niekonsekwentny w obrębie jednego pliku.

Przejrzenie dziesięciominutowego nagrania w edytorze zajmuje zwykle dwie, trzy minuty i to jest realna różnica między napisami, które wyglądają profesjonalnie, a takimi, które wyglądają maszynowo. Sam edytor jest na razie po angielsku — interfejs, nie Twój tekst — więc jeśli wolisz poprawiać w czymś polskim, wyeksportuj SRT i otwórz go w dowolnym edytorze napisów.

Uczciwe ceny — bez zobowiązań

30 minut=~0 $ (okres próbny)
200 minut / miesiąc=~2 $
1000 minut / miesiąc=~5 $
2500 minut / miesiąc=~10 $
6000 minut / miesiąc=~20 $

Godzina wideo kosztuje w planie Basic (5 $/miesiąc) około 0,30 $ za pełne napisy — z eksportem SRT, VTT i TXT. Bez umowy na czas określony, możesz zrezygnować w każdej chwili.

Zobacz wszystkie ceny →

Ręczne tworzenie napisów vs VexaScribe

Ręczne napisy (Aegisub, Subtitle Edit)

  • ✗5–8 godzin pracy na godzinę materiału — cue-timing ręcznie
  • ✗Błędy czasu widoczne przy każdej zmianie montażu
  • ✗Każdy język trzeba osobno tłumaczyć i ponownie timować
  • ✗Brak automatycznej detekcji mówców — trzeba oznaczać ręcznie
  • ✗Znaki diakrytyczne (ą, ę, ł) często psują się przy złym kodowaniu

Idealne dla Projekty artystyczne, bardzo krótkie klipy lub przypadki ekstremalnie złej jakości audio

VexaScribe (automatycznie z Whisper Large-v3)

  • ✓5–10 minut na godzinę materiału — automatycznie z czasem na poziomie słowa
  • ✓99 języków z jednego uploadu, język wykrywany automatycznie
  • ✓Rozpoznawanie i automatyczne etykietowanie mówców
  • ✓Eksport SRT/VTT w UTF-8, polskie znaki kodowane poprawnie
  • ✓Edytor do korekty, dzielenia cues, zmiany nazw mówców

Idealne dla Kanały YouTube, rolki social media, podcasty, e-learning, materiały marketingowe, konferencje

Kluczowe funkcje

Wszystko, czego potrzebujesz do profesjonalnych napisów z wideo lub audio — w jednym narzędziu.

99 języków w tym polski

Plan Standard obsługuje 99 języków, Premium 55 — polski jest w obu. Język wykrywany automatycznie, bez ręcznego przełączania.

SRT, VTT i TXT

Trzy formaty napisów z jednego przetworzenia. Dla YouTube, Vimeo, LinkedIn, DaVinci Resolve, Premiere Pro i CapCut.

Rozpoznawanie mówców

Automatyczne rozpoznawanie mówców etykietuje każdego z osobna.

Znaczniki czasu na słowo

Początek i koniec cue leżą na rzeczywistych granicach wyrazów, nie na interpolowanych środkach segmentu.

Edytor napisów z podglądem wideo

Korekta jednym kliknięciem, zmiana nazw mówców, podział cues — zmiany od razu widoczne w podglądzie.

Pliki do 5 GB

Długie nagrania konferencji, wykładów lub wywiadów obsługiwane bez dzielenia.

Częste pytania

Jak działa generator napisów AI?

Prześlij plik audio lub wideo metodą przeciągnij i upuść albo przez okno wyboru pliku w VexaScribe. Rozpoznawaniem mowy zajmuje się jeden z dwóch silników, zależnie od wybranej jakości: Whisper Large-v3 na planie Standard albo model Premium na Premium. Oba dopasowują znaczniki czasu na poziomie słowa i budują plik napisów. Po zakończeniu możesz wyeksportować napisy jako SRT lub VTT — oba formaty są zgodne z YouTube, TikTokiem, LinkedIn i większością edytorów wideo. Cały proces trwa zwykle kilka minut.

Czy generator napisów online jest darmowy?

Tak. VexaScribe udostępnia darmowy generator napisów z 30 minutami transkrypcji na start — bez karty kredytowej. Płatne plany zaczynają się od 2 $/miesiąc za 200 minut (Starter). Automatyczne napisy, edytor napisów online oraz eksport do SRT, VTT i TXT działają na wszystkich planach, także darmowym. Pierwsze 5 minut przetranskrybujesz bez zakładania konta, bezpośrednio na tej stronie.

Jak dodać napisy do filmu automatycznie?

Aby dodać napisy do filmu, prześlij plik MP4, MOV, MKV lub WebM — ścieżka dźwiękowa zostanie automatycznie wyodrębniona. AI wygeneruje napisy z dokładnymi znacznikami czasu. Gotowy plik pobierzesz jako SRT lub VTT i wgrasz do YouTube, Vimeo albo swojego edytora wideo. Nie renderujemy napisów wewnątrz obrazu — wydajemy plik napisów, nie nowe wideo.

Czy zrobię napisy do rolek na Instagramie i TikToku?

Instagram Reels nie przyjmuje osobnego pliku SRT przy natywnym uploadzie, a pionowy interfejs YouTube Shorts przycina napisy z pliku sidecar. Trzeba je więc wtopić w obraz — a tego nie robimy: VexaScribe wydaje plik napisów, nie przetworzone wideo. W praktyce masz dwie drogi. Wygeneruj u nas SRT z dokładnymi znacznikami czasu i wczytaj go do edytora, który renderuje napisy w obrazie (CapCut, Premiere Pro, DaVinci Resolve) — tekst i czas są już gotowe, zostaje tylko wygląd. Albo użyj wbudowanych napisów samej aplikacji i popraw je ręcznie, jeśli zależy Ci na czasie, a nie na dokładności.

Jaka jest różnica między formatem SRT a VTT?

SRT (SubRip) to najczęściej używany format napisów — prosty, uniwersalny i akceptowany praktycznie przez każdą platformę wideo oraz edytor. VTT (WebVTT, standard W3C) to nowszy format webowy, który obsługuje dodatkowe opcje stylistyczne, takie jak kolor czcionki i pozycjonowanie. W większości przypadków bezpieczniejszym wyborem jest SRT. Wybierz VTT, jeśli osadzasz wideo w HTML5 i potrzebujesz stylowania.

Czy mogę edytować napisy przed pobraniem?

Tak. Po transkrypcji możesz sprawdzić i edytować cały tekst we wbudowanym edytorze napisów online. Popraw słowa, dopasuj czas, zmień etykiety mówców, a następnie wyeksportuj poprawioną wersję jako SRT lub VTT. Otrzymasz napisy w jakości profesjonalnej bez ręcznego dopasowywania czasu.

Jak wyodrębnić napisy z filmu (mp4 to srt)?

Aby wyodrębnić napisy z filmu MP4, prześlij plik do VexaScribe — AI rozpoznaje mowę i buduje plik SRT ze znacznikami czasu. Przetwarzanie zajmuje zwykle 10–20 % długości nagrania. Jeśli chcesz wyodrębnić istniejące napisy z YouTube (a nie wygenerować nowe), skorzystaj z naszej strony transkrypcji YouTube, która pobiera dostępne napisy z filmu.

Ile języków obsługuje generator napisów AI?

Plan Standard (Whisper Large-v3) obsługuje 99 języków, w tym polski. Premium (model Premium) obsługuje 55 — polski jest w obu, więc wybór jakości należy do Ciebie. Język jest wykrywany automatycznie z nagrania lub możesz wskazać go ręcznie dla najlepszych wyników — szczególnie przy krótkich klipach.

Program czy strona do napisów — co wybrać?

Program do napisów (np. Aegisub, Subtitle Edit) daje pełną kontrolę, ale wymaga instalacji, ręcznego wyznaczania klatek i wielu godzin pracy. Strona do napisów online, taka jak VexaScribe, działa w przeglądarce, generuje napisy automatycznie w kilka minut i eksportuje SRT/VTT gotowe do wgrania. Aplikacja do napisów online jest lepszym wyborem dla większości twórców, marketerów i redakcji — offline'owy program tylko wtedy, gdy pracujesz bez internetu.

Dlaczego napisy się nie mieszczą na ekranie?

VexaScribe dzieli cue na granicach słów: do 80 znaków i zwykle 1–7 sekund, z celem tempa czytania 15 znaków na sekundę. Te wartości pochodzą z naszego eksportera, nie z cudzego przewodnika — możesz je sprawdzić, generując plik i licząc znaki. Podziały preferują granice zdań, potem przecinki, a na końcu granice wyrazów. Etykiety mówców pozostają zachowane przy każdym podziale, dzięki czemu napisy importują się czysto do YouTube, Premiere Pro, Final Cut Pro, DaVinci Resolve i VLC bez ręcznej korekty.

VexaScribe korzysta z dwóch silników rozpoznawania mowy, zależnie od wybranej jakości: OpenAI Whisper Large-v3 (plan Standard) oraz model Premium (Premium i darmowy podgląd bez konta). Podana wartość 5,4 % współczynnika błędów słów dla polskiego pochodzi z artykułu Radford i in., „Robust Speech Recognition via Large-Scale Weak Supervision”, arXiv:2212.04356, sekcja D.2.4, i została zmierzona dla modelu large-v2 na benchmarku FLEURS — nie jest to pomiar naszego wyniku ani opis obu silników. Rzeczywista dokładność zależy od jakości audio, liczby mówców, akcentów i terminologii specjalistycznej. Parametry cięcia cue (80 znaków, zwykle 1–7 sekund, cel 15 znaków na sekundę) pochodzą z naszego eksportera i są zgodne z powszechną praktyką napisową, w tym z zaleceniami Netflix Timed Text Style Guide i BBC Subtitle Guidelines — nie są z nich przepisane. „OpenAI” i „Whisper” są znakami towarowymi ich właścicieli. YouTube, TikTok, Instagram, Meta, LinkedIn, Vimeo, Netflix, Premiere Pro, Final Cut Pro i DaVinci Resolve są znakami towarowymi odpowiednich dostawców — nie mają żadnych powiązań handlowych z VexaScribe.