動画 字幕 自動生成 — 無料〜有料8ツール比較 (2026年版)

動画または音声をアップロードすると、SRT・VTT・TXT の字幕ファイルを生成します。最初の5分はアカウントなしで下のツールから試せます。日本語の字幕で実際に何が起きるか(全角の文字数の扱い、句点での分割)も下に明記しています。

最初の5分はアカウント不要 · 200 MB までSRT / VTT / TXT99言語

音声または動画ファイルをドラッグ&ドロップ

クリックしてファイルを選択

音声: MP3 · WAV · M4A · FLAC · OGG · AAC · AIFF · WMA · AMR · OPUS

動画: MP4 · MOV · AVI · MKV · WebM · FLV · WMV

200 MB まで · 最初の5分は無料、アカウント不要

最初の5分は無料 · アカウント不要 · 200 MB までのファイル · 無料登録 で30分・5 GB まで

2026年10月3日 更新

30秒でわかる要点

動画字幕を自動生成する主要ツール: VexaScribe (99言語・SRT/VTT/TXT), Notta (日本語特化), Vrew (動画編集+字幕統合・長尺向け), CapCut (無料・ショート動画向け), TurboScribe (無制限プラン安い), YouTube Studio(自動字幕・無料・字幕ファイルの書き出しは不可)。Premiere/Final Cut/DaVinci Resolve はいずれも SRT の読み込みに対応しています。日本語の字幕については、当社の書き出しで実際に起きること(全角1文字を1文字として数える点、句点「。」で区切られない点)を下の「日本語の字幕で起きること」に明記しています。

字幕 vs 文字起こし — 何が違うか

「字幕」と「文字起こし」は似ていますが、目的とフォーマットが違います。

🎬 字幕 (Subtitle)

動画に同期して表示するテキスト。SRT/VTT 形式。

タイムスタンプが厳密 (「00:03:15 → 00:03:18: こんにちは」)。動画編集ソフトに読み込んで動画に焼き付け (ハードサブ) または字幕トラック追加 (ソフトサブ)。

📝 文字起こし (Transcript)

動画・音声の内容をテキストのみで書き起こしたもの。TXT/DOCX 形式。

動画同期不要、記事・議事録・研究資料として使う。タイムスタンプは省略または段落単位。音声ファイルの詳しいツール比較は 音声文字起こしAIおすすめ7選を参照。

8ツール比較 — 役割で選ぶ

ツールSRTVTTTXT特徴
VexaScribe◎◎◎99言語 · 5GB 大ファイル
Notta◎◎◎日本語特化
Vrew◎◯◎動画編集+字幕統合 · 無音カット
CapCut◎△◎ショート動画特化 · TikTok 系
TurboScribe◎◎◎Whisper large-v3 · 大量向け
YouTube Studio◎×◎YouTube 動画のみ · ファイル書き出し不可
Canva△×◎デザイン豊富
Rimo Voice◎◎◎日本語特化 · 高精度

◎ = 完全対応、◯ = 対応、△ = 制限あり、× = 非対応。ツールごとの精度の数値と料金は掲載していません。精度については各社の測定条件が異なり、当社でこれらのツールを比較測定したわけではないためです。料金は改定が頻繁で、各社の公式ページでご確認いただくのが確実です。

日本語の字幕で起きること

日本語の字幕には、英語の字幕とは別の制約があります。ここは当社の書き出しで実際に 起きることを書いた箇所で、いまのところ2点、改善前の状態です。いずれもご自身で ファイルを生成して確認できます。

全角1文字を1文字として数えます

当社の書き出しは、1つのキュー(字幕の1区切り)を 80文字までに制限しています。ただしこの「80文字」は コードポイント数であり、「日」も「a」も1文字として数えます。 全角文字は半角文字のおよそ2倍の幅を占めるため、80文字の日本語キューは、80文字の 英語キューより画面上で約1.8倍の幅になります。

実際の出力は内容によって1行13〜25文字(全角換算)あたりに収まります。配信向けの 一般的な字幕慣習(1行26文字前後)には収まる範囲ですが、NHK の放送字幕スタイル (1行16文字前後)を基準にすると、1行あたりの文字数が1.5倍ほど多くなります。致命的ではありませんが、 最適でもありません。

放送水準の行長が必要な場合は、エディタでキューを手動で分割してください。CJK の 文字幅を考慮した上限の適用は改善予定として起票済みです。

句点「。」読点「、」では区切られません

分割位置を決める処理が認識するのは、ASCII の . ! ? , だけで、しかも直後に半角スペースがあることを条件にしています。日本語の文章には どちらもないため、「。」も「、」も分割点として機能しません。

結果として、長い発話は文の区切りではなく 80文字ちょうどの位置で切られます。語の途中、 助詞の途中で切れることもあります。あわせて 禁則処理も適用されません。行頭に「、」や「。」が 来ることを防ぐ処理は入っていないため、81文字目がそれらであれば行頭に出ます。

もう1点、関連する事情があります。Whisper は英語では単語単位のタイムスタンプを 返しますが、日本語ではセグメント単位しか返さないことが多く、その場合は上記の テキストのみを見る分割処理が使われます。日本語は2つある経路のうち、精度の低い 側を通りやすい状態です。

日本語の句読点の認識と禁則処理の追加も改善予定として起票済みです。現時点では、 公開前にエディタでキューの区切りを調整していただくのが確実です。本来はツール側で 行うべき作業であり、いまお客様にお願いしている状態である点は、そのまま申し添えます。

どのエンジンが処理するか

ファイルをアップロードするたびに品質レベルを選びます。この選択の背後にあるのは 同じ仕組みの設定違いではなく、2つの別の音声認識エンジンです。消費する分数も 変わります。

レベルエンジン消費する分数向いている音声
StandardOpenAI Whisper Large-v3音声1分につき1分マイク収録のクリアな音声、話者1〜2名
PremiumPremium モデル音声1分につき2分小さい音声、騒がしい音声、訛りのある音声、発話の重なり
アカウントなしのプレビューPremium モデル最初の5分は無料このページ上部のツール

日本語は両方のエンジンが対応しているため、選択はお客様に委ねられています。1点 お伝えしておくと、このページ上部の無料プレビューは Whisper ではなく Premium モデルを 通ります。アカウントを作成して同じファイルを Standard でアップロードすると、 結果が細部で変わることがあります。同じ文字起こしの体裁違いではなく、別のモデルです。

どちらが日本語で優れているかは申し上げません。測定していないためです。 Premium モデルの提供元は、主要なヨーロッパ言語で Whisper と競合する水準と説明して いますが、公表されている数値は測定条件が異なり、そのまま比較できません。 実用的な進め方としては、まず Standard で試し、訛り・背景雑音・発話の重なりで 結果が崩れる場合に同じファイルを Premium に通して比べてみてください。

精度について引用できる数値は、OpenAI の論文にある FLEURS ベンチマークの値のみです (arXiv:2212.04356、D.2.4 節)。日本語は large-v2 で 5.3%。これは上限を示す数値で、 お客様の結果を説明するものではありません。当社として日本語の実測値は公表していません — 参照用の書き起こしと対照して測定したことがないためです。

SRT/VTT/TXT — フォーマット解説

字幕のファイル形式で、どのソフトが何に対応するかを整理しました。

📄 SRT (SubRip)

最も一般的な字幕形式。テキストとタイムスタンプのシンプル構造。

対応: Premiere Pro, Final Cut Pro, DaVinci Resolve, CapCut, Vrew, YouTube, TikTok, Instagram (アップロード時変換), Netflix / Amazon 系動画配信 (審査あり)。動画編集ソフトに読み込む場合は SRT が最も安全。

🌐 VTT (WebVTT)

Web 標準の字幕形式。HTML5 video タグで直接表示可能、スタイル指定 (色・位置・フォント) も可能。

対応: HTML5 video プレイヤー全般、YouTube、Web 動画配信サイト、一部の動画編集ソフト (Premiere Pro など)。Web サイトに埋め込む動画には VTT。

📝 TXT (プレーンテキスト)

タイムスタンプなしのプレーンテキスト。動画字幕には向かないが、文字起こしとして活用可能。

用途: 記事化、議事録、研究資料、SNS 投稿の下書き、ChatGPT に貼り付けての要約など。動画字幕には SRT/VTT を使う。

プラットフォーム別 字幕ワークフロー

🎥 YouTube に字幕をつける方法

  1. VexaScribe / Notta / Vrew で動画の SRT ファイルを生成
  2. YouTube Studio → 対象動画 → 字幕タブ
  3. 「言語を追加」→ 日本語 (他言語も追加可能)
  4. 「字幕を追加」→「ファイルをアップロード」→ SRT を選択
  5. タイミング・翻訳設定を確認して保存

YouTube の自動字幕は字幕ファイルとして書き出せないため、あらかじめ SRT を用意しておくと編集作業がそのまま進められます。YouTube 動画からの文字起こし方法は YouTube文字起こしガイドで詳しく解説。

📱 TikTok / Instagram Reels に字幕をつける方法

2つのアプローチ。

方法1: アプリ内蔵の自動字幕 (簡単・無料)

TikTok: 編集 → 字幕 → 自動生成。Reels: 編集 → ステッカー → 自動字幕。日本語対応。編集の自由度は限定的。

方法2: 事前に高品質字幕を作成 (プロ向け)

CapCut または VexaScribe で SRT を生成 → 動画に焼き付けて (ハードサブ) TikTok/Reels にアップロード。字幕の位置・色・アニメーションを制御可能。ショート動画で差別化したい場合はこちら。

🎬 Premiere Pro / Final Cut / DaVinci Resolve のワークフロー

Adobe Premiere Pro

「ファイル」→「読み込み」→ SRT を選択。または内蔵の「音声からキャプション」機能 (2022+) で自動生成 (日本語対応、精度は Whisper 系より若干劣る)。字幕のスタイル (色・フォント・位置) はキャプション パネルで編集可能。

Final Cut Pro (10.4.1+)

字幕トラックに SRT をドラッグ&ドロップで読み込み可能。タイムラインで直接編集、Roles で字幕言語ごとに管理。CapCut / Vrew で編集した動画を Final Cut に持ち込む場合は SRT 経由が推奨。

DaVinci Resolve

Studio 版でも自動字幕の生成に対応しています(料金は公式ページをご確認ください)。Free 版は SRT の読み込みのみ。VexaScribe / Notta で高精度 SRT を生成 → 読み込みが最も柔軟。

用途別おすすめ

📱 TikTok / Reels ショート動画 (60秒以内)

→ CapCut または アプリ内蔵字幕 — スマホで完結、無料、字幕スタイル豊富。

🎥 YouTube 長尺動画 (10分以上・解説動画)

→ Vrew (動画編集+字幕統合) または VexaScribe → YouTube Studio に SRT アップロード

📢 セミナー・ウェビナー動画 (2時間以上の長尺)

→ VexaScribe (5GB 対応) または TurboScribe — 大ファイル対応が有利。

🎬 プロ向け動画編集 (Premiere/Final Cut/DaVinci Resolve 使用)

→ VexaScribe / Notta で SRT 生成 → 編集ソフトに読み込み — Whisper 系の方が編集ソフト内蔵より精度が高い。

🌐 多言語字幕 (英語動画に日本語字幕など)

→ VexaScribe (英字幕生成) + DeepL (翻訳) または Notta Pro の自動翻訳字幕

💰 予算ゼロ・YouTube 動画のみ

→ YouTube 自動字幕 → 手動編集 — 精度は低いが完全無料で完結。

🎯 日本語特化・高精度重視

→ Rimo Voice または Notta Business — 日本語に特化したサービスです。精度を比較した数値は当社では測定していません。

よくある質問

動画に字幕を自動生成する一番簡単な方法は?

3つの選択肢があります: (1) YouTube Studio の自動字幕 — 完全無料、YouTube にアップした動画に自動生成される。YouTube Studio 上で編集もできますが、字幕ファイルとして書き出すことはできません。(2) 動画ファイルを VexaScribe / Notta / Vrew にアップロード → SRT/VTT/TXT でエクスポート → 動画編集ソフトに読み込み。(3) CapCut / Vrew / Premiere Pro などの動画編集ソフト内の自動字幕機能を使う (編集と字幕生成を同じソフトで完結)。用途で選択。

SRT と VTT の違いは?

どちらも字幕ファイル形式ですが対応先が違います。<strong>SRT (SubRip)</strong>: 最も一般的、Premiere Pro/Final Cut/DaVinci Resolve/CapCut/Vrew/YouTube 全て対応、テキストのみのシンプル形式。<strong>VTT (WebVTT)</strong>: Web 動画向け、HTML5 video タグで直接表示可能、スタイル指定 (色・位置) が可能、YouTube・HTML5 プレイヤー対応。動画編集ソフトに読み込む場合は SRT、Web サイトで直接表示する場合は VTT を選択。

自動生成された字幕の日本語精度はどのくらい?

Whisper Large-v3 を使うツール(VexaScribe、TurboScribe など)と、日本語に特化したサービス(Notta、Rimo Voice)、動画編集に字幕が統合されたもの(Vrew、CapCut)に大きく分かれます。ツールごとの精度の数値は掲載していません。各社の測定条件が異なり、当社でこれらを比較測定したわけではないためです。どのツールでも、専門用語・固有名詞・訛り・複数話者の重なり・BGM のある音声では精度が落ちるという点は共通しています。字幕は Whisper 系ツールで生成 → 動画編集ソフトで微修正、が現実的なワークフロー。

YouTube に自動字幕をアップロードする方法は?

手順: (1) VexaScribe / Notta で動画から SRT ファイルを生成、(2) YouTube Studio → 対象動画 → 字幕タブ、(3) 「言語を追加」→ 日本語 (または対象言語)、(4) 「字幕を追加」→「ファイルをアップロード」→ SRT を選択、(5) タイミング・翻訳ありなしを選択して保存。YouTube 自動字幕を使うより、事前に高精度な SRT を作成してアップロードする方が編集時間を大幅に短縮できます。

TikTok や Instagram Reels に字幕を付ける方法は?

TikTok と Reels は動画アプリ内で撮影・編集する場合、内蔵の自動字幕機能があります (TikTok: 編集 → 字幕、Reels: 編集 → ステッカー → 自動字幕)。日本語対応、無料。編集の自由度は限定的。高品質な字幕が必要なら別途 CapCut や VexaScribe で SRT を作成 → 動画に焼き付けて (ハードサブ) TikTok/Reels にアップロードする方式が一般的。ショート動画向けは字幕の位置・色・アニメーションも重要な要素です。

Premiere Pro / Final Cut Pro / DaVinci Resolve で字幕を扱う方法は?

3ソフト共に SRT/VTT の読み込みに対応。<strong>Premiere Pro</strong>: 「ファイル」→「読み込み」→ SRT を選択、または内蔵の「音声からキャプション」機能 (2022+) で自動生成可能。<strong>Final Cut Pro</strong>: 字幕トラックに SRT をドラッグ&ドロップで読み込み可能 (10.4.1+)。<strong>DaVinci Resolve</strong>: 「Studio」版で自動字幕生成、Free 版は SRT の読み込みのみ対応。VexaScribe / Notta で SRT を生成 → 各ソフトに読み込むワークフローが精度・柔軟性の両面で優位。

CapCut と Vrew の違いは?

<strong>CapCut</strong> (ByteDance/TikTok): 動画編集ツール、自動字幕機能付き、無料、TikTok/Instagram 向けショート動画に最適化。日本語対応・多言語対応。字幕のアニメーション・スタイル種類が豊富。<strong>Vrew</strong> (Voyager X): 動画編集 + 自動字幕統合、無音カット・不要部分自動削除機能、日本語 UI 完備、無料版と有料版あり。長尺動画 (10分以上) では Vrew の編集効率が高い。ショート動画中心なら CapCut、長尺の解説動画やインタビュー動画なら Vrew。両方無料版があるので試して選ぶのが実用的。

字幕生成の料金はどのくらい?

無料で使えるものとしては、YouTube Studio の自動字幕(ただし字幕ファイルとしては書き出せません)、CapCut の自動字幕、Vrew の無料版、CLOVA Note などがあります。当社も最初の5分はアカウントなしで、無料アカウントで月30分までお使いいただけます。有料プランは月額2ドル(200分)から20ドル(6000分)です。他社の料金と無料枠は改定が頻繁なため掲載していません。各社の公式ページでご確認ください。動画が100本あるような大量処理では、1本あたりの単価が下がる月額プランのほうが向いています。

字幕に話者名を入れる (発言者ラベル) は可能?

はい。話者の自動ラベル付けが有効になった場合、字幕に「話者1: 」「話者2: 」などのラベルが自動で付きます。編集画面で実名(「田中: 」など)に変更でき、SRT/VTT の書き出し時にも保持されます。この機能は日本語でも適用されますが、日本語特有の精度は測定していないため数値は公表していません。インタビューや座談会のように相槌(はい、ええ、そうですね)が頻繁に重なる音声では、隣接する話者がまとまってしまうことがあります。その場合はエディタで話者を付け直せます。音声全般の詳しいツール比較は <a href='/ja/mojiokoshi'>音声文字起こしAIおすすめ7選</a>を参照してください。

動画の字幕を英語→日本語に翻訳する方法は?

3つの方法: (1) VexaScribe で英語動画を英字幕生成 → DeepL/Google 翻訳で SRT テキストを翻訳 → 日本語 SRT を動画に再度適用。(2) Notta の自動翻訳字幕機能 (Pro プラン以上) を使う。(3) YouTube 動画なら YouTube 自動翻訳字幕機能で日本語表示可能 (精度は元字幕依存)。より高品質な翻訳字幕が必要なら (1) の方法で DeepL の翻訳品質を活用するのが最も自然。

VexaScribe で動画字幕を生成する

30分無料 · SRT/VTT/TXT エクスポート · 99言語対応。Premiere/Final Cut/DaVinci Resolve/CapCut/Vrew すべてで読み込み可能な SRT を生成。

30分無料で始める →