2026年10月6日から、ChatGPTに音声ファイルをアップロードして、文字起こしや要約ができるようになりました。

私は普段、動画の字幕をCapCutで作っています。動画を読み込んで、必要な部分だけをカットしたあと、キャプションの自動生成で字幕を出して、手で直すやり方です。

ただ、アイドルのコールのような難しい言葉は、CapCutの自動生成ではほとんど正しく認識されません。そういう動画は、ほぼ全文を打ち直しています。

「一日一コール感謝のラミネート」の動画では、最初と最後の2回コールを打つので、その作業も2回です。直した分だけ字幕の帯をずらして合わせるので、タイミングもどうしても少しずつずれてしまいます。

そこで、動画から音声を抜き出してChatGPTに渡したら、文字起こしから字幕用のSRTファイルまで作れるのかを試してみることにしました。作ったSRTが、CapCutにそのまま読み込めるかも確かめます。

この記事では、まず公式の情報で「ChatGPT Plusで何ができて、何に制限があるのか」を整理し、そのあとに実際の画面と出力を記録していきます。

公式の情報で確認できたこと(ChatGPT)

2026年10月11日に、OpenAIのリリースノートとヘルプ記事「Uploading files and audio to ChatGPT」を確認しました。

使えるプラン

音声のアップロードは、有料のChatGPTサブスクリプションとワークスペースで使えると書かれています。無料プランでは、今のところ使えません。

ヘルプにはPlusという名前が個別に書かれているわけではありませんが、Plusも有料プランなので、対象に入ると考えていました。実際に、私のPlusのスマホアプリでも、MP3を添付して送ることができました。

また、使えるかどうかは、地域やアプリのバージョン、選んでいるモデルによって変わることがあるとも書かれています。

対応している音声の形式とサイズ

対応している形式は、WAV、MP3、OGG、音声だけのWebM、PCM、FLAC、AAC、M4A、音声だけのMP4です。

ファイルの大きさは、1つ512MBまでです。

動画ファイルはそのままでは渡せない

ここが今回いちばん大事な点でした。ヘルプには、動画として認識されるMP4やWebMは、音声のアップロードに対応していないと書かれています。

つまり、撮った動画をそのまま渡すのではなく、先に音声だけを抜き出す必要があります。

長い録音と精度について

録音の長さの上限は、ヘルプには書かれていませんでした。長い録音は、データ分析の機能が使える場合に小分けにして処理されることがあり、とても長いものは時間切れになることがある、とされています。

精度については、文字起こしには誤りが含まれることがあり、話している人の区別も正確でないことがある、言語によって精度が変わる、と書かれています。大事なところは元の録音と照らし合わせるように、とも書かれています。

書かれていなかったこと

今回の検証で知りたい次の2点は、公式のヘルプには書かれていませんでした。

  • 文字起こしに、タイムコード(何秒から何秒か)が付くかどうか
  • SRTなどの字幕ファイルとして出力できるかどうか

この2つは、実際に試して確かめます。

アップロードの回数

ファイルのアップロードは、3時間ごとに80ファイルまでと書かれています。混み合う時間帯には、この上限が下がることがあるそうです。

公式の情報で確認できたこと(CapCut)

CapCutのヘルプ「字幕をインポートする方法は?」も確認しました。

PC版では、上のメニューの「キャプション」から「キャプションの追加」を選んで、ファイルを読み込むと書かれています。

検証の条件

今回は、コールの動画で試しました。「一日一コール感謝のラミネート」の企画で、私がアッチェレ終幕ジャパ可変(16小節)を打っている動画です。2026年8月15日に、この企画用の素材として撮った動画です。

この動画は、実際に字幕を付けてTikTokに投稿しています。(TikTok:https://vt.tiktok.com/ZSbcAkreb/ )

コールは、「虎」「火」「人造」「繊維」のような単語が、とても速いテンポで続きます。普通の会話よりも、文字起こしにはかなり厳しい音声だと思います。

  • 音声ファイル:MP3、長さ25.7秒、約412KB
  • 音声の抜き出し方:ブラウザで使えるfreeconvertというサイトで、動画から音声を保存
  • ChatGPT:Plus、スマホのアプリ、モデルはGPT-6.1 Sol(思考の強さは「高い」)、2026年10月11日に検証
  • CapCut:スマホのアプリ

(内部リンク:アッチェレ終幕ジャパ可変の記事 https://choconono.com/call-practice-acchere-syumaku-japakahen/ /一日一コール感謝のラミネート https://choconono.com/daily-call-lamination/ )

手順1:動画から音声を抜き出す

最初は、いつも動画の編集に使っているCapCutで音声を書き出そうと思いました。ただ、スマホのアプリでは、音声だけを保存する方法が見つけられませんでした。

そこで、ブラウザで使えるfreeconvertというサイトに動画ファイルをアップロードして、音声ファイル(MP3)として保存しました。スマホのブラウザから、そのまま使えます。

freeconvertで動画からmp3の音声ファイルへの変換が終わった画面

変換したファイルは、プライバシー保護のため、一定の時間がたつと自動で削除されると画面に書かれていました。削除される前に、ダウンロードしておく必要があります。

手順2:ChatGPTに音声を渡して、SRTまで頼む

スマホのChatGPTアプリで、MP3を添付して、次の一文だけを送りました。

この音声ファイルから文字起こしして字幕用のSRTファイルを作って

形式や区切り方の細かい指定はしていません。

ChatGPTにmp3ファイルを渡し、この音声ファイルから文字起こしして字幕用のSRTファイルを作ってという指示を出したスクリーンショット。

ChatGPTからは、まず「音声を文字起こしして、発話のタイミングに合わせたSRTファイルを作ります。字幕は読みやすい長さに区切ります。」と返ってきて、作業が始まりました。

頼んでから出力されるまで、7分ほどかかりました。その様子を録画した動画です。

(YouTube埋め込み: )

作業中、ChatGPTは画面に途中経過を出していました。主なものを、順番に抜き出します。

  • 「音声は約26秒です。音声認識を進めています。文字起こしの結果から字幕を区切り、表示時刻が重ならないことも確認します。」
  • 「最初の認識結果では、掛け声のような部分に誤認識が多く出ています。別の音声認識モデルでも確認し、確定できない言葉を勝手に補わない形で字幕にします。」
  • 「追加の認識処理を待っています。通常の会話よりも単語を確定しにくい結果が出ているため、読みやすさより先に文字起こしの確認を進めています。」
  • 「11件のウェブサイトを検索しました」
  • 「『農場』『虎』『海女振動』など、MIXの用語が候補として出ています。漢字表記はちょこののーとのコール一覧も参考にしていますが、高速部分にはまだ不確かな箇所があります。そこを再確認してからSRTにまとめます。」
ChatGPTがSRT出力作業中にMIXの分かりにくい単語を起こすのにちょこののーとのコール一覧を参考にしていると表示された画面。

途中で、Pythonを動かして音声認識をしていることも表示されていました。1回の認識で終わりにせず、別のモデルでも確かめていたようです。

そして、漢字の表記は、私のブログのコール一覧を参考にしていました。

コールの単語は、普通の辞書にはない並びがほとんどです。音だけでは決めきれない言葉を、外の情報で確かめながら埋めていく。ここは、ChatGPTで文字起こしをするからこそできることだと感じました。

(内部リンク:ライブアイドルのコール一覧 https://choconono.com/idol-call-dictionary/ )

手順3:出てきたSRTファイル

SRTは、ダウンロードできるファイルとして出てきました。

YouTube動画の最後にはダウンロードをするところまで収めています。

中身は20個の字幕に分かれていて、文字コードはUTF-8でした。最初の字幕が0.72秒から始まり、最後の字幕は24.15秒で終わっています。

冒頭の4つは、次のとおりです。

1
00:00:00,720 --> 00:00:01,400
農場

2
00:00:01,400 --> 00:00:02,100
舞

3
00:00:02,100 --> 00:00:03,150
【要確認:海鵜】

4
00:00:03,150 --> 00:00:03,650
跳

面白かったのは、ChatGPTが自信のないところに、自分で【要確認】の印を付けてきたことです。途中経過で「確定できない言葉を勝手に補わない」と言っていたとおりの出し方でした。20個の字幕のうち3つが、次のような印付きでした。

  • 【要確認:海鵜】(2か所)
  • 【高速部分・聞き取り要確認】(1か所)

答え合わせをすると、「海鵜」は合っていました。高速部分は、「虎 火 人造 繊維」を4倍速で打っているところです。

確認1:字幕の言葉

20個の字幕のうち、手で直す必要があったのは、ChatGPTが【要確認】の印を付けた3つでした。

字幕の番号ChatGPTの字幕直したあと理由
3・18【要確認:海鵜】海鵜言葉は合っていた。印を消すだけ
10【高速部分・聞き取り要確認】虎火人造繊維(4倍速)速すぎて聞き取れなかった部分

ほかの17個の字幕は、言葉もそのまま使えました。

確認2:タイムコード

再生しながら見た限りでは、字幕と声のタイミングのずれは、まったく感じませんでした。

普段の私のやり方では、直した分だけ字幕の帯をずらして合わせるので、タイミングは必ず少しずつずれます。それを、ずれを感じさせない形で一発で出してきたのには、正直びっくりしました。

確認3:CapCutに読み込めたか

出てきたSRTを、手を加えずにそのままCapCutに読み込みました。

使ったのはスマホのCapCutアプリです。キャプションの画面にある「キャプションをインポート」のボタンから、SRTファイルを選んで読み込めました。

字幕はタイムライン上に1つずつのブロックとして並び、再生すると動画に合わせて表示されました。

ChatGPTで作成したSRTをCapCutで読み込んで再生 1回目 #chatgpt #字幕

ここで1つ、公式の情報と違うことがありました。CapCutのヘルプでは、スマホのアプリは2026年時点で字幕ファイルの直接の読み込みに対応していない、と書かれています。ところが私のスマホのアプリでは、読み込みのボタンがあり、SRTをそのまま読み込めました。

ただ、ChatGPTが付けた【要確認】の印も、そのまま字幕として表示されます。動画を公開する前に、この3か所は必ず直す必要があります。

追加検証:CapCutだけで書き出したMP4でもできる?

最初の検証では、音声の抜き出しにfreeconvertを使いました。でも、普段使っているCapCutだけで済むなら、その方が手間がかかりません。

そこで、CapCutで動画の映像部分を削除して、そのままMP4で書き出したファイルでも試してみました。

書き出したファイルの中身

書き出したMP4(長さ25.7秒、約945KB)の中には、音声(AAC)だけでなく、1080×1920の映像のトラックも残っていました。映像を削除しても、ファイルとしては動画のままのようです。

ChatGPTに添付すると、動画ファイルのアイコンで表示されました。

ChatGPTの反応

まず「CapCutで動画部分を削除して音声だけでエクスポートしたファイルなんだけど、これは音声ファイルとして読み込んでSRT出力出来るのかな?」と聞いてみました。

ChatGPTはファイルの中身を調べてから、次のように答えました。

  • このMP4もSRT作成に使える。約26秒のAAC音声が入っていて、正常に読み出せる
  • ただ、ファイルには1080×1920の映像トラックも残っている。CapCutで動画部分を削除しても、出力形式としては動画になっているようだ
  • 今回の確認はファイル解析によるもので、ChatGPTの標準機能がMP4を音声添付として直接認識した、という意味ではない
ChatGPTにCapCutから音声のみにしてエクスポートしたMP4ファイルを渡し、SRTの出力に使えるか聞いてみた画面のスクリーンショット このMP4もSRT作成に使える。約26秒のAAC音声が入っていて、正常に読み出せる ただ、ファイルには1080×1920の映像トラックも残っている。CapCutで動画部分を削除しても、出力形式としては動画になっているようだ 今回の確認はファイル解析によるもので、ChatGPTの標準機能がMP4を音声添付として直接認識した、という意味ではない という回答が表示されていう。

公式ヘルプでは、動画として認識されるMP4は音声アップロードの対象外です。今回は「音声ファイル」としてではなく、「ファイル」として受け取って、中の音声を取り出して処理した、ということのようです。

SRTを頼んだ結果

続けて「このファイルから文字起こししてSRTに書き出して。」と送ると、SRTファイルが出てきました。途中経過には「Whisper環境と依存関係を確認」と表示されていました。

ChatGPTにCapCutから出力したmp4ファイルを渡して文字起こしとSRTへの書き出しを依頼した画面のスクリーンショット。

出てきたSRTは21個の字幕で、【要確認】の印が付いたものが5つありました。1回目は3つだったので、少し増えています。

  • 【要確認:海鵜】(2か所)
  • 【要確認:人造 火】
  • 虎【続き要確認】
  • 【高速部分・聞き取り要確認】

このSRTも、スマホのCapCutアプリにそのまま読み込んで、再生できました。

ChatGPTで作ったSRTをCapCutで再生 2回目 #chatgpt

【要確認】の印は少し増えましたが、CapCutの自動生成で字幕を作るよりは、ずっと正確でした。CapCutで書き出したMP4でも、ChatGPTでSRTを作って、CapCutに戻すところまでできそうです。

答え合わせをすると、2回目も「海鵜」は合っていて、「人造 火」も合っていました。印付きの字幕を直したあとの言葉は、次のとおりです。

字幕の番号ChatGPTの字幕直したあと理由
3・19【要確認:海鵜】海鵜言葉は合っていた。印を消すだけ
7【要確認:人造 火】人造 火言葉は合っていた。印を消すだけ
11虎【続き要確認】虎 火人造繊維(4倍速)4倍速の部分
14【高速部分・聞き取り要確認】海女振動 海女繊 海女繊 人造火速すぎて聞き取れなかった部分

印が付いた5つのうち3つは、言葉自体は合っていて、印を消すだけで済みました。ほかの16個の字幕は、こちらもそのまま使えました。

手で直す必要があったところ

手で直す必要があったのは、2回とも【要確認】の印が付いた字幕だけでした。印のないところで直したところは、ありませんでした。

  • 1回目(MP3):印が3つ。2つは印を消すだけ、1つは速すぎて聞き取れなかった部分を書き足した
  • 2回目(CapCutで書き出したMP4):印が5つ。3つは印を消すだけ、2つは4倍速の部分を書き足した

タイムコードと、CapCutへの読み込みについては、直す必要はありませんでした。

かかった時間

ChatGPTに頼んでから、SRTが出てくるまでは7分ほどでした。

手で直したのは【要確認】の印が付いた3つの字幕だけでした。

今回は、普段のやり方と同じ動画で時間を測って比べてはいません。

そのうえでの私の見込みですが、すでにブログで記事を書いているコールなら、コールの字幕づくりは今までの半分以下の作業時間で終わると思います。普段はCapCutの自動生成のあとにほぼ全文を打ち直して、帯をずらしてタイミングを合わせていたので、その作業がほとんどなくなるからです。

検証してみて分かったこと

今回の検証で分かったことをまとめます。

  • 公式の音声アップロードは動画ファイルに対応していないので、先に音声を抜き出すのが確実(今回はfreeconvertを使った)
  • ただ、CapCutで映像を消して書き出したMP4(中身は動画のまま)でも、ChatGPTがファイルとして解析して、SRTまで作ってくれた。【要確認】の印は3つから5つに増えた
  • 指示は「SRTファイルを作って」の一文だけで、字幕用のSRTファイルとして出てきた
  • コールのような辞書にない言葉でも、ウェブを検索して、私のブログのコール一覧を参考にしながら埋めてきた
  • 自信のないところには【要確認】の印が付いた。今回は全文を確認した結果、修正が必要だったのは印付きの箇所だけだった
  • タイミングのずれは感じなかった
  • スマホのCapCutアプリで、SRTをそのまま読み込めた(CapCutのヘルプの記述とは違った)

一方で、普段のやり方と比べて作業時間がどれだけ変わったかは、今回は同じ動画で測っていないので、まだ言えません。

全体として、ChatGPTがやる文字起こしだからこそ出来る強みを感じられる実験になりました。

音を聞くだけでなく、ウェブを調べ、私のブログのコール一覧まで参考にして言葉を選ぶ。分からないところは勝手に埋めずに、印を付けて返してくる。辞書にない言葉が続くコールの字幕では、この2つがとても助かりました。

次は、次の2つを試してみたいと思っています。

  • 今回はコールの部分だけを抜き出したが、「一日一コール感謝のラミネート」の動画全体(コールの解説をしている部分も含む)でも、同じ単語を同じように認識できるか
  • 話しているときの「あー」「えー」のような、字幕にしなくていい部分をどう扱うか

試したら、この記事に追記します。

ChatGPTとClaudeの使い分けについては、こちらの記事にまとめています。

ChatGPT PlusユーザーがClaude Proにも課金した理由