ai-garage
News

Gemini 3.5 Transcribe とは?無料枠あり・85言語対応の文字起こしAI

「Gemini 3.5 Transcribe とは?」の答えは、Google が2026年8月26日に公開プレビューで出した文字起こしAIだよ。85以上の言語対応で日本語もOK、料金は音声1分あたり実効およそ$0.005、無料で試せる枠もある。話者分けを使うと30分までに縮む注意点まで一次情報で整理するね。

Gemini 3.5 Transcribe とは?無料枠あり・85言語対応の文字起こしAI

この記事の要点

  • Gemini 3.5 Transcribe は2026年8月26日に Google が公開プレビューで出した音声認識モデルだよ。85以上の言語を自動で聞き分けて、対応言語表には日本語(ja-JP)も入っているんだ。従来の Chirp 3 の後継にあたるよ。
  • 料金は無料枠があって、有料でも音声1分あたり およそ $0.005。内訳は入力(音声)が100万トークンあたり $2.00=1分 $0.003、出力(文字)が100万トークンあたり $12.00=1分 $0.002 だよ。リアルタイム版の gemini-3.5-transcribe-live は1分 およそ $0.009 なんだ。
  • 誤り率(WER)は Google の発表で 非リアルタイムが平均2.6%、リアルタイムが平均4.0%。FLEURS という多言語ベンチの上位言語では 非リアルタイム5.04%、リアルタイム5.50% だよ。最終結果が出るまでの時間は Chirp 3 より70%短くなったと書いてあるんだ。
  • 使える音声の長さは通常1時間までだけど、話者の切り分けや単語ごとの時刻を有効にすると30分までに縮むよ。単語ごとの時刻を出すと文字起こしの精度が下がることがある、と公式ドキュメントに明記されているんだ。

やっほー、ぼくてんびん丸!きょうは声を文字にするAIの話だよ。

Google が 2026年8月26日、新しい文字起こしAI「Gemini 3.5 Transcribe(ジェミニ 3.5 トランスクライブ)」を開発者向けの公開プレビューとして出したんだ。会議の録音、インタビュー、動画の字幕——「しゃべった内容を文字にしたい」場面って多いよね。そこを担当する専門モデルなんだ。

しかも料金がかなり安い。分かっていることを、公式の数字だけで整理するね。

何があったの?

Google が出したのは、音声を文字に変える専門のモデルが2つ。

用途モデルID呼び出し方
録音済みの音声を文字にするgemini-3.5-transcribeInteractions API
しゃべっているそばから文字にするgemini-3.5-transcribe-liveLive API(WebSocket)

どちらも Google の従来モデル「Chirp 3」の後継にあたるよ。公式ブログには、最終的な文字起こしが出るまでの時間が Chirp 3 より 70%短くなったと書いてあるんだ。

もう一般向けの製品でも動いていて、Android のキーボード Gboard の音声入力機能「Rambler」と、macOS 版 Gemini アプリの音声入力が、すでにこのモデルで動いているよ。Chrome のウェブ入力欄への対応も予告されているんだ。

どのくらい正確なの?

Google が公表した誤り率(WER=Word Error Rate。文字起こしを100語やったとき何語間違えたか、という割合)はこう。

測り方平均 WERFLEURS の上位言語
録音済み(非リアルタイム)2.6%5.04%
リアルタイム4.0%5.50%

FLEURS というのは多言語の音声を集めたテスト用データのこと。全体平均より FLEURS のほうが数字が悪いのは、こっちのほうが対象の言語が広くて難しいからだと考えられるよ。

ここは正直に書いておくね。日本語だけの誤り率は公表されていないんだ。だから「日本語でも2.6%」とは言えないよ。日本語がどのくらい得意かは、自分の音声で試して確かめるのがいちばん確実だね。

何ができるの?

公式ドキュメントに書かれている機能を並べるとこうなるよ。

  • 自動で言語を聞き分ける85以上の言語に対応。対応言語表には日本語(ja-JP)も入っているよ。しかも1つの文の中で言語が切り替わっても追いかけられるんだ
  • 専門用語を登録できる — 社名や製品名など、間違えられたら困る言葉を最大1,000個まで先に渡せるよ(公式は「100個くらいまでが結果が良い」と書いている)
  • 誰がしゃべったか分けるspk_1 spk_2 のようなラベルを付けてくれるよ
  • 単語ごとに時刻を付ける — その言葉が何秒何分に出たかを記録できるんだ
  • 言い直しを消して整える — 「えーっと」「あの」みたいな言葉や言い直しを取り除いて、読みやすい形にしてくれるよ
  • 書き方を整える — 大文字・小文字や句読点を補って、「twenty six million dollars」を「$26M」のように書き直してくれるんだ

最後の2つが、いわゆる従来の音声認識との違いだね。そのまま読める文章として出てくるところが売りなんだ。

従来の音声認識とGemini 3.5 Transcribeの出力の違いを並べた図。左は言い直しやフィラーがそのまま残った文字起こし、右はフィラーが取り除かれ句読点と数字表記が整えられた文章。

いくらかかるの?

いちばん気になるところだよね。Gemini API の公式料金表に載っている数字がこれ。

入力(音声)出力(文字)実効の目安
gemini-3.5-transcribe$2.00 / 100万トークン(1分 $0.003)$12.00 / 100万トークン(1分 $0.002)1分 約 $0.005
gemini-3.5-transcribe-live$3.50 / 100万トークン(1分 $0.005)$21.00 / 100万トークン(1分 $0.004)1分 約 $0.009

そしてどちらにも無料枠がある(公式表記は Free Tier で「Free of charge」)。まず試すだけならお金はかからないよ。

1分 $0.005 がどのくらいかというと、1ドル157円で換算すると1分あたり約0.8円。1時間の会議なら約47円だね。

ほかの会社の文字起こしと並べるとこうなるよ。

モデル提供元1分あたり
gpt-4o-mini-transcribeOpenAI$0.003
gpt-transcribeOpenAI$0.0045
Gemini 3.5 TranscribeGoogle約 $0.005
gpt-4o-transcribeOpenAI$0.006
WhisperOpenAI$0.006
Gemini 3.5 Transcribe Live(リアルタイム)Google約 $0.009
gpt-live-transcribe(リアルタイム)OpenAI$0.017

録音済みの文字起こしではOpenAI の軽い方が少し安く、リアルタイムではGemini がおよそ半額という並びだね。

ただし数字の性質が違うので、そこは注意してほしいんだ。OpenAI の分単価は公式がそのまま「1分いくら」で出している値だけど、Google の分単価は「音声1秒=25トークン、出力は1分=175トークン」という前提で換算した目安なんだ。実際の請求はトークンの量で決まるから、しゃべる量が多い音声だと出力側が増えて目安からズレることがあるよ。

気をつけるところは?

便利そうに見えるけど、制限もちゃんと書いてあるよ。

  • 音声の長さは通常1時間まで。 ただし話者の切り分けや単語ごとの時刻を有効にすると、30分までに縮むんだ
  • 単語ごとの時刻を出すと、文字起こしの精度が下がることがあると公式ドキュメントが認めているよ。全部の機能を同時にオンにすればいい、というものではないんだ
  • 短い音声以外は Files API にアップロードしてから渡す方式だよ
  • 公開プレビューだから、仕様や料金がこのあと変わる可能性はあるね

そしてもう1つ、見つけてしまったことがあるんだ。

話者を何人まで聞き分けられるか、Google の公式情報どうしで食い違っている。 公式ブログには「最大3人まで」と書いてあるのに、開発者向けドキュメントには「最大8人まで対応。3人以上の割り当ては実験的」と書いてあるんだ。仕様を細かく書いてあるのはドキュメントのほうだから、そちらが実態に近いとぼくは思う。でもどちらも Google の公式なので、ここでは両方そのまま書いておくね。確実なのは2人までで、3人以上は結果を見ながら使うのがよさそうだよ。

ぼくの感想

いちばん面白いと思ったのは、「正確に聞き取る」から「読める文章にして返す」に仕事の範囲が広がったことなんだ。

これまでの音声認識は、言ったとおりに文字にするのが仕事だった。だから「えーっと、あの、それでですね」もそのまま出てきて、人が消す作業が残っていたよね。Gemini 3.5 Transcribe はそこを自分でやって、数字の書き方まで整えて返してくる。文字起こしのあとの片付け仕事を減らしにきているんだ。

一方で、日本語の誤り率が公表されていないのは気になるところ。85言語対応と言っても、言語ごとの得意・不得意は必ずあるはずだからね。あと無料枠のぶんは「製品の改善に使う」と料金表に書いてある(有料枠は使わない、とも書いてある)から、仕事の録音を投げるなら有料枠を使うほうがいいと思う。ここは無料の代わりに何を渡しているか、という話だね。

まとめ

Gemini 3.5 Transcribe は、85以上の言語を自動で聞き分けて、言い直しまで消して返してくる Google の新しい文字起こしAIだよ。日本語も対応言語に入っていて、料金は1分 約 $0.005(1ドル157円で約0.8円)、無料枠もあるんだ。

ただし公開プレビューだし、日本語だけの精度は公表されていないし、話者の人数は公式のなかで説明が割れている。まずは無料枠で自分の音声を通してみるのが、いちばん確実な確かめ方だと思うよ。試したら教えてね!

よくある質問

Q.Gemini 3.5 Transcribe とは?
A.Google が2026年8月26日に公開プレビューで提供を始めた、音声を文字に起こすAIモデルです。モデルIDは gemini-3.5-transcribe で、リアルタイム版は gemini-3.5-transcribe-live です。85以上の言語を自動で判別して文字にでき、話者の切り分け、単語ごとの時刻の付与、専門用語の登録、言い直しの除去といった機能を持ちます。従来 Google が提供していた Chirp 3 の後継にあたります。
Q.Gemini 3.5 Transcribe の料金は?
A.Gemini API の公式料金表では無料枠(Free Tier)が用意されており、有料枠は gemini-3.5-transcribe が入力100万トークンあたり $2.00(音声・1分あたり $0.003 相当)、出力100万トークンあたり $12.00(文字・1分あたり $0.002 相当)です。Google はこれを合わせた実効単価を1分あたり およそ $0.005 と説明しています。リアルタイム版の gemini-3.5-transcribe-live は入力 $3.50・出力 $21.00 で、実効 およそ $0.009 です。
Q.Gemini 3.5 Transcribe は日本語に対応している?
A.対応しています。Gemini API のドキュメントにある対応言語表に日本語(BCP-47 コードは ja-JP)が明記されています。言語を指定しなくても自動で判別しますが、話す言語が分かっている場合は language_codes に ja-JP を指定したほうが精度が上がる、と公式ドキュメントは説明しています。ただし Google が公表している誤り率(WER)は全体平均と FLEURS 上位言語の数値で、日本語だけの数値は公表されていません。
Q.Gemini 3.5 Transcribe は何人まで話者を聞き分けられる?
A.公式ドキュメントでは最大8人まで対応し、3人以上の割り当ては実験的な扱いだと書かれています。一方 Google の公式ブログには「最大3人まで」と書かれており、2つの公式情報で説明が食い違っています。確実に使えるのは2人までで、3人以上は結果を確認しながら使うのが安全です。なお話者の切り分けを有効にすると、処理できる音声は30分までに制限されます。
Q.Gemini 3.5 Transcribe と OpenAI の文字起こしはどっちが安い?
A.1分あたりの単価で並べると、OpenAI の gpt-4o-mini-transcribe が $0.003、gpt-transcribe が $0.0045、Gemini 3.5 Transcribe が およそ $0.005、gpt-4o-transcribe と Whisper が $0.006 です。リアルタイムでは Gemini が およそ $0.009、OpenAI の gpt-live-transcribe が $0.017 で、Gemini のほうが安くなります。ただし Google の分単価は「音声1秒=25トークン、出力は1分=175トークン」という前提で換算した目安であり、実際の請求はトークン量で決まる点に注意してください。
Q.Gemini 3.5 Transcribe はどこで使える?
A.開発者は Gemini API(Google AI Studio 経由)と Google Antigravity から公開プレビューとして使えます。長い音声は Files API にアップロードしてから渡す方式です。一般の利用者向けには、Android の Gboard の音声入力機能「Rambler」や、macOS 版 Gemini アプリの音声入力ですでに動いており、Chrome のウェブ入力欄への対応も予告されています。

参考・一次ソース

この記事に出てきた用語・モデル

関連 AI モデル

まとめて読む

このテーマの動きは、時系列で1ページに整理しています。

この記事をシェア

Xでシェア

関連記事

更新を受け取る