2026年8月27日

Gemini 3.5 Transcribe発表、高精度リアルタイム文字起こしの新時代

Gemini 3.5 Transcribeとは?正確でインテリジェントな音声認識モデル

Gemini 3.5 Transcribeの特徴
最高精度の音声認識
公式発表で「最も正確な音声認識モデル」と位置づけ
ノイズ・専門用語に強い
背景ノイズや専門用語、言い直しによる精度低下を解決
インテリジェント整形
話し言葉を自然な文章に整えて文字起こし
幅広い提供形態
Geminiアプリ・Android・macOS、API・AI Studio・Enterprise Agent Platformで利用可能
室谷室谷代表取締役
Googleが新しい音声認識モデル「Gemini 3.5 Transcribe」を発表しましたね。音声をそのまま高精度にテキスト化してくれる、まさに次世代の文字起こしモデルです。
テキトー教師テキトー教師DotAI 認定講師
ええ、公式発表では「最も正確な音声認識モデル」と位置づけられています。従来の音声認識って、背景ノイズや専門用語、言い直しなんかで精度が落ちることが多かったんですけど、Gemini 3.5 Transcribeはそういった課題をまとめて解決しているのが特徴です。
室谷室谷代表取締役
しかも、すでにGeminiアプリやAndroid、macOS向けの機能として実装されているんですよね。Ramblerという新しい音声操作も、このモデルが支えているとか。

開発者向けにGemini APIやGoogle AI Studio、Gemini Enterprise Agent Platformで提供されることで、外部のアプリにも同じ精度が持ち込める。MYUUUでもこういう音声系の技術はかなり気になっていて、実際に試してみたいなと思っています。
テキトー教師テキトー教師DotAI 認定講師
音声をテキストにするだけなら従来モデルでもできますが、3.5 Transcribeは「インテリジェントな文字起こし」をうたっているのがポイントです。単に文字にするだけでなく、人間の話し言葉を自然な文章に整形してくれる。

これはかなり実用的だと思いますよ。

従来モデルとの違い—雑音・専門用語・言い直しをどう克服するか

従来モデル vs Gemini 3.5 Transcribe
従来の文字起こし
  • 「えーっと」「あー」がそのまま入る
  • 言い直しがそのまま残る
  • 専門用語や独自語の誤認識
  • 後で清書し直す手間
Gemini 3.5 Transcribe
  • フィラーワードを自動除去
  • 言い直しを自動整理して正しい文に
  • カスタム語彙で専門用語に対応
  • アルファベットと数字の混在も正確に認識
  • 自動でフォーマットまで整える
  • WER 4.0%(ストリーミング)/ 2.6%(非ストリーミング)
  • 85以上の言語・方言に対応
室谷室谷代表取締役
テキトー先生、従来の文字起こしだと「えーっと」とか「あー」がそのまま入っちゃうのが悩みでしたよね。特に会議の議事録だと、あとで清書し直す手間が発生する。
テキトー教師テキトー教師DotAI 認定講師
そうですね。Gemini 3.5 Transcribeは「スマート文字起こし」という機能を備えていて、言い直しを自動で処理してくれます。

たとえば「火曜日に会おう——いや、水曜日だ」みたいな発言を、きちんと「水曜日に会おう」と整理して出力する。そのうえで「えっと」「あー」といったフィラーワードも除去し、自動でフォーマットまで整えてくれます。
室谷室谷代表取締役
それは便利ですね。しかも、郵便番号とか注文IDのようなアルファベットと数字が混ざった文字列も正確に拾ってくれると。

実務ではこういうのが意外と重要で、たとえばコールセンターの音声解析なんかで数字を誤認識すると業務に支障が出ますからね。
テキトー教師テキトー教師DotAI 認定講師
さらに「カスタム語彙」にも対応しています。専門用語や独自の固有名詞を事前に登録しておけば、その表記に合わせて文字起こししてくれる。

医療や法務、金融などの専門分野で特にありがたいですね。
室谷室谷代表取締役
ベンチマークでは、ストリーミングで平均WER 4.0%、非ストリーミングで2.6%という数値が出ています。WERっていうのは単語誤り率ですから、100単語に対して4個ないし2.6個の誤りという計算ですね。

雑音の多い現実環境でも強いパフォーマンスを示すと公式にあります。
テキトー教師テキトー教師DotAI 認定講師
しかも85以上の言語を自動検出して書き起こせて、地域なまりや方言にも対応するとのこと。日本語の対応は明示されてはいませんが、85言語の中に含まれている可能性は高いですね。

ただ、断言はできないので「現時点では明らかにされていません」というのが正確なスタンスです。

2つのAPIを使い分ける—リアルタイム配信(Live API)と録音処理(Interactions API)

Live API vs Interactions API
Live API
  • リアルタイムのストリーミング向け
  • サブ秒レベルの遅延で双方向音声ストリーミング
  • ライブ通訳・音声エージェント・リアルタイム字幕に使用
  • モデル名: gemini-3.5-transcribe-live
Interactions API
  • 録音済み音声の処理向け
  • 会議の録音や通話ログを文字起こし
  • 話者識別(最大3人正確、3人以上は実験的)
  • 単語レベルのタイムスタンプ付与
  • モデル名: gemini-3.5-transcribe
室谷室谷代表取締役
開発者視点で見ると、APIが2つに分かれているのがポイントですね。1つは「Live API」、もう1つは「Interactions API」。

ここはテキトー先生、しっかり解説してくれませんか。
テキトー教師テキトー教師DotAI 認定講師
はい。まず「Live API」はリアルタイムのストリーミング向けです。

サブ秒レベルの遅延で双方向の音声ストリーミングを処理できるので、ライブ通訳や音声エージェント、リアルタイム字幕といったインタラクティブなアプリに使えます。モデル名は「gemini-3.5-transcribe-live」です。
室谷室谷代表取締役
もう一方の「Interactions API」は録音済み音声の処理ですね。会議の録音や通話ログなどを文字起こしして、話者識別(スピーカーアトリビューション)と単語レベルのタイムスタンプが付く。

こちらは「gemini-3.5-transcribe」というモデル名です。
テキトー教師テキトー教師DotAI 認定講師
その通りです。話者識別は最大3人まで正確に区別できて、3人以上は実験的なサポートとされています。

会議の議事録作成やコールセンターの通話分析には、この録音向けAPIが強力ですね。
室谷室谷代表取締役
2つのAPIを使い分けることで、ライブ配信の字幕とオンデマンドの文字起こしをそれぞれ最適な形で作れる。まさに開発者フレンドリーですね。

開発者はどう使える?Gemini API/Google AI Studio/Enterprise Agent Platform

室谷室谷代表取締役
では、開発者として具体的にどう使っていくのでしょうか。
テキトー教師テキトー教師DotAI 認定講師
提供経路は3つあります。1つ目は「Gemini API」。

ここにGemini 3.5 Transcribeが追加されているので、既存のGemini APIを利用している開発者はすぐに組み込めます。
室谷室谷代表取締役
2つ目は「Google AI Studio」ですね。ブラウザ上でモデルを試せるので、プロトタイプを作るのに便利です。

3つ目は「Gemini Enterprise Agent Platform」。企業向けのエージェント基盤なので、社内システムと連携して音声エージェントを構築するようなケースに適しています。
テキトー教師テキトー教師DotAI 認定講師
さらに、関数呼び出し(Function calling)にも対応しています。音声文字起こしをした後に、その内容に基づいて画像生成やファイル分析などのタスクを別のGeminiモデルに委譲できる。

たとえば音声で「この資料を要約して、関連する画像を生成して」と言えば、文字起こしモデルがそれを解釈して別モデルに処理を依頼する、という流れです。
室谷室谷代表取締役
これは会話型AIの可能性を広げますね。ちなみに関数呼び出しは現在Gemini macOSアプリで利用可能とありますが、APIで使えるようになるかは今後のアップデートを待つ必要がありそうです。
テキトー教師テキトー教師DotAI 認定講師
そうですね。公式ブログでは「開発者は同様の機能を構築できる」とありますが、詳細な実装条件までは明記されていません。

とはいえ、音声入力からタスク実行まで一気通貫でつながるのは大きな前進です。

音声エージェントや会議文字起こし、ポストコール分析への応用

室谷室谷代表取締役
実際のユースケースとしては、どのようなものが考えられますか。
テキトー教師テキトー教師DotAI 認定講師
まず挙げられるのが「音声エージェント」ですね。顧客からの問い合わせをリアルタイムに文字起こししながら、適切な回答を返す。

ボイスボットの品質が劇的に上がるはずです。
室谷室谷代表取締役
あと「リアルタイムキャプション」も大きい。イベントやWeb会議でその場で字幕を出せば、聴覚障害のある方の参加や、言語の壁を越えたコミュニケーションに役立ちます。
テキトー教師テキトー教師DotAI 認定講師
それから「ポストコール分析」ですね。対応後の通話記録を話者ごとに分けて文字起こしし、単語レベルのタイムスタンプ付きで管理できる。

カスタマーサポートの品質改善やセールス通話の分析に直結します。
室谷室谷代表取締役
まさに私もそう思います。こういった自動文字起こしの進化は、単に効率化だけでなく、会話データを資産として活用できるようにするという意味で重要です。

最近ではAIを活用した新しい読書体験なども話題になっていますが、音声系も急激に進んでいますね。詳しくはNotebookLMで読書が変わる? AIと深く読む新しい方法でも解説していますけど、音声とテキストの境界がどんどんなくなっていく感じがします。
テキトー教師テキトー教師DotAI 認定講師
そうですね。リアルタイムの音声文字起こしは「話す」と「書く」を結ぶ架け橋。

Gemini 3.5 Transcribeはその核心を担うモデルです。

Gemini 3.5 Transcribeの使い方・料金・日本語対応は?(FAQ)

室谷室谷代表取締役
読者の方からよく聞かれそうなポイントを整理してみましょう。使い方、料金、日本語対応の3点ですね。
テキトー教師テキトー教師DotAI 認定講師
整理するとこうです。
項目内容
使い方Gemini API、Google AI Studio、Gemini Enterprise Agent Platformからアクセス可能。リアルタイムはLive API、録音はInteractions APIを使う
料金現時点では明らかにされていません
日本語対応85以上の言語を自動検出。ただし日本語と明記はなく、現時点では明らかにされていません
室谷室谷代表取締役
使い方については、すでに提供チャネルが決まっているので開発者はすぐに試せますね。まずはGoogle AI Studioで気軽にデモを試してみるのが良さそうです。
テキトー教師テキトー教師DotAI 認定講師
ええ、料金と日本語の公式な案内は待つ必要がありますが、モデルの性能そのものはかなり期待できる。特に「話し言葉をきれいなテキストに整形してくれる」部分は、実際の業務でかなり助かるでしょう。
室谷室谷代表取締役
音声AIの進化はまだまだ続きそうですね。今後のアップデートにも注目したいです。
テキトー教師テキトー教師DotAI 認定講師
そうですね。また新しい情報があれば、この.AI(ドットエーアイ)でも速報しますね。
室谷室谷代表取締役
ぜひお願いします。

Related

関連記事

New Articles

新着記事

ニュース

OpenAIエージェント700体がHugging Face攻撃

2026年8月27日
室谷テキトー教師
ガイド

Cursorの料金を徹底解説!Pro/Pro+/Ultraの違いと選び方

2026年8月26日
室谷テキトー教師
ガイド

ChatGPT APIの使い方完全ガイド|Python初心者でもできる始め方と料金を解説

2026年8月23日
室谷テキトー教師
ニュース

OpenAI、Mac版ChatGPTにiMessage連携プラグインを公開

2026年8月22日
室谷テキトー教師
ニュース

OpenAIが10代向けChatGPT for Teensを公開

2026年8月22日
室谷テキトー教師
ニュース

アンソロピック支援のOde、Casper買収でAI実装市場へ

2026年8月22日
室谷テキトー教師
ニュース

Anthropic、企業向けデータ保持ポリシー変更を計画か

2026年8月21日
室谷テキトー教師
ニュース

OpenAIが「AI Futures」を発表——新ブログと戦略的将来チームの狙い

2026年8月21日
室谷テキトー教師
ニュース

ブラウン大学が生成AI活用のQ&A公開、授業での指針示す

2026年8月21日
室谷テキトー教師
ガイド

Google Antigravityとは?エージェント開発プラットフォームの使い方と料金プラン比較

2026年8月21日
室谷テキトー教師

Join

AIプレナーになる。

入会は審査制です。いまの事業と、AIで何を動かしたいのかを聞かせてください。

参加を申請する