Gemini 3.5 Transcribeとは?正確でインテリジェントな音声認識モデル
Gemini 3.5 Transcribeの特徴
最高精度の音声認識
公式発表で「最も正確な音声認識モデル」と位置づけ
ノイズ・専門用語に強い
背景ノイズや専門用語、言い直しによる精度低下を解決
インテリジェント整形
話し言葉を自然な文章に整えて文字起こし
幅広い提供形態
Geminiアプリ・Android・macOS、API・AI Studio・Enterprise Agent Platformで利用可能
室谷代表取締役Googleが新しい音声認識モデル「Gemini 3.5 Transcribe」を発表しましたね。音声をそのまま高精度にテキスト化してくれる、まさに次世代の文字起こしモデルです。
テキトー教師DotAI 認定講師ええ、公式発表では「最も正確な音声認識モデル」と位置づけられています。従来の音声認識って、背景ノイズや専門用語、言い直しなんかで精度が落ちることが多かったんですけど、Gemini 3.5 Transcribeはそういった課題をまとめて解決しているのが特徴です。
室谷代表取締役しかも、すでにGeminiアプリやAndroid、macOS向けの機能として実装されているんですよね。Ramblerという新しい音声操作も、このモデルが支えているとか。
開発者向けにGemini APIやGoogle AI Studio、Gemini Enterprise Agent Platformで提供されることで、外部のアプリにも同じ精度が持ち込める。MYUUUでもこういう音声系の技術はかなり気になっていて、実際に試してみたいなと思っています。
開発者向けにGemini APIやGoogle AI Studio、Gemini Enterprise Agent Platformで提供されることで、外部のアプリにも同じ精度が持ち込める。MYUUUでもこういう音声系の技術はかなり気になっていて、実際に試してみたいなと思っています。
テキトー教師DotAI 認定講師音声をテキストにするだけなら従来モデルでもできますが、3.5 Transcribeは「インテリジェントな文字起こし」をうたっているのがポイントです。単に文字にするだけでなく、人間の話し言葉を自然な文章に整形してくれる。
これはかなり実用的だと思いますよ。
これはかなり実用的だと思いますよ。
従来モデルとの違い—雑音・専門用語・言い直しをどう克服するか
従来モデル vs Gemini 3.5 Transcribe
従来の文字起こし
- 「えーっと」「あー」がそのまま入る
- 言い直しがそのまま残る
- 専門用語や独自語の誤認識
- 後で清書し直す手間
Gemini 3.5 Transcribe
- フィラーワードを自動除去
- 言い直しを自動整理して正しい文に
- カスタム語彙で専門用語に対応
- アルファベットと数字の混在も正確に認識
- 自動でフォーマットまで整える
- WER 4.0%(ストリーミング)/ 2.6%(非ストリーミング)
- 85以上の言語・方言に対応
室谷代表取締役テキトー先生、従来の文字起こしだと「えーっと」とか「あー」がそのまま入っちゃうのが悩みでしたよね。特に会議の議事録だと、あとで清書し直す手間が発生する。
テキトー教師DotAI 認定講師そうですね。Gemini 3.5 Transcribeは「スマート文字起こし」という機能を備えていて、言い直しを自動で処理してくれます。
たとえば「火曜日に会おう——いや、水曜日だ」みたいな発言を、きちんと「水曜日に会おう」と整理して出力する。そのうえで「えっと」「あー」といったフィラーワードも除去し、自動でフォーマットまで整えてくれます。
たとえば「火曜日に会おう——いや、水曜日だ」みたいな発言を、きちんと「水曜日に会おう」と整理して出力する。そのうえで「えっと」「あー」といったフィラーワードも除去し、自動でフォーマットまで整えてくれます。
室谷代表取締役それは便利ですね。しかも、郵便番号とか注文IDのようなアルファベットと数字が混ざった文字列も正確に拾ってくれると。
実務ではこういうのが意外と重要で、たとえばコールセンターの音声解析なんかで数字を誤認識すると業務に支障が出ますからね。
実務ではこういうのが意外と重要で、たとえばコールセンターの音声解析なんかで数字を誤認識すると業務に支障が出ますからね。
テキトー教師DotAI 認定講師さらに「カスタム語彙」にも対応しています。専門用語や独自の固有名詞を事前に登録しておけば、その表記に合わせて文字起こししてくれる。
医療や法務、金融などの専門分野で特にありがたいですね。
医療や法務、金融などの専門分野で特にありがたいですね。
室谷代表取締役ベンチマークでは、ストリーミングで平均WER 4.0%、非ストリーミングで2.6%という数値が出ています。WERっていうのは単語誤り率ですから、100単語に対して4個ないし2.6個の誤りという計算ですね。
雑音の多い現実環境でも強いパフォーマンスを示すと公式にあります。
雑音の多い現実環境でも強いパフォーマンスを示すと公式にあります。
テキトー教師DotAI 認定講師しかも85以上の言語を自動検出して書き起こせて、地域なまりや方言にも対応するとのこと。日本語の対応は明示されてはいませんが、85言語の中に含まれている可能性は高いですね。
ただ、断言はできないので「現時点では明らかにされていません」というのが正確なスタンスです。
ただ、断言はできないので「現時点では明らかにされていません」というのが正確なスタンスです。
2つのAPIを使い分ける—リアルタイム配信(Live API)と録音処理(Interactions API)
Live API vs Interactions API
Live API
- リアルタイムのストリーミング向け
- サブ秒レベルの遅延で双方向音声ストリーミング
- ライブ通訳・音声エージェント・リアルタイム字幕に使用
- モデル名: gemini-3.5-transcribe-live
Interactions API
- 録音済み音声の処理向け
- 会議の録音や通話ログを文字起こし
- 話者識別(最大3人正確、3人以上は実験的)
- 単語レベルのタイムスタンプ付与
- モデル名: gemini-3.5-transcribe
室谷代表取締役開発者視点で見ると、APIが2つに分かれているのがポイントですね。1つは「Live API」、もう1つは「Interactions API」。
ここはテキトー先生、しっかり解説してくれませんか。
ここはテキトー先生、しっかり解説してくれませんか。
テキトー教師DotAI 認定講師はい。まず「Live API」はリアルタイムのストリーミング向けです。
サブ秒レベルの遅延で双方向の音声ストリーミングを処理できるので、ライブ通訳や音声エージェント、リアルタイム字幕といったインタラクティブなアプリに使えます。モデル名は「gemini-3.5-transcribe-live」です。
サブ秒レベルの遅延で双方向の音声ストリーミングを処理できるので、ライブ通訳や音声エージェント、リアルタイム字幕といったインタラクティブなアプリに使えます。モデル名は「gemini-3.5-transcribe-live」です。
室谷代表取締役もう一方の「Interactions API」は録音済み音声の処理ですね。会議の録音や通話ログなどを文字起こしして、話者識別(スピーカーアトリビューション)と単語レベルのタイムスタンプが付く。
こちらは「gemini-3.5-transcribe」というモデル名です。
こちらは「gemini-3.5-transcribe」というモデル名です。
テキトー教師DotAI 認定講師その通りです。話者識別は最大3人まで正確に区別できて、3人以上は実験的なサポートとされています。
会議の議事録作成やコールセンターの通話分析には、この録音向けAPIが強力ですね。
会議の議事録作成やコールセンターの通話分析には、この録音向けAPIが強力ですね。
室谷代表取締役2つのAPIを使い分けることで、ライブ配信の字幕とオンデマンドの文字起こしをそれぞれ最適な形で作れる。まさに開発者フレンドリーですね。
開発者はどう使える?Gemini API/Google AI Studio/Enterprise Agent Platform
室谷代表取締役では、開発者として具体的にどう使っていくのでしょうか。
テキトー教師DotAI 認定講師提供経路は3つあります。1つ目は「Gemini API」。
ここにGemini 3.5 Transcribeが追加されているので、既存のGemini APIを利用している開発者はすぐに組み込めます。
ここにGemini 3.5 Transcribeが追加されているので、既存のGemini APIを利用している開発者はすぐに組み込めます。
室谷代表取締役2つ目は「Google AI Studio」ですね。ブラウザ上でモデルを試せるので、プロトタイプを作るのに便利です。
3つ目は「Gemini Enterprise Agent Platform」。企業向けのエージェント基盤なので、社内システムと連携して音声エージェントを構築するようなケースに適しています。
3つ目は「Gemini Enterprise Agent Platform」。企業向けのエージェント基盤なので、社内システムと連携して音声エージェントを構築するようなケースに適しています。
テキトー教師DotAI 認定講師さらに、関数呼び出し(Function calling)にも対応しています。音声文字起こしをした後に、その内容に基づいて画像生成やファイル分析などのタスクを別のGeminiモデルに委譲できる。
たとえば音声で「この資料を要約して、関連する画像を生成して」と言えば、文字起こしモデルがそれを解釈して別モデルに処理を依頼する、という流れです。
たとえば音声で「この資料を要約して、関連する画像を生成して」と言えば、文字起こしモデルがそれを解釈して別モデルに処理を依頼する、という流れです。
室谷代表取締役これは会話型AIの可能性を広げますね。ちなみに関数呼び出しは現在Gemini macOSアプリで利用可能とありますが、APIで使えるようになるかは今後のアップデートを待つ必要がありそうです。
テキトー教師DotAI 認定講師そうですね。公式ブログでは「開発者は同様の機能を構築できる」とありますが、詳細な実装条件までは明記されていません。
とはいえ、音声入力からタスク実行まで一気通貫でつながるのは大きな前進です。
とはいえ、音声入力からタスク実行まで一気通貫でつながるのは大きな前進です。
音声エージェントや会議文字起こし、ポストコール分析への応用
室谷代表取締役実際のユースケースとしては、どのようなものが考えられますか。
テキトー教師DotAI 認定講師まず挙げられるのが「音声エージェント」ですね。顧客からの問い合わせをリアルタイムに文字起こししながら、適切な回答を返す。
ボイスボットの品質が劇的に上がるはずです。
ボイスボットの品質が劇的に上がるはずです。
室谷代表取締役あと「リアルタイムキャプション」も大きい。イベントやWeb会議でその場で字幕を出せば、聴覚障害のある方の参加や、言語の壁を越えたコミュニケーションに役立ちます。
テキトー教師DotAI 認定講師それから「ポストコール分析」ですね。対応後の通話記録を話者ごとに分けて文字起こしし、単語レベルのタイムスタンプ付きで管理できる。
カスタマーサポートの品質改善やセールス通話の分析に直結します。
カスタマーサポートの品質改善やセールス通話の分析に直結します。
室谷代表取締役まさに私もそう思います。こういった自動文字起こしの進化は、単に効率化だけでなく、会話データを資産として活用できるようにするという意味で重要です。
最近ではAIを活用した新しい読書体験なども話題になっていますが、音声系も急激に進んでいますね。詳しくはNotebookLMで読書が変わる? AIと深く読む新しい方法でも解説していますけど、音声とテキストの境界がどんどんなくなっていく感じがします。
最近ではAIを活用した新しい読書体験なども話題になっていますが、音声系も急激に進んでいますね。詳しくはNotebookLMで読書が変わる? AIと深く読む新しい方法でも解説していますけど、音声とテキストの境界がどんどんなくなっていく感じがします。
テキトー教師DotAI 認定講師そうですね。リアルタイムの音声文字起こしは「話す」と「書く」を結ぶ架け橋。
Gemini 3.5 Transcribeはその核心を担うモデルです。
Gemini 3.5 Transcribeはその核心を担うモデルです。
Gemini 3.5 Transcribeの使い方・料金・日本語対応は?(FAQ)
室谷代表取締役読者の方からよく聞かれそうなポイントを整理してみましょう。使い方、料金、日本語対応の3点ですね。
テキトー教師DotAI 認定講師整理するとこうです。
| 項目 | 内容 |
|---|---|
| 使い方 | Gemini API、Google AI Studio、Gemini Enterprise Agent Platformからアクセス可能。リアルタイムはLive API、録音はInteractions APIを使う |
| 料金 | 現時点では明らかにされていません |
| 日本語対応 | 85以上の言語を自動検出。ただし日本語と明記はなく、現時点では明らかにされていません |
室谷代表取締役使い方については、すでに提供チャネルが決まっているので開発者はすぐに試せますね。まずはGoogle AI Studioで気軽にデモを試してみるのが良さそうです。
テキトー教師DotAI 認定講師ええ、料金と日本語の公式な案内は待つ必要がありますが、モデルの性能そのものはかなり期待できる。特に「話し言葉をきれいなテキストに整形してくれる」部分は、実際の業務でかなり助かるでしょう。
室谷代表取締役音声AIの進化はまだまだ続きそうですね。今後のアップデートにも注目したいです。
テキトー教師DotAI 認定講師そうですね。また新しい情報があれば、この
.AI(ドットエーアイ)でも速報しますね。
室谷代表取締役ぜひお願いします。
