OpenAI、新世代音声認識モデル「GPT-Live-Transcribe」と「GPT-Transcribe」を発表 — コンテキスト認識で文字起こし精度が飛躍
室谷代表取締役皆さん、OpenAIがまた面白いものを出しましたね。新しい音声認識モデル、GPT-Live-TranscribeとGPT-Transcribeです。
公式スレッドによると、ライブ文字起こし用と非同期バッチ処理用の2モデルがAPIで提供開始されたんですよね。
公式スレッドによると、ライブ文字起こし用と非同期バッチ処理用の2モデルがAPIで提供開始されたんですよね。
テキトー教師.AI認定講師そうなんです。従来のWhisper(whisper-1)から大幅に進化したモデルで、特に「コンテキストを理解する」という点が最大の違いです。
背景ブリーフにもあったように、Whisperは固有名詞や専門用語、数字や略語、ノイズ環境で誤認識が目立ちました。新モデルはそれらを改善するために、自由形式のコンテキストやキーワード、言語指定などを事前に与えられるようになっています。
背景ブリーフにもあったように、Whisperは固有名詞や専門用語、数字や略語、ノイズ環境で誤認識が目立ちました。新モデルはそれらを改善するために、自由形式のコンテキストやキーワード、言語指定などを事前に与えられるようになっています。
室谷代表取締役つまり「これからこういう内容の会話を文字起こしします」と前もって教えてあげると、より正確に聞き取ってくれると。これはビジネス会議や医療現場など、専門用語が多いシーンで特に効果を発揮しそうです。
従来モデルWhisperとの比較:エラー率が半減、ベンチマーク結果を徹底解説
テキトー教師.AI認定講師室谷さん、具体的な数字を見てみましょう。公式スレッドから引用します。
- Common Voice(22言語) でのトランスクリプションエラー率:
- GPT-Live-Transcribe: 19.70%
- GPT-Realtime-Whisper-1: 20.33%
- Real-World Audio Recording benchmark(9言語):
- GPT-Live-Transcribe: 9.60%
- GPT-Realtime-Whisper-1: 11.65%
非同期モデルのGPT-Transcribeはさらに優秀で、Common Voiceで19.27%(Whisperは40.37%)、Real-World Audioで8.98%(Whisperは15.21%)と、エラー率が半分近くになっています。
室谷代表取締役これは驚異的ですね。特に実世界のノイズの多い音声で9.6%というのは、実用レベルとして非常に優秀です。
従来のWhisperは確かにノイズに強かったですが、それでもこの差は大きい。
従来のWhisperは確かにノイズに強かったですが、それでもこの差は大きい。
テキトー教師.AI認定講師もう一つ重要なのが「Context Aware ASR benchmark」です。GPT-Live-Transcribeは、自由形式のコンテキストを与えない場合の意味的正確率(semantic accuracy)が38.5%だったのに対し、コンテキストを与えると44.6%に向上。
GPT-Transcribeでも41.6%→45.2%と改善しています。この差が実際の使い勝手に直結するわけです。
GPT-Transcribeでも41.6%→45.2%と改善しています。この差が実際の使い勝手に直結するわけです。
コンテキスト活用の仕組み:自由形式のコンテキスト、キーワード、言語指定でどう変わる?
室谷代表取締役ここが新しいモデルの肝ですね。具体的にどんな情報を与えられるんですか?
テキトー教師.AI認定講師公式スレッドによると、4つの方法があります。
- 自由形式のコンテキスト(Free-form context):録音の背景説明やトピックをテキストで与える。
- キーワード(Keywords):人名、製品名、専門用語など、認識してほしい単語のリスト。
- 入力言語の指定(Expected input languages):話されている言語を事前に指定。
- 過去の書き起こしターン(Earlier transcribed turns as context):すでに書き起こした発言の連続をコンテキストとして与える。
室谷代表取締役なるほど。例えば「これはAI関連のカンファレンスの講演で、スピーカーは田中太郎さん、専門用語として『Transformer』『attention mechanism』などが出てきます」と事前に指定すれば、誤認識が減ると。
過去のターンを与えられるのは、会話の流れを考慮した補正に効きそうです。
過去のターンを与えられるのは、会話の流れを考慮した補正に効きそうです。
テキトー教師.AI認定講師まさに。講座でも受講生さんから「Whisperは『ニューラルネットワーク』が『ニューラルネットワック』になる」といった声がよくありましたが、今回のモデルならキーワード指定で改善できるでしょう。
開発者向けAPIの使い方:低遅延ライブ文字起こしとバッチ処理の概要
室谷代表取締役では、実際に開発者がどう使うのか。公式ドキュメントを見ると、APIのエンドポイントは既存のResponses APIと統合されているようです。
テキトー教師.AI認定講師そうですね。ライブ文字起こしにはGPT-Live-Transcribe、録音済みファイルにはGPT-Transcribeを使います。
背景ブリーフによると、低遅延が要求されるライブ用途では数秒以内の応答が求められますが、今回のモデルはその要件を満たす設計になっています。
背景ブリーフによると、低遅延が要求されるライブ用途では数秒以内の応答が求められますが、今回のモデルはその要件を満たす設計になっています。
室谷代表取締役MYUUUでも以前から音声認識を使ったサービスを考えていたんですが、このモデルならリアルタイム字幕や音声アシスタントに使えますね。ただし、現時点ではいくつか制約があると背景ブリーフに書かれています。
テキトー教師.AI認定講師そうなんです。公式スレッドには明記されていませんが、背景ブリーフによると、単語レベルのタイムスタンプ、話者ラベル、信頼スコアは提供されないとのこと。
これらが必要な場合は従来のモデルを併用する必要がありそうです。
これらが必要な場合は従来のモデルを併用する必要がありそうです。
室谷代表取締役あと、料金についてもまだ明らかにされていませんね。背景ブリーフでは「現時点では明らかにされていません」とされています。
今後の発表を待つ必要があります。
今後の発表を待つ必要があります。
【FAQ】GPT-Live-Transcribeのよくある質問(日本語対応、精度限界、料金など)
テキトー教師.AI認定講師よくある質問をいくつか整理しておきましょう。
Q: 日本語は対応していますか? A: はい。Common Voiceの22言語に対応しており、日本語も含まれます。ベンチマークでも多言語で評価されています。
Q: 精度の限界はどこですか? A: 非常に騒がしい環境や、極端に早口な発話、複数話者が同時に話す場面では、まだ誤認識が起こり得ます。また、話者ラベルや単語単位のタイムスタンプは提供されません。
Q: 料金はいくらですか? A: 現時点では明らかにされていません。OpenAIの公式発表をお待ちください。
Q: 従来のWhisperと比べてどのくらい速いですか? A: 低遅延が売りのGPT-Live-Transcribeはリアルタイムに近い速度を謳っていますが、具体的な遅延時間の数値は公表されていません。
室谷代表取締役まとめ:ビジネスにおける音声認識の新たな可能性と今後の展望
テキトー教師.AI認定講師今回のリリースで、OpenAIは単なるASRモデル以上のものを提供したと言えます。コンテキストを活用した精度向上は、特にビジネス現場での実用性を大きく押し上げます。
室谷代表取締役そうですね。会議の文字起こし、コールセンターの音声解析、医療現場でのカルテ代行、教育現場での講義録作成など、用途は無限大です。
しかも、APIとして提供されるので、開発者が簡単に組み込める。
しかも、APIとして提供されるので、開発者が簡単に組み込める。
テキトー教師.AI認定講師ただし、現時点では制約もあります。話者ラベルやタイムスタンプがない点は、用途によっては別のツールと組み合わせる必要があるでしょう。
また、料金が明確になれば、さらに普及が進むと思います。
また、料金が明確になれば、さらに普及が進むと思います。
室谷代表取締役
テキトー教師.AI認定講師
室谷代表取締役そういう細かいノウハウも含めて、このモデルをどう活用するかは、これからのコミュニティ次第ですね。私もMYUUUで実際に試して、またレポートします。
テキトー教師.AI認定講師ぜひお願いします。今回の記事が、皆さんの音声認識活用の一助になれば幸いです。
