Google は本日、Gemini 3.5 Transcribe を正式に発表した。これは、同社が「現時点で最も正確な音声テキスト化モデル」と謳うものであり、すでに複数の自社製品に導入されている。従来の音声認識システムは、背景ノイズや業界用語、口癖などに影響されやすかったが、新しいモデルは、元の音声を直接、正確かつ整理されたフォーマット済みのテキストに変換することができる。同社は、「自然な話し言葉のトーンを維持し、使用者の意図をより正確に理解し、カスタマイズされた語彙を識別することを目的としている」と説明している。
Gemini 3.5 Transcribe は、リアルタイムでの自己修正、例えば「火曜日に会いましょう——違います、水曜日」のようなケースを処理でき、「えー」や「あのー」といった間投詞や冗長な言葉を自動的に削除する。また、自動フォーマット設定と自然な音声編集機能もサポートしている。正確性に関しては、Artificial Analysis のテスト結果によると、ストリーミングモードでの平均単語誤り率(WER)は 4.0%、非ストリーミングモードではさらに 2.6% にまで低下している。このモデルは、ノイズの多い現実の環境でも安定して動作し、郵便番号や注文番号など、文字と数字で構成される文字列を正確に認識することができる。
Gemini 3.5 Transcribe はカスタム語彙と多言語認識をサポート
カスタム語彙に関しては、モデルは特定の業界用語や特殊なスペルを認識し、使用者が提供する語彙リストに基づいて転写結果を自動的に調整する。言語サポートに関しては、システムは 85 以上の言語を自動検出し、転写することができ、地域ごとのアクセントや方言もカバーしている。多話者認識機能では、録音済みの音声の中で最大 3 人の話者にタイムスタンプを付けて対応する文を割り当てるが、3 人以上の話者のシーンはまだ実験段階である。
性能の面では、Google は Gemini 3.5 Transcribe が 2025 年に発売された Chirp 3 転写モデルと比較して、「すべての能力、単語誤り率、および遅延のパフォーマンスにおいて大きな進歩を遂げた」と主張している。Artificial Analysis のデータによると、最終的な転写が完了するまでの時間が Chirp 3 と比較して 70% 短縮されている。FLEURS ベンチマークテストでは、複数の主流言語および地域において、ストリーミングモードでの単語誤り率は 5.50%、非ストリーミングモードでは 5.04% で、多言語パフォーマンスも前世代のモデルを上回っている。
音声エージェントとクロスプラットフォーム統合
新しいモデルのもう一つの重要な目標は、ユーザーが「音声でタスクを実行できるようにする」ことである。関数呼び出し機能を通じて、Gemini 3.5 Transcribe は「イメージ生成やファイル分析などの複雑なタスクを他の Gemini モデルに委譲する」ことができる。この体験は、macOS 版の Gemini アプリケーションの Speak to Window 機能で確認できる。macOS 版の Gemini アプリケーションや Android プラットフォームの Gboard Rambler に加えて、Gemini 3.5 Transcribe は Google Antigravity ポップアップのマイクにも組み込まれており、ユーザーの許可の下で画面の内容と会話の記録を結合し、
ファイル名やスマートエージェントの思考、現在開いているドキュメントなどのシーンでも正確に転写できるようにしている。
このモデルは後に Chrome ブラウザにも導入される予定であり、その際にはユーザーはあらゆるウェブページのフィールドで音声入力が可能になる。返信を書いたり、投稿の下書きをしたり、Chrome で Gemini に音声で指示を出したりする際に、操作がより自然でスムーズになる。Gemini 3.5 Transcribe は現在、2 種類のユーザーが利用できる。開発者は Gemini API(Google AI Studio および Google Antigravity に位置)を介してパブリックプレビュー版を試すことができ、企業ユーザーは Gemini Enterprise Agent Platform でパブリックプレビュー版を取得でき、Gemini
Enterprise for Customer Experience に近日中に導入される予定である。

