Google が Gemini 3.5 Transcribe の音声文字変換モデルを発表

·著者 Henderson
Google が Gemini 3.5 Transcribe の音声文字変換モデルを発表

Google は、同社の最新の音声文字変換モデルである Gemini 3.5 Transcribe を発表しました。このモデルは、リアルタイムでの高精度かつインテリジェントな文字起こし機能を提供することを目的としています。このモデルは、従来の音声認識モデルとは異なり、背景ノイズ、専門用語、音声の流暢さの問題を効果的に処理し、生の音声を正確かつフォーマット化されたテキストに直接変換します。

Gemini 3.5 Transcribe の主な機能

Google の説明によると、Gemini 3.5 Transcribe はユーザーの自然な言語スタイルを捉え、意図をよりよく理解し、カスタム語彙を識別することで、音声によるタスク実行を可能にします。このモデルは、以下のような先進的な機能を備えています。

「スマート文字起こし:セルフコレクションをシームレスに処理し、不要なフィラー言葉を削除し、テキストを自動的にフォーマットします。」

Google

さらに、Gemini 3.5 Transcribe は多言語認識をサポートし、85 以上の言語を自動的に検出して文字起こしを行い、最大 3 人の話者の音声を正確に識別し、録音済みの音声にタイムスタンプを提供します。

開発者や企業への応用可能性

このモデルは、Google AI Studio の Gemini API や Gemini Enterprise Agent Platform からアクセスでき、開発者がワークフローにシームレスに統合できるようにしています。Google はまた、このモデルがリアルタイムのストリーミングメディアと録音済みの音声処理の両方に対して異なる API サービスを提供していると指摘しています。具体的には以下の通りです。

「リアルタイムストリーミング:継続的な双方向ストリーミングを提供し、遅延は 1 秒未満で、インタラクティブな音声アプリケーションに最適です。」

Google

「録音済みの音声処理:録音済みの音声、会議、通話記録などの文字起こしを行い、話者の帰属や逐語的なタイムスタンプを提供します。」

Google

これにより、開発者は音声エージェント、リアルタイム字幕ツール、または通話後の分析パイプラインを簡単に構築し、ユーザー体験を向上させることができます。

Gemini 3.5 Transcribe の性能向上

Gemini 3.5 Transcribe は、前のモデルである Chirp 3 と比較して性能が大幅に向上しています。人工的な分析によると、ストリーミングモードでの平均文字誤り率(WER)は 4.0%、非ストリーミングモードでは 2.6% です。このモデルは、ノイズの多い現実の環境でも優れたパフォーマンスを発揮し、郵便番号や注文 ID などの英数字のエンティティを正確に捕捉します。

「FLEURS ベンチマークテストでは、このモデルは複数の言語や地域で Chirp 3 を上回るパフォーマンスを示し、ストリーミングモードでの WER は 5.50%、非ストリーミングモードでは 5.04% でした。」

Google

これらの改良により、Gemini 3.5 Transcribe は開発者や企業にとって音声文字起こし分野での強力なツールとなっています。

出典:Google 公式発表

H
著者について
Henderson