Tech Shots
AIとロボティクスのニュース
日本語
モデル

Gemini 3.5 Transcribe、音声をリアルタイムでテキスト化

Googleは、アップロードしたファイルだけでなくライブの会話を想定した文字起こしモデルを公開した。ストリーミング用とファイル用のエンドポイントがあり、ノイズや専門用語への対応も進めている。これはGemini APIにあるGoogleのモデルであり、暗号資産取引所のGeminiでも、サードパーティのナレーターでもない。

出典: Google

AIの支援により翻訳しました。