Google、次世代の音声認識モデル「Gemini 3.5 Transcribe」を発表 言い直しの自動補正や85言語に対応
- 米Googleが最新の音声認識モデル「Gemini 3.5 Transcribe」を発表した。
1ページあたり 20 件ずつ表示します。
- 米Googleが最新の音声認識モデル「Gemini 3.5 Transcribe」を発表した。
- 米Googleは2026年8月25日、macOS向けGeminiアプリに音声入力機能「インテリジェント・ディクテーション」を導入したと発表した。
- セキュリティ企業SOCRadarが、盗難・紛失したApple端末のロック解除を狙うPhaaS基盤「AnonyMousKIT」の調査結果を公開した。
- Stability AIは音楽生成AIモデル「Stable Audio 3.0」を活用するDAWプラグインと、編集機能を拡張したWebアプリの早期ベータ版を発表した。
- NVIDIAは、オープンウェイトの多言語テキスト読み上げ(TTS)モデル「NVIDIA Magpie Multilingual TTS」を公開した。
音声AIプロバイダーのDeepgramが、AWSのアクセス管理機能「AWS IAM一時委任」を同社のサポートプロセスへ統合した。
- AIアシスタント「Claude」の音声会話機能が、最上位モデルの「Opus」および中位モデルの「Sonnet」に対応した。
- AIモデルの仲介プラットフォーム「OpenRouter」が、音声文字起こし(STT)APIの提供を開始しました。
- AWSが、AIエージェントを構築する「Amazon Bedrock AgentCore」とリアルタイム音声モデル「Amazon Nova 2 Sonic」を組み合わせたレストラン向け電話注文システムの構築方法を公開した。
- AWSのサービスパートナーであるScienceSoftが、医療向けのAI音声予約スケジューラーを開発した。
- 米Metaが、ユーザーの会話音声を一日中聴き取り、その話し方や言葉から感情の状態を推測して記録するAI技術の特許を出願していたことが判明した。
- Cohereは2026年7月7日、アラビア語の自動音声認識モデル「Cohere Transcribe Arabic」をオープンソースで公開した。
- 中国のAI企業MiniMaxは、人間の声が持つリアルな質感や感情表現を追求した最新の音声生成モデル「MiniMax Speech 2.8」を発表した。
- 中国のAI開発企業MiniMaxが、新型の音楽生成AIモデル「MiniMax Music 2.6」をリリースした。