SpaceXAIがGrok Voice Transcribe 2.0を公開、音声認識精度でAA-WERトップクラスを達成
日本語参考要約訳
SpaceXAIは、新たな音声認識モデル「Grok Voice Transcribe 2.0」を発表した。このモデルは、ストリーミングの最終文字起こし(Final Transcript)において0.49秒後に2.7%の誤認率(WER)を達成し、AA-WER Streamingで最も高い精度を記録している。従来版のGrok Voice Transcribe 1.0からの改良により、ストリーミング時のWERは3.9%から2.7%へ、非ストリーミングAA-WERは4.0%から2.3%へと向上した。これらの性能は、Muse Voice TranscribeやElevenLabs Scribe v2 Realtime、Cartesia Ink-2などの他モデルと比較して、精度面で優れるが応答速度はやや遅い。 部分的な最初の文字起こし(First Partial Transcript)でも3.4%と高い精度を示し、他モデルより正確だが速度は劣る。非ストリーミングでは、59モデル中5位の2.3% AA-WERを記録し、AlibabaやMicrosoft、ElevenLabsのモデルに次ぐ順位となっている。処理速度は約160倍の速さを持つ。 料金はストリーミングで1時間あたり$0.20、1,000 minutesあたり$3.33で、競合製品の価格帯と比較するとやや安価かそれに近い設定。
※長文投稿のため、参考訳は概要を最大600字まで表示しています。 元投稿をご参照ください
AINNでは投稿本文・投稿者本人の追記・第三者コメントの全文転載を避け、X公式埋め込みと元投稿への導線を中心に表示します。
AIによる見どころ整理
何について
SpaceXAIが新しい音声認識モデルGrok Voice Transcribe 2.0を発表しました。このモデルはストリーミングの最終文字起こし精度で2.7%のWERを記録し、AA-WERストリーミングで最高評価を獲得しています。前バージョンから精度が向上したほか、非ストリーミングAPIも同価格で提供されます。競合他社モデルと比較しても高い精度を示しています。
なぜ注目
投稿はSpaceXAIの新音声認識モデルの精度向上とAPI提供開始という公式発表で、利用者にとって精度・速度・価格情報が重要な判断材料となるため注目されます。
🔰 初学者向け要約
SpaceXAIは、音声をテキストに変換する新モデルGrok Voice Transcribe 2.0を出しました。これは話し終わってから約0.5秒で、誤変換が2.7%の精度で文字起こしをします。前のモデルより正確になり、使いやすいAPIとしても利用可能です。
この記事の出典
関連する記事
同じ製品・モデル、または同じ元投稿を扱う記事です。この記事の根拠を示すものではありません。
