SpaceXAI、音声認識モデルGrok Voice Transcribe 2.0を発表、高精度化と低価格を実現
日本語参考要約訳
SpaceXAIは「Grok Voice Transcribe 2.0」を発表し、従来モデルの約2.0倍の精度を同価格で提供する。人工分析によると32のストリーミング音声認識モデルの中で精度が第1位で、多言語に対応し、話される言語を自動検出、同一録音内での言語切替も可能だ。アップロードファイル、URL、ライブ音声ストリームを文字起こしでき、単語ごとに正確なタイムスタンプと信頼度スコアを付与する。話者を無料で識別・ラベル付けし、最大8チャンネルの音声を独立処理できる。また、製品名や医療用語など最大100のキーワード登録が可能で、話し終わりを検知して音声エージェントの自然な応答を実現する。雑音やアクセント、重なり合う声、電話番号やメールアドレスの認識も得意とする。APIは既存の統合にコード変更不要で精度向上をもたらし、短い音声コマンドの誤認識率は20.6%から6.8%に低減された。料金は、バッチ音声文字起こしが1時間あたり$0.10、リアルタイムストリーミングが$0.20のままで、Atlassianは従来のソリューションより高精度と判断し、自社のLoom動画の文字起こしに活用している。今後、xAIのSpeech-to-Text APIでデフォルトモデルになる予定だと紹介されている。
※長文投稿のため、参考訳は概要を最大600字まで表示しています。 元投稿をご参照ください
AINNでは投稿本文・投稿者本人の追記・第三者コメントの全文転載を避け、X公式埋め込みと元投稿への導線を中心に表示します。
AIによる見どころ整理
何について
SpaceXAIがGrok Voice Transcribe 2.0をリリースしました。従来モデルの2.0倍の精度を維持しつつ価格は据え置きで、多言語対応や話者分離など多彩な機能を持ち、API統合ユーザーはコード変更不要で利用可能です。Atlassian社も自社製品の動画文字起こしに採用しています。
なぜ注目
投稿は音声認識モデルの精度向上と利用料金の維持を明示し、既存API統合での無償アップデートや企業導入事例を示しているため、利用者の実務的影響と話題性が確認できるため注目される。
🔰 初学者向け要約
SpaceXAIは音声をテキストに変換する新しいモデル、Grok Voice Transcribe 2.0を発表しました。このモデルはこれまでのものよりも正確に話した言葉を認識でき、複数の言語や話者を自動で区別し、ノイズにも強い特徴があります。価格も変わらず手頃なまま提供されています。
この記事の出典
関連する記事
同じ製品・モデル、または同じ元投稿を扱う記事です。この記事の根拠を示すものではありません。
