Image-to-WebDev Arenaで新モデル4種の評価結果を公開、GPT-6 Astraがトップ評価を獲得
日本語参考要約訳
Image-to-WebDev Arenaにて4つの新モデルが評価され、そのうちGPT-6 Astra (Max)、Claude Fable 5.1 (Max)、Muse Spark 1.3 (Max)、GLM-5.3-Flashが登場した。GPT-6 Astraは1733ポイントで最高得点を記録し、前モデルGPT-5.6 Solを129ポイント上回り2位モデルにも23ポイント差をつけた。Claude Fable 5.1は1710ポイントで2位に入り、前モデルFable 5やClaude Opus 5を上回った。Muse Spark 1.3は1645ポイント、GLM-5.3-Flashは1588ポイントであった。 特に、GPT-6 Astra、Muse Spark 1.3、GLM-5.3-Flashは、性能とコスト効率の観点からパレート最適前線に位置している。1M tokensあたりの価格に基づく評価では、GPT-6 Astraは$40で1733ポイント、Muse Sparkは$3.50で1645ポイント、GLM-5.3-Flashは$0.21で1588ポイントと、コストパフォーマンスも考慮された結果となった。
※長文投稿のため、参考訳は概要を最大600字まで表示しています。 元投稿をご参照ください
AINNでは投稿本文・投稿者本人の追記・第三者コメントの全文転載を避け、X公式埋め込みと元投稿への導線を中心に表示します。
AIによる見どころ整理
何について
Image-to-WebDev Arenaは画像やスクリーンショットからウェブサイトを生成する能力を評価するAIモデルランキングを更新し、4つの新モデルを評価に加えました。OpenAIのGPT-6 Astraが1733ポイントで1位を獲得し、AnthropicのClaude Fable 5.1やMetaのMuse Spark 1.3も上位にランクイン。コスト効率も考慮した評価で、複数モデルがパレートフロンティア上に位置しています。
なぜ注目
新規評価モデルの順位やポイント、費用対性能の比較が具体的に示されており、利用者がモデル選択やコスト効果を検討する際に参考になるため注目されます。
🔰 初学者向け要約
画像やスクリーンショットからウェブサイトを自動で作るAIモデルを評価するコンテスト「Image-to-WebDev Arena」に4つの新しいAIモデルが参加しました。OpenAIのGPT-6 Astraが最も高い点数を取り、AnthropicのClaude FableやMetaのMuse Sparkも良い評価を受けました。これらのAIは質と費用の両面で優秀とされています。
