Perceptronが35Bのembodied-agentモデルMk1.5を公開、First-person動画対応でMMSearch性能向上
日本語参考要約訳
Perceptronが発表したMk1.5は、35Bパラメータのembodied-agentモデルで、リクエスト完了速度が最大4.7倍速くなっている。特に第一人称視点の動画理解は、通常の動画理解とは大きく異なる問題である。ロボットやスマートグラスでは、手が常に画面に入り込み物体を操作したり隠したりし、カメラ自体も動いているため複雑だ。Mk1.5はこのようなegocentric(主観的)動画に特化して訓練されており、ウェブ検索、ページ読取、逆画像検索、ズームなどのツール利用時にMMSearchのF1スコアが18.2から54.3へ、36.1ポイントも大幅に向上した。これはembodied intelligence(体現知能)を考える上でも有用な示唆で、ロボットはすべての能力を内部の重みに詰め込む必要はなく、不足情報を認識して適切な外部ツールを選択・利用しながらタスクを進めることが重要だとしている。
※長文投稿のため、参考訳は概要を最大600字まで表示しています。 元投稿をご参照ください
AINNでは投稿本文・投稿者本人の追記・第三者コメントの全文転載を避け、X公式埋め込みと元投稿への導線を中心に表示します。
AIによる見どころ整理
何について
Perceptronがembodied-agent用の新モデルMk1.5を公開しました。このモデルはFirst-person動画に特化しており、手や動くカメラの扱いが必要な課題に対応しています。Web検索などのツール使用時にMMSearchで36.1ポイントもF1スコアが向上し、高速なリクエスト完了も特徴です。ロボットが外部能力を必要に応じて選択し続行する考え方も示されています。
なぜ注目
embodied-agentに特化した35Bモデルの高性能化とリクエスト高速化、First-person動画特有の課題対応、Web検索等外部ツール活用による大幅な性能向上がポイントです。
🔰 初学者向け要約
Perceptronは、現実の環境で動くロボットやスマートグラス向けに特化した大型AIモデルMk1.5を発表しました。このモデルは使う人の視点で撮影した動画を理解し、Web検索などの外部機能も活用して物体の認識精度が大幅に上がることがわかりました。モデルは複数の道具を賢く使い分けてタスクを進めます。
用語を調べる
公開記事とWeb上の出典をもとに、Geminiが短く説明します。1日5回まで利用できます。
