DeepMindの手法「宣言的注意」で大規模言語モデルの注意計算効率向上
日本語参考要約訳
Google DeepMindが発表した研究では、大規模言語モデル(LLM)が自分自身の注意(attention)を制御する手法「Declarative Attention」を導入した。従来、AIが長い文書に基づいて回答を生成する際、回答の一単語を生成するたびに文書全体を再度読み直す方式を取っており、これが極めて非効率かつコスト高となっていた。例えば、1百万トークンの文脈情報を使う際には、単語一つを書くために15ギガバイトものメモリを消費し、人間が500ページの本を一文書くごとに全ページ読み返すような無駄があった。 「Declarative Attention」ではAIに3つのタグを与え、必要な情報がどこにあるかを宣言させる。まず文書全体をざっと見て情報の位置を特定し、つづいて特定の部分(例:7ページ)だけに注意を集中、最後に文書を読まずに抽出済みの情報だけで推論する、という人間の読書プロセスに似た流れを実現した。この方法は新たなモデルを訓練する必要なく、既存のモデルにプロンプトによる指示で適用可能だという。 実験結果では、処理するトークン数が半分近く(約52%)削減され、応答あたり最大21 million tokensの節約となったにもかかわらず、回答の精度はほとんど落ちていない。これにより、長文を扱うAIの計算コストと効率の問題に大きな進展がもたらされている。
※長文投稿のため、参考訳は概要を最大600字まで表示しています。 元投稿をご参照ください
AINNでは投稿本文・投稿者本人の追記・第三者コメントの全文転載を避け、X公式埋め込みと元投稿への導線を中心に表示します。
AIによる見どころ整理
何について
この投稿は、DeepMindの研究者が発表した手法「宣言的注意(Declarative Attention)」により、大規模言語モデルが長文の注意処理を自分で制御できることを紹介する。従来の手法では長文の全体を毎単語ごとに再読するため膨大な計算コストがかかっていたが、宣言的注意により処理すべき文脈の範囲を限定し、計算資源を大幅に削減しつつ精度を維持できる。既存モデルにプロンプトを与えるだけで効果が得られ、長文処理の効率化に重要な技術と評価される。
なぜ注目
長文処理時の計算負荷が高い問題を、既存モデルの追加学習なしで解決できる手法を示し、処理コストの大幅削減と人間の読書行動に近い自己制御アテンションの実装を示した点に注目できる。
🔰 初学者向け要約
DeepMindの研究で、長い文章を扱うAIが、読むべき部分を自分で決めて無駄な部分を無視する方法が公開されました。これにより、AIが長文の情報を効率よく処理できるようになり、計算コストが大幅に減ります。新しいAIモデルを作らず、既存のモデルに少し指示を加えるだけで使えます。
用語を調べる
公開記事とWeb上の出典をもとに、Geminiが短く説明します。1日5回まで利用できます。
