パターンを読み込んでいます…
Infini-Attention アーキテクチャ(IAA)
有界メモリと圧縮的アテンション機構を用いた、Google による画期的な無限コンテキスト処理
30秒でわかる概要
- 概要
- 直近のトークンへのローカルな注意と、古いトークンへの圧縮された注意を、有界なメモリの中で組み合わせ、実効的な文脈長を伸ばします。
- 使いどころ
- 際限なく続くストリームを処理する長時間稼働のシステムで、履歴全体が重要でありながらメモリは一定に保たなければならない場合。
- 注意点
- 圧縮は情報を失います。遠い文脈の想起が劣化しても自分のタスクが耐えられるかを、本番投入の前に確かめてください。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
Infini-Attention アーキテクチャ: 概要
有界メモリと圧縮的アテンション機構を用いた、Google による画期的な無限コンテキスト処理
- Infinite context length with bounded memory
- Compressive memory module integration
- Linear attention mechanism for long sequences
- Streaming over infinitely long inputs
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- Infini-attention: Infinite Context Length with Bounded Memory (Munkhdalai et al., 2024)arXiv:2404.07143
- Transformers are RNNs: Fast Autoregressive Transformers with Linear AttentionarXiv:2006.16236
- Compressive Transformers for Long-Range Sequence Modelling (Rae et al., 2019)arXiv:1911.05507
- Google Research - Infini-attention Implementation
- Linear Attention Implementation Guide
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで