パターンを読み込んでいます…
🎰
多腕バンディット最適化(MAB)
不確実性の下での逐次的な意思決定において、探索と活用の最適なトレードオフを実現する手法
複雑さ: medium探索と発見
30秒でわかる概要
- 概要
- 新しい選択肢を試すことと、良いと分かっている選択肢を活用することのバランスを取り、信頼区間の上限を用いて各ラウンドでどのアームを引くかを決めます。
- 使いどころ
- 報酬が不確実な意思決定を繰り返し、各選択から学びながら、累積リグレットを最小化する必要がある場面。
- 注意点
- 報酬シグナルにノイズや遅延がある場合、あるいは環境がアルゴリズムの適応速度より速く変化する場合、収束が遅くなったり判断を誤ったりします。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
多腕バンディット最適化: 概要
不確実性の下での逐次的な意思決定において、探索と活用の最適なトレードオフを実現する手法
- Regret minimization
- Confidence bounds
- Bayesian optimization
- Contextual awareness
- Non-stationary adaptation
- Multi-objective handling
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで