パターンを読み込んでいます…
テスト時計算スケーリング(TTC)
問題の複雑さに応じて計算リソースを動的に割り当てる
30秒でわかる概要
- 概要
- 難しい問題にはより多くの推論ステップや計算リソースを、簡単な問題にはより少なく割り当て、検出した難易度に応じてリアルタイムで調整します。
- 使いどころ
- 問題の複雑さの幅が大きく、レイテンシのばらつきを許容できる場合や、深い推論が要る問い合わせと素早い回答で足りる問い合わせが混在する場合に。
- 注意点
- 問題の複雑さを事前に見積もるのは当てになりません。ずれに気づく前に、簡単な問題に使いすぎたり、難しい問題に足りなかったりします。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
テスト時計算スケーリング: 概要
問題の複雑さに応じて計算リソースを動的に割り当てる
- Dynamic compute allocation
- Complexity-aware scaling
- Adaptive thinking time
- Resource optimization
- Quality-compute trade-offs
- Real-time adjustment
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- Scaling Laws for Neural Language Models (Kaplan et al., 2020)arXiv:2001.08361
- Training Compute-Optimal Large Language Models (Hoffmann et al., 2022)arXiv:2203.15556
- Let's Verify Step by Step (Lightman et al., 2023)arXiv:2305.20050
- STaR: Bootstrapping Reasoning With Reasoning (Zelikman et al., 2022)arXiv:2203.14465
- OpenAI Latency Optimization Guide
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで