パターンを読み込んでいます…
TheAgentCompany Benchmark(TAC)
ソフトウェアエンジニアリング企業で通常は複数の職務ロールが担うような、影響の大きい現実世界のタスクでLLMエージェントをベンチマークする。
30秒でわかる概要
- 概要
- ソフトウェアエンジニアリングの各職務にまたがる多段階の実務タスクでエージェントの性能を測り、完全達成と部分点を分けて採点します。
- 使いどころ
- 本番投入の前に現実的な業務シナリオで LLM エージェントを比較したいときや、モデルのバージョン間で能力の伸びを追いたいときに。
- 注意点
- 部分点は、重要な工程で失敗しているエージェントを覆い隠すことがあります。39% という部分点が、価値ゼロの未完成な作業を隠している場合もあります。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
TheAgentCompany Benchmark: 概要
ソフトウェアエンジニアリング企業で通常は複数の職務ロールが担うような、影響の大きい現実世界のタスクでLLMエージェントをベンチマークする。
- Real-world professional tasks
- Multiple job role simulations
- Partial completion scoring
- Industry-relevant scenarios
- Comprehensive task diversity
エージェント評価フィールドガイドを受け取る
25のエージェント評価手法を1冊に凝縮:どのベンチマークが何を測るか、公開スコアが誤解を招くのはどんなときか、自分の失敗から評価を組み立てる方法。確認メールと一緒にリンクが届き、週刊The Agent Architectも購読できます。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
評価が見落としているものを可視化
エージェントの評価は実装よりも難しく、多くのテストは緑のまま本番だけがずれていきます。評価の仕組みを端から端まで点検します。いま測れているもの、まだ見えていないもの、そして現状のテストが素通りさせる劣化を洗い出します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで