Loading...
AgentBench(AgentBench)
オリジナルのAgentBench研究は、公開されたモデル一覧を8つの多様な環境およびマルチターンでオープンエンドな設定にわたって評価した。
In 30 seconds
- What
- SQL、ゲーム、ウェブ、オペレーティングシステムなど 8 種類の異なる環境でエージェントを複数ターンにわたり動かし、領域横断の実践的な能力を測る。
- When to use
- エージェントのモデルを比較したいときや、単一領域のベンチマークを超えた多様でオープンエンドなタスクを自分のエージェントが扱えるか検証したいとき。
- Watch out
- 複雑さと計算コストが大きい。結果が自分の具体的なユースケースや独自環境にそのまま当てはまるとは限らない。
Loading technique guide…