Loading...
GAIA:汎用 AI アシスタントのベンチマーク(GAIA)
オリジナルの GAIA ベンチマークは、推論、マルチモーダル処理、ウェブ閲覧、ツール利用を評価しました。比較対象として挙げられたモデルは、論文当時のベースラインです。
In 30 seconds
- What
- 3 つの難易度レベルにわたる 450 問以上からなるベンチマーク群で、推論、マルチモーダル性、ツール利用、ウェブ閲覧を人間のベースライン 92% と比較して測定します。
- When to use
- 複数のスキルを要する実世界タスクでエージェントの能力を比較し、推論、視覚、ツール連携における性能の差を特定する場合。
- Watch out
- 結果は特定の問題分布に対する一時点の性能を示すにすぎず、エージェントがベンチマークのパターンに過適合し、新しい実世界の問題に一般化できないことがあります。
Loading technique guide…