Loading...
AgentBench(AgentBench)
Оригинальное исследование AgentBench оценивало опубликованный набор моделей в 8 различных средах и в многошаговых сценариях с открытым завершением.
In 30 seconds
- What
- Прогоняет агентов через восемь разных сред (SQL, игры, веб, операционные системы) с многоходовыми взаимодействиями, чтобы измерить практические способности в разных областях.
- When to use
- Сравнение моделей агентов или проверка того, справляется ли ваш агент с разнообразными открытыми задачами за пределами однодоменных бенчмарков.
- Watch out
- Высокая сложность и вычислительная стоимость; результаты могут не переноситься на ваши конкретные сценарии или собственные среды.
Loading technique guide…