Loading...
TheAgentCompany Benchmark(TAC)
Оценивает LLM-агентов на значимых реальных задачах, которые обычно выполняются несколькими рабочими ролями в компании по разработке программного обеспечения.
In 30 seconds
- What
- Измеряет работу агентов на многошаговых профессиональных задачах из разных ролей в разработке ПО, оценивая полное выполнение и частичный зачёт по отдельности.
- When to use
- Чтобы сравнить LLM-агентов на реалистичных рабочих сценариях перед внедрением или отследить рост возможностей от версии модели к версии.
- Watch out
- Баллы за частичное выполнение могут скрывать провал агента на критических шагах: 39 % частичного результата способны маскировать незаконченную работу нулевой ценности.
Loading technique guide…