Новости
VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
arXiv cs.AI · Опубликовано · 3 мин чтения
За 30 секунд
- Что произошло
- VAKRA benchmark evaluates AI agents on multi-hop reasoning across 8,000+ executable APIs in 62 domains with tool-use policy constraints.
- Почему это важно
- Enterprise engineers building or deploying AI agents that must combine API calls and document retrieval under operational constraints.
- На что обратить внимание
- Best models achieve only 70% on single-hop tasks and 50% on multi-step reasoning; failures stem from language reasoning, not tool mechanics.
Послушать это резюме
- agent
- reasoning
- retrieval
- tool-use
- edge
Паттерны, стоящие за этой новостью
Каждый разбирает, как работает техника, когда она оправдывает затраты и где ломается.
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.