Новости
DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
Apple Machine Learning Research · Опубликовано · 3 мин чтения
За 30 секунд
- Что произошло
- Apple researchers released DeepAmbigQA, a 3,600-question benchmark testing whether LLMs can answer complex questions requiring both name disambiguation and multi-hop reasoning.
- Почему это важно
- Engineers building search-augmented LLM systems should care when evaluating whether their models return complete answer sets to ambiguous, multi-step questions.
- На что обратить внимание
- Even GPT-5 achieves only 0.13 exact match on ambiguous questions, suggesting current LLMs struggle fundamentally with answer completeness rather than this being a simple benchmark limitation.
Послушать это резюме
- llm
- language model
- reasoning
- eval
- benchmark
Паттерны, стоящие за этой новостью
- Proactive Clarification & Active Disambiguation
- Eval-Driven Development (Agent CI)
- Agentic Context Engineering (Evolving Playbook)
Каждый разбирает, как работает техника, когда она оправдывает затраты и где ломается.
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.