Новости
PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image
arXiv cs.AI · Опубликовано · 3 мин чтения
За 30 секунд
- Что произошло
- PathAgentBench benchmark evaluates vision-language models on whole-slide pathology images across evidence-seeking tasks using 1,822 annotated TCGA slides.
- Почему это важно
- Matters for engineers building AI systems for digital pathology who need to assess model performance on realistic gigapixel image analysis workflows.
- На что обратить внимание
- Models excel at reasoning over curated evidence but struggle with finding relevant regions directly in slides, with hit rates dropping sharply at higher magnifications.
Послушать это резюме
- agent
- language model
- retrieval
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.