Лаборатория оценки паттернов
Запустите небольшой набор тестов на разных паттернах агентов и разных моделях рядом друг с другом. Каждый запуск показывает реальный вывод, задержку, число токенов и стоимость; ИИ-судья оценивает качество по вашим ожидаемым ответам, а всё сравнение экспортируется в JSON или CSV. Выбор паттерна опирается на измерения, а не на интуицию.
Одно реальное сравнение
Одна задача, четыре способа
Две модели и два паттерна на одном вопросе: измерено, а не предположено. Задержка это реальное время, число токенов приходит от провайдера, а стоимость та, что была фактически списана.
Задача: A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball. How much does the ball cost?
| Модель | Паттерн | Ответ | Задержка | Токены | Стоимость |
|---|---|---|---|---|---|
| anthropic/claude-sonnet-5 | Direct | $0.05 | 3,065 ms | 63 | $0.000174 |
| anthropic/claude-sonnet-5 | Chain of Thought | $0.05 | 4,870 ms | 366 | $0.0031 |
| google/gemini-2.5-flash | Direct | $0.05 | 458 ms | 45 | $0.000024 |
| google/gemini-2.5-flash | Chain of Thought | $0.05 | 1,257 ms | 276 | $0.00058 |
Все четыре запуска ответили верно, то есть на этой задаче паттерн рассуждения не дал ничего, кроме времени и денег: самый дорогой запуск обошёлся примерно в 128 раз дороже самого дешёвого. Это и есть довод в пользу того, чтобы измерять выбор паттерна, а не предполагать его, и причина, по которой лаборатория показывает стоимость и задержку рядом с результатом.
Измерено 2026-08-06
И судья, который показывает свою работу
Лаборатория оценивает и качество: ИИ-судья опирается на ожидаемый ответ, который вы задаёте. В этом записанном сравнении оба запуска вычислили верное число, и судья всё равно их развёл: задача требовала назвать число первым, и запуск, спрятавший его в конце, потерял баллы за следование инструкциям.
Задача: A retail API rate limiter allows 120 requests per minute per key. A batch job needs to send 4,500 requests. What is the minimum time in minutes to send them all, and how should the job pace itself? Answer with the number first.
Ожидаемый ответ: 37.5 minutes (4500 / 120), pacing at or under 2 requests per second.
| Модель | Паттерн | Качество | Инструкции | Задержка | Стоимость |
|---|---|---|---|---|---|
| openai/gpt-5-mini | Chain of Thought | 5.00/5 | 5/5 | 14,220 ms | $0.0021 |
| anthropic/claude-haiku-4-5 | Chain of Thought | 4.67/5 | 3/5 | 4,688 ms | $0.0023 |
Судья о запуске со снятыми баллами: “The calculation and pacing advice are correct and clearly explained, but the answer is not given first as instructed; it only appears at the end after several intermediate steps.”
Парные вердикты проверяются на позиционное смещение: судью спрашивают дважды, меняя порядок, и на этой близкой паре он поменял выбор, поэтому лаборатория сообщила о ничьей вместо выдуманного победителя.
Оценено моделью anthropic/claude-sonnet-5 от 1 до 5 по ожидаемому ответу. Измерено 2026-08-10