Как модели решают продуктовые задачи
Шесть задач из нашей библиотеки промптов — по одной на зону. Одни и те же брифы уходят в каждую модель, ответы оценивает судья чужого семейства по заранее заданным критериям. Это первый стартовый прогон: одна итерация, без повторов — читайте как ориентир, а не как истину.
Лидерборд
- 01GPT 5.6 Sol9,3
- 02GPT 5.6 Luna9,2
- 03Claude Fable 59,2
- 04GLM 5.39,1
- 05GPT 5.6 Terra9,1
- 06Claude Sonnet 59,0
- 07Claude Opus 4.88,7
- 08DeepSeek V4 Flash8,4
- 09Claude Haiku 4.57,8
Шкала 0–10: балл модели — среднее её оценок по шести задачам.
Победители по зонам
- АналитикаClaude Opus 4.810,0
- КомандаGPT 5.6 Sol9,6
- ДокументацияClaude Fable 59,8
- ОбщееGPT 5.6 Sol9,4
- РостClaude Fable 59,8
- ДискавериGPT 5.6 Luna9,2
Все задачи × модели
| Задача | GPT 5.6 Sol | GPT 5.6 Luna | Claude Fable 5 | GLM 5.3 | GPT 5.6 Terra | Claude Sonnet 5 | Claude Opus 4.8 | DeepSeek V4 Flash | Claude Haiku 4.5 |
|---|---|---|---|---|---|---|---|---|---|
| Выжимка из отчёта | 9,4 | 9,2 | — | 8,2 | 9,0 | 9,0 | 8,0 | 8,4 | 7,4 |
| Гайд кастдев-интервью | 9,0 | 9,2 | 8,8 | 9,2 | 8,4 | 8,2 | 8,6 | 7,8 | 8,0 |
| Каркас конкурентного анализа | 9,2 | 9,4 | 9,8 | 9,8 | 9,2 | 9,4 | 9,6 | 9,4 | 8,2 |
| Релизные ноты | 9,6 | 9,4 | 9,4 | 7,6 | 9,2 | 8,4 | 6,2 | 7,8 | 7,2 |
| Черновик PRD | 9,4 | 9,4 | 9,8 | 9,8 | 9,6 | 9,2 | 9,8 | 8,6 | 7,0 |
| SQL-запрос по описанию | 9,2 | 8,8 | 8,2 | 10,0 | 9,0 | 10,0 | 10,0 | 8,8 | 9,0 |
Средний балл критериев задачи по шкале 0–10. Запрет самосуда: GPT судит Claude Sonnet, Claude судит GPT Terra; GLM, Qwen и DeepSeek — среднее обоих судей.
Как читать эти цифры
- Модели через kodik-роутер, temperature 0: GLM 5.3, GPT 5.6 (Sol, Terra, Luna), Claude (Opus 4.8, Sonnet 5, Fable 5, Haiku 4.5), DeepSeek V4 Flash. Grok на роутере отсутствует.
- Брифы вымышлены, но реалистичны — те же, что в примерах ответов библиотеки.
- Судьи — две модели разных семейств (Claude Sonnet и GPT 5.6 Terra), балл — среднее их оценок по критериям, заданным до прогона. Каждое семейство судей совпадает с одним из кандидатов — абсолютную беспристрастность тут обеспечить нечем, поэтому цифры читайте как ориентир одной итерации, а не статистику.
- Позиции с разницей меньше 1 балла не считайте преимуществом: это шум одного судейства.