Итог
Максимум по этому заходу — 73 балла: три шага из шести. Цена по первым шести названа за исследование и лендинг, без статьи; по DeepSeek и Mimo охват не уточнялся, поэтому «балл за доллар» — порядок величины.
| Модель | Балл из 73 | Цена прогона | Балл за доллар | Штраф |
|---|---|---|---|---|
| Opus 5.0 | 70 | 33,15 $ | 2,1 | — |
| Kimi 3 | 67,5 | 7,53 $ | 9,0 | — |
| Grok 4.5 | 61 | 4,07 $ | 15,0 | — |
| GPT-5.6 Terra | 52,5 | 4,86 $ | 10,8 | — |
| DeepSeek v4 Pro | 51,5 | 3,15 $ | 16,3 | −5 |
| Qwen 3.6 | 47 | 0,78 $ | 60,3 | −5 |
| Mimo 2.5 Pro | 36,5 | 0,16 $ | 228 | −10 |
Шаг 0: что сделали с данными
Токена Вордстата не было ни у кого — проверено во всех семи папках. Это и есть главный разделитель захода.
| Модель | Конкурентов | Все сайты открываются | Запросов в ядре | Что с частотностью | Выдумки |
|---|---|---|---|---|---|
| Opus 5.0 | 6 | да | 37 | Букварикс, широкая и точная; числа сверены и совпали | нет |
| Kimi 3 | 6 | да | 43 | оценка классами A–D с диапазонами, метод воспроизводим | нет |
| Grok 4.5 | 6 | да | 35 | «н/д» во всех строках + инструкция, чем перезаполнить | нет |
| GPT-5.6 Terra | 1 | да | 25 | колонка пуста, R1–R3 не отмечены | нет |
| DeepSeek v4 Pro | 4 | да | 30 | оценка, метод расписан; анкер шкалы без ссылки | средний чек 8 000 ₽ в статье |
| Qwen 3.6 | 6 | да | 35 | оценка ±40 %, метод непроверяем | реестровая запись № 1234183 |
| Mimo 2.5 Pro | 5 | нет: splus.center не существует | 39 | оценка косвенная | домен конкурента |
Шаги 1 и 2: что построено
Контракт — внешняя проверка адресов и форматов ответов, одинаковая для всех. Объём статьи по редполитике — от 6 000 до 12 000 знаков без пробелов.
| Модель | Контракт | Вёрстка на 360 px | Статья, знаков | Тестов | Навык seo-article |
|---|---|---|---|---|---|
| Opus 5.0 | 33 из 39 | чисто | 10 054 | 67, включая браузерные | SKILL.md + исполняемый чекер |
| Kimi 3 | 33 из 39 | чисто | 6 447 | 16 | SKILL.md |
| Grok 4.5 | 38 из 39 | чисто | 9 633 | нет | SKILL.md + шаблон |
| GPT-5.6 Terra | 32 из 39 | прокрутка 377 px | 9 831 | нет | README.md |
| DeepSeek v4 Pro | 33 из 39 | чисто | 7 454 | нет | prompt.md |
| Qwen 3.6 | 38 из 39 | чисто | 7 591 | нет | skill.md |
| Mimo 2.5 Pro | 32 из 39 | чисто | 4 177 — ниже нормы | нет | README.md |
Процесс
Ложная галочка — критерий приёмки, отмеченный выполненным, но опровергаемый проверкой. Это не небрежность, а заявление о результате, которого нет.
| Модель | Обращений к человеку | Ложных галочек | Что именно |
|---|---|---|---|
| Opus 5.0 | 0 | 0 | — |
| Kimi 3 | 0 | 0 | — |
| Grok 4.5 | 0 | 0 | — |
| GPT-5.6 Terra | 1, по существу задания | 1 | L6: вёрстка на 360 px |
| DeepSeek v4 Pro | 0 | 1 | A5: все цифры прослеживаются до источника |
| Qwen 3.6 | 0 | 1 | R6 и A5: выдуманная реестровая запись |
| Mimo 2.5 Pro | 0 | 2 | R6: выдуманный домен; A2: объём статьи |
Что из этого следует
Три модели из семи выдумали данные — и все три выдумали ровно то, чего не смогли достать. Токена Вордстата не было ни у кого, и это оказалось лучшей проверкой захода: у инструмента остаётся два пути — сказать «не смог и вот почему» или выдать правдоподобное число.
Разрыв проходит не по цене и не по размеру. Grok за 4 доллара ведёт себя безупречно, Qwen за 78 центов выдумывает одну цифру, Mimo за 16 центов — один домен, а самый дорогой прогон захода отработал чисто. Аккуратность здесь — не функция бюджета.
Второй результат — про деньги. Kimi 3 набрал 96 % балла Opus за 23 % его цены. Разница между ними набрана на мелочах: длиннее статья и настоящие браузерные тесты. Если платить из своего кармана, выбор перестаёт быть очевидным.
И третий, неудобный: кривую вёрстку видно сразу, а выдуманное число со ссылкой на источник уезжает в презентацию заказчику. Все семь работ выглядели прилично. Проверка источников отделила их иначе, чем внешний вид.