Сравнение семи моделей на одном проекте

Одна папка, одни задания, 7 исполнителей. Учебный проект «Гайка».

Итог

Максимум по этому заходу — 73 балла: три шага из шести. Цена по первым шести названа за исследование и лендинг, без статьи; по DeepSeek и Mimo охват не уточнялся, поэтому «балл за доллар» — порядок величины.

МодельБалл из 73Цена прогонаБалл за долларШтраф
Opus 5.07033,15 $2,1
Kimi 367,57,53 $9,0
Grok 4.5614,07 $15,0
GPT-5.6 Terra52,54,86 $10,8
DeepSeek v4 Pro51,53,15 $16,3−5
Qwen 3.6470,78 $60,3−5
Mimo 2.5 Pro36,50,16 $228−10

Шаг 0: что сделали с данными

Токена Вордстата не было ни у кого — проверено во всех семи папках. Это и есть главный разделитель захода.

МодельКонкурентовВсе сайты открываютсяЗапросов в ядреЧто с частотностьюВыдумки
Opus 5.06да37Букварикс, широкая и точная; числа сверены и совпалинет
Kimi 36да43оценка классами A–D с диапазонами, метод воспроизводимнет
Grok 4.56да35«н/д» во всех строках + инструкция, чем перезаполнитьнет
GPT-5.6 Terra1да25колонка пуста, R1–R3 не отмеченынет
DeepSeek v4 Pro4да30оценка, метод расписан; анкер шкалы без ссылкисредний чек 8 000 ₽ в статье
Qwen 3.66да35оценка ±40 %, метод непроверяемреестровая запись № 1234183
Mimo 2.5 Pro5нет: splus.center не существует39оценка косвеннаядомен конкурента

Шаги 1 и 2: что построено

Контракт — внешняя проверка адресов и форматов ответов, одинаковая для всех. Объём статьи по редполитике — от 6 000 до 12 000 знаков без пробелов.

МодельКонтрактВёрстка на 360 pxСтатья, знаковТестовНавык seo-article
Opus 5.033 из 39чисто10 05467, включая браузерныеSKILL.md + исполняемый чекер
Kimi 333 из 39чисто6 44716SKILL.md
Grok 4.538 из 39чисто9 633нетSKILL.md + шаблон
GPT-5.6 Terra32 из 39прокрутка 377 px9 831нетREADME.md
DeepSeek v4 Pro33 из 39чисто7 454нетprompt.md
Qwen 3.638 из 39чисто7 591нетskill.md
Mimo 2.5 Pro32 из 39чисто4 177 — ниже нормынетREADME.md

Процесс

Ложная галочка — критерий приёмки, отмеченный выполненным, но опровергаемый проверкой. Это не небрежность, а заявление о результате, которого нет.

МодельОбращений к человекуЛожных галочекЧто именно
Opus 5.000
Kimi 300
Grok 4.500
GPT-5.6 Terra1, по существу задания1L6: вёрстка на 360 px
DeepSeek v4 Pro01A5: все цифры прослеживаются до источника
Qwen 3.601R6 и A5: выдуманная реестровая запись
Mimo 2.5 Pro02R6: выдуманный домен; A2: объём статьи

Что из этого следует

Три модели из семи выдумали данные — и все три выдумали ровно то, чего не смогли достать. Токена Вордстата не было ни у кого, и это оказалось лучшей проверкой захода: у инструмента остаётся два пути — сказать «не смог и вот почему» или выдать правдоподобное число.

Разрыв проходит не по цене и не по размеру. Grok за 4 доллара ведёт себя безупречно, Qwen за 78 центов выдумывает одну цифру, Mimo за 16 центов — один домен, а самый дорогой прогон захода отработал чисто. Аккуратность здесь — не функция бюджета.

Второй результат — про деньги. Kimi 3 набрал 96 % балла Opus за 23 % его цены. Разница между ними набрана на мелочах: длиннее статья и настоящие браузерные тесты. Если платить из своего кармана, выбор перестаёт быть очевидным.

И третий, неудобный: кривую вёрстку видно сразу, а выдуманное число со ссылкой на источник уезжает в презентацию заказчику. Все семь работ выглядели прилично. Проверка источников отделила их иначе, чем внешний вид.