Тест нейросетей против Opus 4.7: неожиданный лидер в кодинге Windows 95

Выбор подходящей нейросети для разработки сегодня напоминает прогулку по минному полю: маркетинговые обещания кричат о превосходстве, но на практике код часто разваливается при первой же сложной задаче. Когда стандартные бенчмарки перестают отражать реальность, остается только одно — брать и тестировать модели на «неудобных» задачах в один промпт (1-shot), чтобы увидеть их истинный предел креативности и логики.

Многие привыкли полагаться на громкие имена, но что если бюджетная модель стоимостью в несколько раз дешевле выдает результат чище, чем признанные гиганты? В этом материале мы разберем результаты эксперимента по воссозданию интерфейса Windows 95 в одном HTML-файле силами семи передовых нейросетей, включая новинки 2026 года.

Основные выводы исследования

  • Модель mimo-v2.5-pro стала главным открытием теста, показав результат на уровне топовых решений при стоимости всего $1/$3 за миллион токенов.
  • Claude Opus 4.7 лидирует в плане функциональности, будучи единственной моделью, реализовавшей рабочие инструменты в приложении Paint.
  • GPT-5.5 продемонстрировала неожиданную небрежность в дизайне и упрощение логики, что ставит под вопрос её безоговорочное доминирование.
  • Сложные UI-задачи без предварительного планирования (Chain-of-Thought) выявляют структурные слабости даже у самых дорогих моделей.

Как проходило сравнение нейросетей: glm-5.1, kimi-k2.6, mimo-v2.5-pro и другие

Для объективности эксперимента была выбрана задача, требующая не только чистого кода, но и понимания визуального стиля, а также базовой логики взаимодействия оконных интерфейсов. Участники теста: китайские флагманы glm-5.1, kimi-k2.6, qwen3.6-plus, deepseek-v4-pro и "темная лошадка" mimo-v2.5-pro. Позже к ним присоединились гиганты западного рынка — Opus 4.7 и GPT-5.5.

Суть задания: сгенерировать полностью автономный HTML-файл, имитирующий рабочий стол Windows 95, с работающим меню «Пуск», окнами и хотя бы одной простой игрой (Солитер). Здесь нет места для дебаггинга или уточняющих промптов — только 1-shot. Для глубокого понимания контекста и свежих новостей из мира нейросетей рекомендую подписаться на телеграм-канал "Олег Тестов | Соло-фаундер в найме", где регулярно выходят подобные разборы.

Тут есть нюанс: китайские модели традиционно сильны в математике и кодинге алгоритмов, но верстка ретро-интерфейсов — это проверка на "насмотренность" обучающей выборки. Результаты оказались полярными: от идеальной эстетики до полной потери функциональности.

Кто победил в битве за верстку: Итоговая таблица результатов

Чтобы не быть голословными, сравним ключевые параметры работы моделей. Оценка выставлялась по 10-балльной шкале на основе визуального соответствия, чистоты кода и интерактивности элементов.

Модель Визуальный стиль Функциональность Наличие Солитера Итог (из 10)
Claude Opus 4.7 9/10 9/10 Частично 9.0
mimo-v2.5-pro 8/10 7/10 Да 7.5
GPT-5.5 6/10 6/10 Нет 6.0
Deepseek-v4-pro 7/10 5/10 Да 6.0
Kimi-k2.6 5/10 4/10 Нет 4.5

Но вот что действительно интересно: модель mimo-v2.5-pro, о которой мало кто говорит в широких кругах, выдала на удивление крепкий результат. При цене в $1 за входные токены она предложила готовую архитектуру, которая не рассыпалась при открытии нескольких окон. Для тех, кто ищет оптимальное соотношение цены и качества в разработке, это может стать ключевым инсайтом года. Узнайте больше о скрытых возможностях бюджетных моделей в нашем детальном сообществе.

Почему GPT-5.5 уступила позицию лидерства?

Многие ожидали, что GPT-5.5 с легкостью справится с задачей, учитывая её вычислительную мощность. Однако на практике реализация оказалась небрежной. Окна выглядели криво, дизайн был упрощен до уровня современных плоских интерфейсов, что убивало атмосферу Windows 95, а реализовывать Солитер модель и вовсе поленилась.

В чем причина такого провала? Вероятно, дело в оптимизации. Современные модели все чаще обучаются по принципу достаточности: выдать рабочий, но минималистичный код. В то время как Opus 4.7 пошел по пути "избыточности" — это единственная нейросеть, которая попыталась реализовать даже инструменты рисования в Paint (круги, заливка, прямоугольники). Хотя работало это кривовато, сам факт попытки в рамках одного промпта впечатляет.

Здесь важно отметить: тестирование проводилось в нативных средах — Claude Code для Opus и Codex для GPT. Никакого предварительного планирования (planning stage) не использовалось. Это был чистый поток сознания AI.

Часто задаваемые вопросы

Какая нейросеть лучше всего пишет код в 2026 году?

На данный момент лидером по глубине проработки и креативности в сложных UI-задачах является Claude Opus 4.7, однако модель mimo-v2.5-pro лидирует по показателю эффективности на затраченный доллар.

Стоит ли переплачивать за GPT-5.5 для простых задач?

Эксперимент показывает, что для задач фронтенд-разработки GPT-5.5 может быть избыточен или даже менее аккуратен, чем специализированные китайские модели или Claude.

Почему результаты 1-shot могут быть неточными?

Без итеративного подхода и дебаггинга результат сильно зависит от "удачной" генерации начальных весов внимания нейросети (нам повезло или не повезло в конкретный момент).

Будущее персональных бенчмарков и выводы

Этот тест — лишь начало. Верить официальным таблицам лидеров на Hugging Face становится всё сложнее, так как модели часто переобучаются под конкретные тесты. Разработка собственного бенчмарка с реальными задачами (от верстки до сложной бизнес-логики) — единственный способ для разработчика или фаундера выбрать рабочий инструмент.

Подводя итог, можно сказать: эпоха одного лидера закончилась. Рынок сегментируется:

  • Если нужна максимальная функциональность и мощь — ваш выбор Claude Opus 4.7.
  • Если бюджет ограничен, но нужно качество — присмотритесь к mimo-v2.5-pro.
  • Китайские модели типа deepseek-v4-pro отлично показывают себя в специфических алгоритмах, но могут плавать в дизайне.

В ближайшее время мы планируем запустить постоянную рубрику с проверкой новых моделей на специфических кейсах. Это поможет отсеять маркетинговый шум от реально работающих технологий.

Следите за битвой нейросетей в реальном времени

Присоединяйтесь к сообществу практиков, чтобы первыми получать результаты новых тестов → Подписаться на канал "Олег Тестов"

Read more

План А: как спасти человечество от гонки ИИ-вооружений

План А: как спасти человечество от гонки ИИ-вооружений

Мир стоит на пороге технологической сингулярности, и вопрос уже не в том, когда появится сверхразум, а в том, как человечество переживет момент его рождения. Создатели нашумевшего проекта AI 2027 представили новый сценарий будущего под названием «Plan A» — амбициозный манифест по предотвращению глобальной катастрофы. Пока ведущие державы наращивают вычислительные мощности в

Как скрыть ИИ: 5 способов изменить ритм текста для обхода детекторов

Как скрыть ИИ: 5 способов изменить ритм текста для обхода детекторов

Вы наверняка это чувствовали: читаешь статью, и внутри срабатывает тихий звоночек. Вроде бы все грамматически верно, факты на месте, но текст ощущается «пластиковым». Это «запах» нейросети. Сегодня детекторы ИИ и обычные читатели стали невероятно чуткими к определенным паттернам, которые выдают машину с потрохами. Проблема не в использовании ChatGPT как таковом,

7 техник промптинга от Anthropic: как получать умные ответы от ИИ

7 техник промптинга от Anthropic: как получать умные ответы от ИИ

Каждый, кто активно работает с нейросетями, рано или поздно сталкивается с «эффектом плато»: ответы становятся предсказуемыми, плоскими и лишенными той глубины, которая необходима для серьезных исследовательских или бизнес-задач. Проблема не в модели, а в подходе к постановке задачи. Когда мы просим ИИ «просто решить проблему», мы получаем усредненный результат из

7 способов сохранить лицо в ИИ-видео: решаем проблему за 30 секунд

7 способов сохранить лицо в ИИ-видео: решаем проблему за 30 секунд

Вы провели часы, оттачивая промпт, выбрали лучшую модель, нажали «Сгенерировать», и первый кадр выглядит потрясающе. Но к третьему шоту ваш главный герой внезапно меняет черты лица, освещение в комнате превращается из дневного в закатное, а одежда живет своей жизнью. Знакомая ситуация? Виртуальная «преемственность» (continuity) — это главная стена, о которую разбиваются