Нейросети находят уязвимости быстрее людей и пишут ОС за 12 часов
Мир искусственного интеллекта перешел в режим гиперскачка. Если раньше мы обсуждали выход новых моделей раз в квартал, то за последние три недели (с 4 по 24 мая) концентрация событий превысила все разумные пределы. От появления роботов-титанов до фундаментальных перестановок в кадровом составе крупнейших лабораторий — ландшафт индустрии меняется прямо на глазах.
Многие разработчики и фаундеры сейчас чувствуют легкое головокружение: как уследить за всем, когда Gemini пишет операционные системы за полдня, а Anthropic нанимает главных звезд индустрии? Мы подготовили детальный разбор ключевых событий, которые определят вектор развития AI на ближайшие месяцы.
Key Takeaways
- Anthropic совершила мощный рывок, наняв Андрея Карпатого и показав превосходство модели Mythos в поиске уязвимостей (найдено 271 багов в Firefox).
- Тренд на "агентность" стал доминирующим: новые версии Gemini и Claude Code теперь могут работать автономно до достижения поставленной цели без участия человека.
- Рынок вычислительных мощностей перегрет: аренда H100 практически недоступна, а старые чипы A100 продолжают расти в цене из-за дефицита.
- Инструменты разработки (Cursor, Bun) показывают невероятную скорость эволюции благодаря интеграции глубоких LLM-моделей в процесс написания кода.
1. LLM: Эра тотальной агентности и новые рекорды скорости
Последние недели ознаменовались переходом от "чат-ботов" к полноценным агентам. Обновление GPT Instant 5.5 привнесло в ChatGPT прозрачный интерфейс памяти — теперь пользователь четко видит, на какие данные опирается модель при формировании ответа. Это критически важно для уменьшения галлюцинаций в сложных рабочих процессах.
Тем временем Google нанесла ответный удар, представив Gemini 3.5 Flash. Главная фишка — фокус на агентности. В ходе тестов модель смогла написать скелет собственной операционной системы всего за 12 часов. Однако за интеллект придется платить: стоимость токенов выросла втрое. Параллельно с этим Cerebras запустили Kimi K2.6, выдающую фантастическую скорость в 1000 токенов в секунду, что делает реал-тайм взаимодействие с LLM на уровне триллиона параметров реальностью для корпоративных клиентов.
Для тех, кто строит продукты на базе AI, есть отличная новость: Anthropic начала выделять до $200 бесплатных API-кредитов для сторонних приложений на базе своего Agent SDK. Если вы планируете запускать свой проект, это отличный момент, чтобы протестировать возможности Claude. Подробнее о том, как эффективно выстраивать такие системы, рассказывает Олег Тестов | Соло-фаундер в найме в своем блоге.
2. Безопасность и код: Mythos против Firefox
Настоящий шок в сообществе кибербезопасности вызвала модель Mythos от Anthropic. Всего за месяц работы она обнаружила 271 уязвимость в браузере Firefox, включая критические бреши. Для сравнения: командам профессиональных исследователей-людей на такой объем работы обычно требуется около полутора лет. Это доказывает, что LLM становятся незаменимыми инструментами в аудите кода.
Разработчиков также порадовал Claude Code с новым мульти-агентным режимом и функцией /goal. Теперь модель не просто отвечает на вопросы, а работает в цикле до тех пор, пока задача не будет выполнена полностью. Это напоминает возможности легендарного Codex, но на новом уровне понимания контекста. В это же время лид-разработчик Bun совершил невозможное — при помощи Claude он за 10 дней переписал значительную часть рантайма с Zig на Rust, добившись более высокой стабильности.
3. Генеративные модели: Смена парадигмы в Google
Google официально объявила о закате линейки Veo. На смену узкоспециализированным инструментам пришла Gemini Omni. Теперь модель является мультимодальной по своей сути: она способна генерировать видео напрямую, без использования сторонних надстроек. Это упрощает пайплайны для креаторов и снижает задержки при создании контента.
Здесь же стоит упомянуть и технические нюансы инференса. Исследования в vLLM показали, что популярная квантизация KV-кэша (TurboQuant) отлично показывает себя на локальных машинах, но на серверах она съедает до 70% пропускной способности. Это важный сигнал для архитекторов систем: не все оптимизации одинаково полезны в продакшене. Чтобы не допускать досадных ошибок в архитектуре, стоит следить за актуальными практиками, которые публикует телеграм-канал "Олег Тестов | Соло-фаундер в найме".
4. Железо и инфраструктура: Маск, Anthropic и дефицит GPU
В мире инфраструктуры произошла неожиданная сделка: Anthropic арендует мощности в датацентре Colossus у SpaceX. Илон Маск и Anthropic теперь партнеры, что позволило последним вдвое увеличить лимиты для платных подписчиков. Это происходит на фоне глобального кризиса GPU — арендовать H100 практически невозможно, а облачные гиганты отдают приоритет только корпорациям.
В таблице ниже приведено сравнение текущей ситуации с вычислительными мощностями:
| Ресурс | Доступность | Тренд цены | Основные потребители |
|---|---|---|---|
| NVIDIA H100 | Критически низкая | Стабильно высокая | Big Tech, Frontier Labs |
| NVIDIA A100 | Ограниченная | Растет (+15-20%) | Средние AI-стартапы |
| L40S / RTX 4090 | Средняя | Стабильно | Локальный инференс, Fine-tuning |
5. Робототехника и кадры: Карпатый в Anthropic и робот весом в полтонны
Сенсацией недели стало присоединение Андрея Карпатого к команде Anthropic. После ухода из OpenAI и периода работы над образовательными проектами, Карпатый возвращается в "большую игру". Это значительное усиление для Anthropic в их гонке с OpenAI.
В физическом мире Unitree представила GD01 — настоящего стального гиганта весом в 500 кг. Этот робот стоимостью $650 000 уникален своей гибридной походкой: он одинаково уверенно перемещается как на двух, так и на четырех ногах, что открывает новые возможности для промышленной автоматизации в сложных условиях.
How does the GPU shortage affect small AI startups?
Дефицит вычислительных мощностей заставляет стартапы искать обходные пути: использовать более эффективные методы квантизации, переходить на менее востребованные L40S чипы или фокусироваться на дистилляции моделей. Многие малые игроки теперь вынуждены тратить до 50% своего финансирования только на оплату облачных вычислений.
What are the best ways to get hired by an AI frontier lab?
По мнению экспертов индустрии, сейчас ценятся не только теоретические знания, но и наличие публичных Open Source проектов или участие в ресерч-коллаборациях. Однако стоит помнить, что топовые стартапы часто предлагают больше "ownership" и возможностей для быстрого роста, чем гиганты вроде Google или OpenAI.
Какие изменения в Gemini 3.5 Flash наиболее значимы для бизнеса?
Для бизнеса наиболее важна агентность — способность модели выполнять длинные цепочки задач без подтверждения каждого шага. Это позволяет автоматизировать сложные процессы вроде первичного анализа юридических документов или автоматической обработки PR в GitHub, что уже успешно делают создатели OpenClaw (тратя при этом до $1.3 млн в месяц на токены).
Часто задаваемые вопросы
Стоит ли сейчас переходить с GPT-4 на Claude 3 для разработки?
Это зависит от задач. Claude 3 показывает отличные результаты в кодинге и логике, особенно с учетом новых увеличенных лимитов благодаря партнерству с SpaceX. Однако GPT-4 по-прежнему удерживает лидерство в некоторых аспектах мультимодальности.
Как сэкономить на токенах при масштабировании AI-агентов?
Рекомендуется использовать кэширование контекста (Context Caching), которое начали внедрять лидеры рынка, и переводить рутинные задачи на более дешевые модели вроде Gemini Flash или GPT-4o mini, оставляя флагманские модели только для финального принятия решений.
Безопасно ли доверять написание кода нейросетям после случая с Mythos?
Случай с Mythos доказывает обратное: нейросети — лучшие помощники в обеспечении безопасности. Они находят такие баги, которые человек может пропустить. Главное — использовать их как инструмент аудита, а не как единственный источник истины.
Будущее, которое уже здесь
Мы видим, как AI перестает быть просто надстройкой и становится фундаментом для новых операционных систем, языков программирования и даже физических роботов. Скорость изменений такова, что опыт месячной давности может считаться устаревшим. Главный навык сегодня — это адаптивность и умение быстро внедрять новые инструменты в свой воркфлоу.
Для тех, кто хочет не просто наблюдать за новостями, а понимать внутреннюю кухню разработки и запуска AI-продуктов, крайне важно иметь доступ к практическому опыту. Путь от идеи до работающей системы полон нюансов, о которых не пишут в официальных пресс-релизах.
Построй свою систему автоматизации и роста
Практические советы по архитектуре жизни и бизнеса от эксперта → Подписаться на канал Олега Тестова