Что нового в главных ИИ-моделях этой весной
РАБОЧИЕ МОДЕЛИ
Каждый релиз сопровождается таблицами, где новая модель выигрывает у старой. Пользователю важнее другое: станет ли меньше ручных исправлений, можно ли отдать модели более длинную задачу и не придётся ли платить флагманскую цену за простую операцию.
Ниже — не полный календарь индустрии, а срез заметных релизов с 1 марта по 29 мая 2026 года. Более поздние летние обновления сознательно не включены, чтобы материал оставался честным снимком периода.
Коротко: четыре изменения
| Семейство | Заметные релизы | Практический смысл |
|---|---|---|
| OpenAI | GPT‑5.4, mini/nano, GPT‑5.5 | Рабочие задачи и выбор между качеством и стоимостью внутри одной линейки |
| Anthropic | Claude Opus 4.7 и 4.8 | Длинные агентные и кодовые задачи, управляемый effort |
| Gemini 3.1 Flash-Lite и Flash Live | Дешёвые массовые операции и более естественные голосовые сценарии | |
| DeepSeek | V4-Pro и V4-Flash | Отдельные режимы для сильных и быстрых задач, новая базовая линейка API |
OpenAI: рабочая линейка вместо одной модели
5 марта OpenAI выпустила GPT‑5.4 и GPT‑5.4 Pro. В анонсе акцент сделан на профессиональной работе: код, использование инструментов, документы, таблицы и презентации. Через двенадцать дней появились GPT‑5.4 mini и nano — версии для более быстрых и массовых операций.
Это важнее очередного прироста в общем тесте. У пользователя появляется понятная маршрутизация:
- флагман — для неоднозначной задачи и финального решения;
- mini — для хорошо поставленных подзадач, кода и работы с инструментами;
- nano — для извлечения, классификации и простых операций в большом объёме.
23 апреля вышла GPT‑5.5. OpenAI описала её как модель для более самостоятельного выполнения реальной работы. Практически это продолжает общий тренд: модель получает не только вопрос, а цель, доступ к инструментам и возможность пройти несколько шагов.
Что проверить самому: не стала ли более сильная модель избыточной для ваших повторяемых запросов. Возьмите десять типичных задач и сравните флагман с mini по объёму правок, времени и цене.
Claude: длинная работа и управляемое усилие
16 апреля Anthropic представила Claude Opus 4.7, а 28 мая — Opus 4.8. Компания связывает обновления с кодом, агентными задачами, многошаговой работой и большей последовательностью на длинных траекториях.
Вместе с Opus 4.8 пользователи получили управление уровнем effort, а Claude Code — dynamic workflows для крупномасштабных задач. Это отражает изменение интерфейса моделей: «какую модель выбрать» дополняется вопросом «сколько вычислительного усилия оправдано здесь».
Высокий effort полезен не всегда. Редактура короткого письма не становится в несколько раз ценнее от долгого рассуждения. Он оправдан, когда ошибка дорога, задача неоднозначна и есть способ проверить итог.
Что проверить самому: дайте одной версии три длинных задачи — разбор документа, изменение в кодовой базе и исследование с источниками. Смотрите не только на финальный текст, но и на пропущенные условия, лишние действия и способность восстановиться после ошибки инструмента.
Gemini: быстрые модели и голос
3 марта Google представила Gemini 3.1 Flash-Lite как наиболее доступную модель линейки для массовых задач. В примерах компании — перевод, модерация, интерфейсы и сценарии, где важны низкая задержка и цена.
26 марта вышла Gemini 3.1 Flash Live — модель для голосового взаимодействия в реальном времени. Здесь качество ощущается не в абстрактном IQ, а в задержке, понимании тона и способности поддерживать естественный диалог.
Весной развивалась и инфраструктура вокруг моделей: мультимодальный File Search научился искать не только по тексту, но и по изображениям, а Deep Research получил новые варианты для быстрых и более полных исследований.
Что проверить самому: для мультимедийной задачи заранее определите единицу анализа — кадр, слайд, фрагмент аудио — и сравните не красоту резюме, а долю найденных деталей и точность ссылок.
DeepSeek: переход к V4
24 апреля DeepSeek обновила API до V4-Pro и V4-Flash. Pro предназначен для более сильной работы, Flash — для быстрых и экономичных запросов; режим thinking можно включать отдельно.
Одновременно компания объявила о выводе старых универсальных имён deepseek-chat и deepseek-reasoner. Для разработчиков это напоминание: псевдоним модели не всегда означает неизменную версию. Если результат важен для продукта, нужно фиксировать model ID, дату теста и настройки.
Что проверить самому: прогоните существующие промпты на новой версии до миграции. Особое внимание — формату JSON, использованию инструментов, длине ответа и тем случаям, где прежняя модель должна была честно отказаться.
Три тренда важнее названий
1. Маленькие модели становятся основной рабочей силой
Флагманы двигают верхнюю границу, но большинство задач бизнеса — извлечь поля, классифицировать, кратко переписать, вызвать один инструмент. Для них решающими становятся цена, задержка и стабильность формата.
Хорошая архитектура не отправляет всё самой дорогой модели. Она маршрутизирует простое в быстрый режим, а сложное — во флагман или человеку.
2. Модель превращается в участника процесса
Код, браузер, поиск, файлы и внешние функции больше не выглядят дополнительной демонстрацией. Релизы всё чаще оценивают по способности выполнить последовательность действий.
Отсюда новый риск: качество текста может расти вместе с масштабом возможной ошибки. Чем больше действий доступно модели, тем важнее разрешения, журналы, лимиты и подтверждение перед необратимым шагом. Подробнее — в разборе ИИ-агентов.
3. Выбор теперь происходит внутри семейства
Раньше пользователь сравнивал GPT против Claude или Gemini. Теперь у каждого провайдера есть флагман, быстрый вариант, специализированный режим и настройка усилия.
Поэтому вопрос «какой бренд лучше» становится ещё менее полезным. Нужна связка: семейство + конкретная версия + режим + инструменты + цена.
Стоит ли сразу переключаться
Нет, если текущая модель стабильно решает задачу. Миграция оправдана, когда новое поколение устраняет измеримую проблему или снижает стоимость.
Сравни текущую и новую модель на одинаковых
реальных задачах.
Для каждого ответа оцени:
1. Фактические ошибки.
2. Пропущенные требования.
3. Количество ручных правок.
4. Время до готового результата.
5. Стоимость.
6. Стабильность формата в трёх повторах.
Не меняй одновременно модель и промпт:
иначе причина улучшения будет непонятна.
Сохраняйте не только удачные ответы, но и ошибки. Именно они показывают, нужно ли менять процесс, промпт или модель.
Главное
Весна 2026 года показала не одного окончательного победителя, а зрелую структуру рынка: сильные модели для сложной работы, быстрые — для масштаба, специализированные — для голоса, изображений и инструментов.
Лучший способ использовать обновления — перестать гоняться за каждым названием. Определите несколько типов задач, назначьте для них базовую модель и пересматривайте выбор, когда релиз обещает конкретное улучшение, которое вы можете измерить. Методика есть в статье «Как выбрать нейросеть и не переплачивать».