OpenAI поставила новую модель на паузу. Что происходит с гонкой ИИ?
Что сегодня важнее — иметь самую новую модель или уметь выжать максимум из уже существующей, если новые версии в реальных задачах не всегда оказываются лучше старых?
Читатель получит рабочую картину рынка на август 2026-го: два способа сделать ИИ сильнее (улучшать базовую модель или обвязку вокруг неё), почему всякая надстройка вроде скиллов через полгода оказывается внутри продукта, и какие связки моделей действительно работают у людей, которые делают этим ежедневную работу.
На что обратить внимание
Ключевые тезисы и выводы
Привычка была простая: вышла новая версия — значит, она сильнее предыдущей. В реальных задачах последних месяцев всё чаще наоборот: старые версии оказываются стабильнее и иногда справляются лучше. Исключение, которое участники называют сразу, — Fable.
Внутренние тесты всегда дают неуправляемые ситуации, и обычно компании о них не рассказывают. Здесь же заявление выходит накануне очень дорогого IPO Anthropic, которая показывает рекордную выручку. Отсюда встречное чтение: не закидка ли это про сверхъестественную модель, которой у OpenAI якобы есть.
Из-за отношений крупных компаний с правительством США слишком свободную и слишком сильную модель просто не выпустят — залочат. «Наша модель уже настолько хороша, что дальше улучшать не надо» может быть не хвастовством, а описанием потолка, через который иначе не пройти.
После инцидентов OpenAI начала отслеживать не только вызовы инструментов, но и сам reasoning trace — как модель думает по дороге к действию. Это огромный дополнительный объём данных: по оценкам, до двадцати-двадцати пяти процентов обучающих мощностей. Если триггер сработал и за тридцать минут автоматически не решается, процесс останавливается до ручного разбора.
Ожидали следующую номерную версию к концу августа, и Astra была бы готова, если бы не эти проблемы. Плюс после историй со взломами пройти проверки в правительстве США будет непросто. У Anthropic по срокам ощущалось то же самое, но дополнительных новостей пока нет.
Тот момент, когда система впервые делала правильный разбор архитектуры, большие анализы и серьёзные блоки кода. Потом Fable принёс не длительность и не выдержку пути, а другое качество результата: как будто задачу вместо пятнадцатилетнего взял взрослый человек.
После Opus 5 и семейства Luna, Sol, Terra что-то пошло не так: бесконечные глюки, и по практике ведущего 4.8 решает задачи лучше, чем Opus 5. Он до сих пор возвращается к 4.8 там, где нет Fable. У 5.6 Sol Pro при этом полгода сбивается ползунок выбора режима — мелочь, которая повторяется.
Вопрос к стратегии OpenAI прямой: что они хотят создавать. Партнёрка, где бесплатно открыт сервис разработки софта на Terra, выглядит странно, если у ChatGPT уже есть бесплатная Terra по умолчанию и Codex доступен любому за двадцать долларов.
Сделка Cursor закрыта — при этом владеет xAI SpaceX, а продукт называется Grok. Cursor — очень серьёзная система, и в связке с Grok это полноценная конкуренция Codex и Claude. Google при этом не отступает: 3.7 Flash выпущена как раз под агентные задачи программирования.
У Anthropic цель конкретная — безопасность AGI, а программирование решается по дороге; видно это по исследованиям, эссе и конституции. OpenAI делает очень универсальный продукт, применимый везде. Это одновременно благословение и проклятие: универсальность не даёт двигаться в одну сторону.
Всё время существования подкаста рядом с базовым уровнем существовали надстройки. Сначала нужно было хорошо писать промпт — были целые гайдлайны. Потом появились подключения по API, потом MCP и разбиение задачи на суб-агентов. Базовая модель при этом менялась не так сильно, а ситуация менялась кардинально.
Сегодняшняя фишка — скиллы, вроде того, что помогает разобрать тему вопросами и построить карту проекта. С ними можно быть на месяц впереди остальных, но все эти вещи будут интегрированы внутрь Claude и ChatGPT и станут доступны всем из коробки. Так было с каждой предыдущей надстройкой.
Никто не требует срочно разрабатывать сверхмодели. Можно параллельно улучшать текущую работу — не двигать кнопочку, а чинить то, что полгода не меняется: линейную структуру управления проектами, неудобные названия, глюки, из-за которых непонятно, был сбой или нет. Именно эти мелочи решают, привяжется человек к системе или уйдёт.
5.6 Sol и её Ultra-режим — очень дорогие модели. Если ты платишь за запрос всерьёз, ты подождёшь. Вопрос к режиму Ultra Fast прямой: для кого он, если тот, кто пользуется Sol Ultra или Extra High, никуда не торопится. Тот же вопрос был к ChatGPT Pro за сто долларов.
Татьяна не начала пользоваться Codex: то, что он предлагал, было базовыми шагами, до которых она дошла сама. Он составил их за пять-десять минут против её нескольких месяцев, но развить дальше не получилось — и на системе поставлен крестик, хотя с тех пор она изменилась.
Человек с платной подпиской за двадцать долларов не знает, что можно ещё, — та же история, что с непереставленным ползунком. И отдельно: подписка «вместе с папой» была нормальной два года назад, а сейчас двадцать долларов в месяц кажутся дорогими тому, кто легко берёт кофе за десять. Это не жадность, а неведение — и это мировая реальность.
Ильнар собирает в ChatGPT весь контекст — по проекту, по экспериментам, иногда за несколько месяцев работы, — вместе с ним разбивает на смысловые блоки, а затем несёт это в Claude Design вместе с референсами. Две-три итерации дают результат, который руками он бы не собрал. Claude Design не соберёт контекст сам, но с оформлением справляется.
Новая система ToTheMoon: карточки всех выпусков, разметка сущностей, покрытие в тридцать две тысячи пересечений тегов, восемьсот девяносто две сущности, сто пятьдесят три выпуска — и поиск, который показывает, где, когда и в каком контексте что упоминалось, вплоть до минуты. Дизайн сделал Claude Design, вёрстку и разработку — Fable, и архитектуру поиска Claude Design написал с первой попытки.
О чём этот выпуск
Сэм Альтман сообщил, что OpenAI останавливает обучение следующей frontier-модели Astra — следующего поколения после линейки 5.6 Sol — из-за вопросов к её поведению и безопасности. Первая реакция ведущего простая: зачем об этом писать вообще? Внутренние тесты всегда дают неуправляемые ситуации, и обычно о них не рассказывают. Тем более что происходит это накануне очень дорогого IPO Anthropic, которая показывает рекордную выручку и говорит о сотнях миллиардов в год.
Ильнар Шафигуллин предлагает читать новость в двух аспектах. Первый — регуляторный: из-за отношений крупных компаний с правительством США слишком свободную и слишком сильную модель просто не выпустят, и «дальше улучшать не надо» может быть честным описанием потолка. Второй — технический: после инцидентов OpenAI начала отслеживать не только вызовы инструментов, но и сами рассуждения модели, reasoning trace. Это огромный дополнительный объём данных — по оценкам, до двадцати-двадцати пяти процентов обучающих мощностей уходит теперь на анализ этих следов. И если триггер сработал, а за тридцать минут автоматически проблему решить не удалось, весь процесс останавливается до ручного разбора. Двухнедельная пауза может быть именно этим.
Следствие — GPT-6 сдвигается. Ожидали конца августа; Astra была бы готова, если бы не эти проблемы. Плюс после историй со взломами пройти проверки в правительстве США будет непросто.
Отдельная линия — деградация, которую участники наблюдают на практике. Пик был на ChatGPT 5.5 Extra High и Opus 4.8 Max, потом Fable принёс фундаментально другое качество результата. А дальше появились Opus 5 и семейство Luna, Sol, Terra — и, по ощущению ведущего, 4.8 решает задачи лучше, чем Opus 5. В 5.6 Sol Pro при этом до сих пор сбивается ползунок выбора режима — мелочь, которая повторяется полгода.
Отсюда вопрос о стратегии: AGI, кодинг или чаты для бизнеса? Anthropic движется к конкретной цели — безопасность AGI, попутно программирование, — а OpenAI пытается двигаться во все стороны с универсальным продуктом, и это одновременно благословение и проклятие.
Рынок программирования при этом перестраивается: xAI закрыл сделку с Cursor и явно выходит на него всерьёз, Google не отступает и выпустил 3.7 Flash под агентные задачи.
Главная мысль Ильнара — про два пути. Можно улучшать базовую модель, а можно выжимать больше из текущей. Всё время существования подкаста рядом с базовым уровнем существовали надстройки: сначала гайдлайны по промптам, потом подключение сервисов по API, потом MCP и суб-агенты, теперь скиллы. Каждая давала продвинутому пользователю фору примерно на месяц и затем оказывалась встроенной в продукт для всех.
Вторая половина выпуска — практика. Татьяна объясняет, почему не начала пользоваться Codex: старое впечатление от ранней версии и ощущение, что система осталась прежней. Обсуждают, что огромная часть даже платных пользователей ChatGPT не знает, что ещё можно делать, — та же история, что с непереставленным ползунком. Ильнар описывает свою рабочую схему: контекст собирается в ChatGPT, оформление делается в Claude Design, и две-три итерации дают результат, который руками он бы не собрал.
Завершается выпуск показом новой системы ToTheMoon: карточки всех выпусков, разметка сущностей, покрытие в тридцать две тысячи пересечений тегов, восемьсот девяносто две сущности, сто пятьдесят три выпуска и поиск, который делает всё это за миллисекунды. Дизайн сделал Claude Design, вёрстку и разработку — Fable, и архитектуру поиска Claude Design написал с первой попытки.
Пауза Astra читается в обе стороны и обеими сторонами пользуются: «мы не справляемся с тем, что сделали» и «мы сделали настолько сильное, что остановились сами». Важнее другое — рынок никого не торопит. Улучшать можно не базовую модель, а обвязку вокруг неё, и это уже происходит: промпт-гайды, MCP, суб-агенты, оркестрация, скиллы — каждая надстройка сначала даёт продвинутому пользователю месяц форы, а потом оказывается внутри продукта у всех. Выигрывает не тот, у кого новее модель, а тот, кто понимает, из чего собрана его задача.
Расшифровка выпуска
Голосовая связка применена к 110 сегментам: 110 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Загрузка…