Fable 5.1 вышел. Claude открыл память. OpenAI готовит Astra – что меняется в новой гонке ИИ?
Что из обновлений этой недели действительно меняет работу с искусственным интеллектом — открытая память, новая архитектура или собственные чипы, — и кто в результате получает преимущество в гонке: Anthropic или OpenAI?
Читатель поймёт, почему Fable 5.1 важнее для крупных компаний, чем для пользователя чата: хранение данных переезжает внутрь корпоративного контура, а обращение к кэшу дешевеет на 75%. Увидит, что именно Claude показал в разделе «Темы» и чего памяти всё ещё не хватает. Разберётся, что такое рекуррентные трансформеры и почему за качество Astra рынок платит потерей прозрачности рассуждений. И получит рамку, по которой платформы забирают функции сторонних сервисов внутрь — от Amazon и YouTube до OpenAI.
На что обратить внимание
Ключевые тезисы и выводы
Anthropic описывает обновление через архитектуру больших систем в нескольких репозиториях, крупные миграции, объёмные обновления кода и проверку производительности. По сути это то же, что Mythos 5.1. Пользователь обычного чата разницы, скорее всего, не заметит.
Запросы к моделям этого класса хранились тридцать дней и анализировались на попытки взлома. Для крупной компании данные за пределами её контура — это ответственность перед клиентами и риск утечки, и именно это мешало Anthropic там, куда компания целится.
Вместе с 5.1 хранение данных и классификаторы, решающие блокировать запрос или нет, можно развернуть на мощностях самой компании. Блокер снимается, и это движение прямо в enterprise.
Повторные вычисления модель берёт из кэша, и обращение к нему становится дешевле примерно на 75%. В стоимости решения задачи целиком это даёт около 25%. Для дорогих моделей Anthropic это ещё один шаг к охвату рынка.
В интерфейсе появился раздел «Темы»: видно каждую сохранённую запись, её можно отредактировать или удалить. Это относится к Claude и Claude Cowork, но не к Claude Code.
В длинной поездке модель держит контекст без напоминаний, и объяснять детали каждый раз больше не приходится. Открытыми остаются вопросы, где этот контекст применится потом и как модель поймёт, о каком месте её спрашивают.
Скилл Grill me разбирает идею со всех сторон и задаёт наводящие вопросы; десятки сообщений сводятся в документ, где описано, что делается и почему. С этим документом можно перейти в другую систему и продолжить там.
Управлять памятью бесконечно человек не может — значит, это должна делать система: дообучаться по проекту и задавать уточняющие вопросы. Пока модели решают другие задачи, а память остаётся на пользователе.
Дорогая модель в режиме Extra High выдала три версии происходящего в Мадриде, а простой ассистент предположил демонстрацию. Вечером выяснилось, что в городе прошли два митинга. Дорогая система искала и анализировала, но нужный кусок информации потеряла.
Обычная модель генерирует рассуждение токен за токеном. В новой архитектуре несколько итераций размышления проходят внутри модели до появления первого токена, а наружу выходит гораздо более разреженная цепочка.
Контроль безопасности сегодня держится на анализе цепочки размышлений: по ней восстанавливают, как произошёл инцидент. В скрытом виде это делать намного сложнее. OpenAI обещает ограничивать глубину внутреннего размышления, но за другими компаниями этого никто не гарантирует.
Процессоры, высокоскоростная память, сеть между процессорами, платы, серверные стойки, программное обеспечение — и около девяти месяцев на разработку, в которой активно участвовал сам искусственный интеллект.
Обычное оборудование набирает суммарную производительность, объединяя пользователей в группы, и каждый начинает ждать дольше. Здесь пытаются одновременно обслуживать много запросов и быстро отвечать каждому.
Открытая память Anthropic через чужой интерфейс работать не будет, а своей модели уровня Fable 5.1 или Astra у Perplexity нет. Тот же аргумент объясняет, почему разрыв контракта Cursor стратегически логичен.
Amazon пустил селлеров, посмотрел, что продаётся, и выпустил свои батарейки, бумагу и вилки — они оказались в топе, а десятки тысяч продавцов были вытеснены. Тот же механизм работает для генерации объявлений, обложек и нарезки коротких видео.
Вышли M6 и M5 Ultra, Mac Studio и Mac Mini, к MacBook на его территории никто не приблизился. Но моделей уровня ChatGPT у Apple нет — а будь их создание действительно лёгким, у Apple Intelligence они бы уже были.
О чём этот выпуск
Воскресный подкаст ToTheMoon с Александром Волчеком, Ильнаром Шафигуллиным и Татьяной Цветковой. Повод — три новости, которые пришлись на одну неделю.
Первый блок — Fable 5.1. Anthropic описывает обновление как существенное: лучше держится архитектура больших систем в нескольких репозиториях, крупные миграции, объёмные обновления кода. По сути это то же, что Mythos 5.1, и в обычном чате разницы, скорее всего, не заметно — ведущие за пару дней тестов её не увидели. Настоящее изменение в другом: раньше запросы хранились тридцать дней и анализировались, а это блокировало внедрение в крупных компаниях, ради которых Anthropic и работает. Теперь хранение и классификаторы можно развернуть внутри контура заказчика. Плюс обращение к кэшу дешевеет примерно на 75%, а задача целиком — процентов на 25.
Второй блок — память. Claude открыл раздел «Темы», где видно каждую сохранённую о вас запись, её можно отредактировать и удалить; это касается Claude и Claude Cowork, но не Claude Code. Ведущий признаёт, что сильнее всего память выросла у ChatGPT: в длинной поездке модель держит контекст без напоминаний. Дальше — про то, чего не хватает: система должна управлять памятью сама и хоть когда-нибудь начать спрашивать, а нелинейное хранение и обрезка длинных чатов пока не решены. Ильнар описывает рабочий обходной путь — скиллы вроде Grill me и документ ADR, с которым можно перейти в любую другую систему. Отдельная история — Мадрид, где дорогая модель в режиме Extra High выдала три версии происходящего, а Алиса ответила «наверное, демонстрация» и оказалась права.
Третий блок — архитектура и железо. Слухи об Astra говорят о рекуррентных трансформерах: несколько итераций размышления проходят внутри модели до появления токена, наружу выходит разреженная цепочка, и пошагово следить за рассуждениями уже не получится. Отсюда и противники: разбор инцидентов вроде взлома Hugging Face держится именно на восстановлении рассуждений. Плата — качество растёт без гиперувеличения размеров. Параллельно OpenAI показала чип Халапеньо, который на деле целая платформа: процессоры, память, сеть, стойки, софт; за девять месяцев она обходит перспективные решения NVIDIA на тестах самой OpenAI. Замыкает выпуск разговор о том, как платформы забирают функции сторонних сервисов — на примерах Amazon, YouTube, Meta, Cursor и Perplexity — и кто сегодня строит инфраструктуру: NVIDIA, Tesla с SpaceX, Google с TPU и Apple, у которой сильное железо и нет своих моделей.
Выпуск хорошо показывает, что «обновление модели» и «сдвиг рынка» — разные вещи, и на этой неделе они разошлись особенно заметно. Fable 5.1 в чате почти не виден, но снимает главный корпоративный блокер; открытая память Claude — скорее заявка на интерфейс, чем решение задачи; настоящий сдвиг прячется в архитектуре и в железе, где его труднее всего проверить со стороны. И тот же выпуск честно называет цену прогресса: рекуррентные трансформеры дают качество за счёт прозрачности рассуждений, а платформы, забирая функции внутрь, забирают их у тех, кто эти функции придумал.
Расшифровка выпуска
Голосовая связка применена к 109 сегментам: 109 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Загрузка…