Claude Opus 5.5 вышел. Стоит ли вообще переходить на новые модели?
Если возможности моделей за последние месяцы выросли настолько сильно, почему люди и компании не стали в пять–десять раз эффективнее — и стоит ли вообще переходить на каждую новую модель?
Claude Opus 5.5 вышел с заявкой, что превосходит Fable, стоит дешевле и в среднем режиме работает лучше прежних моделей на максимальных тарифах, а в тот же день Codex снял поддержку 5.6 Sol в пользу GPT-6 Astra. Ведущий сверяет это с практикой: задача сестры по расписанию в Astra перестала выполняться, в Claude Design он держит Opus 4.8 Max, Astra в режиме Pro потратила часы на простой отчёт, а Claude на Fable 5.1 съел все подписочные токены за два часа. По тестам Opus 5.5 даёт 66% в терминале против 55 у Fable и 57 у Astra, а Astra выигрывает только в научных задачах — 64 против 58. Александр Волчек показывает, что найм, софт и процессы компаний почти не изменились, реальный сдвиг он видит у одного человека из двадцати–тридцати, а сверхвозможности получил ноль один процент мира, — и что главный вопрос не в адаптации к новым моделям, а в том, дадут ли они по-настоящему эффект.
На что обратить внимание
Ключевые тезисы и выводы
За последние месяцы вышли Fable, GPT-6 Astra и теперь Claude Opus 5.5 с новыми рекордами и заявлениями Anthropic, но между тем, как быстро растут модели, и тем, как меняются жизнь, работа и бизнес, ведущий видит сумасшедший разрыв. Три года бесконечных обновлений — версии ChatGPT от 4.0 до 6.0, целая линейка Anthropic — перевели дискуссию от ошибок в знаках препинания к взломам с моделями семейства Mythos и к устойчивому написанию сайтов и приложений. Вопросы выпуска: где новые модели дают другой уровень результата, какую выбирать и что менять в своей работе.
Задача сестры ведущего, полгода работавшая по расписанию, в GPT-6 Pro — то есть в Astra — перестала выполняться, хотя её делала чуть ли не позапрошлая версия. В Claude Design он до сих пор использует Opus 4.8 Max: с Fable и Opus 5 система как будто не понимала, что делать, а Astra не делает отчёты, которые делала версия 5.4. В день записи Codex сообщил, что больше не поддерживает 5.6 Sol на подписке Pro, и предложил мигрировать в GPT-6 Astra, хотя в 5.6 у ведущего была устойчивость; OpenAI выпустила линейку Terra, Luna и Sol и двигается дальше, не дав людям её протестировать.
Компании заинтересованы в собственном результате — AGI, ASI, технологической сингулярности или системах, которые дадут им серьёзные выгоды вплоть до взлома государств и экономик. Но помогают ли модели последнего полугода Anthropic или OpenAI увеличить число пользователей и заработать на них больше? Прямого результата ведущий не видит, хотя системы улучшились невероятно. Если дать всему миру возможность открывать бизнес, будет хаос массовой конкуренции; влияние ИИ на ВВП стран за прошлый год небольшое, но изменения в поведении и общении людей уже необратимы.
Сайты, отчёты и дизайн приложений стали упрощённой задачей, но люди остаются теми же. На множестве собраний с компаниями ведущий видит один случай из двадцати или тридцати, где подходы к работе изменились и есть позитивный эффект от систем вроде ChatGPT. Его жена, занятая домом и четырьмя детьми, пользуется ChatGPT на платных подписках с первого дня — но изменилась ли её жизнь по-настоящему? Зрителей он спрашивает о том же: стали ли они больше зарабатывать, появилось ли свободное время и за счёт чего — например, работа на восемь часов делается за час, а работодателю об этом не говорят.
Работодатели ждут, что за сэкономленные часы вы сделаете огромное количество другой работы. Если в компании из ста человек финансы, аналитика, маркетинг и редактура получили эффективность икс пять или икс десять с помощью ChatGPT, стало ли в ней как будто пятьсот человек — или люди просто генерируют больше документов и текста? Софт, которым пользуется ведущий, чуда не показал: Booking, Airbnb, Google Drive, Gmail и поиск Google не дают правильных подсказок и новых интерфейсов, хотя внутри строятся системы, способные проанализировать сотни миллионов людей.
У систем вроде OpenAI данных о ресторанах, кафе и гостиницах гораздо больше, чем у любого агрегатора вроде Booking: сам ведущий в поездках спрашивает ChatGPT о лучших местах в самолёте больше, чем Expedia, Booking или операторов, продавших билет. Революционные изменения, по его мнению, начнутся, когда системы станут опрашивать людей, но этого не происходит — компаниям нет разницы на людей: они меряют программирование в терминале и бизнес-процессы, а не жизнь настоящего человека. Умный дом за несколько лет не изменился, автопомощники, даже у Tesla, отвечают долго, и реального value пока мало.
Opus 5.5 обещает тратить на 30–50% меньше токенов, но людям непонятно, что такое токены, а сравнивать системы надо по конечному результату. Свой софт для датчика сердца на Mac и MATLAB ведущий заменил Codex: стартовать датчик на ночь, скачать данные, построить отчёт, отправить врачу, сравнить с трёхлетними кардиограммами. При этом GPT-6 Astra в режиме Pro потратила часы на отчёт за несколько дней, тогда как ChatGPT-5.5 или 5.0 тратили гораздо меньше при той же эффективности, а Claude на Fable 5.1 съел все подписочные токены за два часа.
У Opus 5.5 шестьдесят шесть процентов по работе в терминале против пятидесяти пяти у Fable и примерно пятидесяти семи у Astra, в программировании пятьдесят четыре против пятидесяти у Fable; единственная задача, где GPT-6 Astra значительно выигрывает, — научная, пятьдесят восемь против шестидесяти четырёх. Заголовки про сайт, 3D-мир и восемьсот презентаций с одного промта ведущего не впечатляют: ChatGPT Pro в режиме Extra High делал это полгода назад. Главный вопрос: если Fable способна взламывать всё подряд, что такое Opus 5.5, которая её опережает, — или Fable ухудшили, как в июле.
У ChatGPT токены чата не считаются вместе с токенами Codex и Work, а Грег Брокман, взявшийся в конце весны или в июне за объединение всего в одно приложение, пока не убрал разъединённость чата и Codex; у Anthropic люди так же выбирают между Cowork, Code и просто Claude, не понимая, почему система уходит в тот или иной режим. У Opus 5.5 режимы от low до max с intelligence index 58 у max и 56 у extra high — собственная шкала Anthropic, не процент правильных ответов и не IQ. Opus 5.5 Low стоит в десять раз меньше Max при индексе 42 против 58.
За последние полгода Anthropic с OpenAI получили разительный отрыв: Grok, Moonshot Kimi и DeepSeek были видны в прошлом, а сейчас рядом никого нет. Google останется в гонке благодаря поиску и сервисам, но без них, по мнению ведущего, Google Gemini имел бы огромные проблемы. Новый iPhone и Siri никому не интересны: у ведущего восемнадцатый iPhone с вдвое большей мощностью для ИИ, но ему нет разницы, как там работает искусственный интеллект. Ни одна система пока не работает в разных местах одновременно, а Claude Code не принимает файлы больше двадцати мегабайт и не работает с файловой системой.
Anthropic выпустила Fable и заблокировала её после постановления правительства США: модель нельзя использовать негражданам, включая сотрудников самой Anthropic, — и непонятно, какую модель используют теперь. Если у Anthropic или OpenAI ограничений нет и мощности бесконечны, почему они не забирают целые индустрии одним-двумя процентами мощностей? Пример есть: ChatGPT Sites создаёт и хостит сайты — по словам Брокмана, больше десяти миллионов — и забирает рынок CMS; через год, считает ведущий, новые сайты будут писаться вне CMS-систем, а маркетинг и продажи перестанут заказывать разработку.
Для грамотных людей появилась возможность резко заработать много денег и получить связи, но досталась она ноль одному проценту мира — тем, у кого хватит головы принять правильное решение. Восемь из десяти, по наблюдению ведущего, сопротивляются, и ИИ для них остаётся очень относительным: возвращаясь из Европы в Штаты, он видел, как люди десять часов полёта работают в неудобных Excel с бухгалтерскими данными, перепроверяют всё вручную и не открывают ни ChatGPT, ни Anthropic. Вопрос выпуска не в том, смогут ли эти люди адаптироваться, а в том, даст ли это им по-настоящему эффект.
О чём этот выпуск
Соло-выпуск ToTheMoon о выходе Claude Opus 5.5 — и о том, что вообще значит выход очередной модели. Александр Волчек начинает с рекордов и заявлений Anthropic, напоминает, что за последние месяцы вышли Fable и GPT-6 Astra, и фиксирует сумасшедший разрыв между тем, как быстро растут модели, и тем, как меняется жизнь, работа и бизнес. Но параллельно модели как будто деградируют: задача сестры ведущего в GPT-6 Pro перестала выполняться, в Claude Design он до сих пор использует Opus 4.8 Max, а Astra не делает отчёты, которые делала версия 5.4.
Сам Opus 5.5 ведущий не хочет разбирать как очередной релиз — его интересует, как модели выпускаются в целом. В день записи Codex сообщил, что больше не поддерживает 5.6 Sol на подписке Pro, и предложил мигрировать в GPT-6 Astra, хотя в 5.6 у него была устойчивость; OpenAI выпустила линейку Terra, Luna и Sol и движется дальше, не дав людям её протестировать. Причина, по его мнению, в том, что OpenAI и Anthropic заинтересованы в собственном результате — AGI, ASI, сингулярности, — и большой вопрос, помогают ли модели последнего полугода их бизнесу: прямого результата не видно, хотя системы улучшились невероятно. Если всему миру дать возможность открывать бизнес, будет хаос массовой конкуренции; влияние ИИ на ВВП за прошлый год ведущий называет небольшим, хотя изменения в поведении людей уже необратимы.
Дальше — про людей, которые остаются теми же. Сайты, отчёты и дизайн стали упрощённой задачей, но на множестве встреч с компаниями ведущий видит один случай из двадцати–тридцати, где подходы к работе действительно изменились. Его жена с четырьмя детьми пользуется ChatGPT на платных подписках с первого дня — изменилась ли её жизнь по-настоящему? Тот же вопрос он задаёт зрителям: стали ли вы больше зарабатывать, появилось ли свободное время, или вы делаете восьмичасовую работу за час и не говорите работодателю. Работодатели же ждут, что за сэкономленные часы вы сделаете огромное количество другой работы, и если эффективность в компании из ста человек выросла в пять раз, стало ли в ней как будто пятьсот человек — или просто больше документов и текста.
Софт чуда не показал: Booking, Airbnb, Google Drive, Gmail и поиск Google не дают правильных подсказок и новых интерфейсов, хотя внутри строятся системы, способные проанализировать государство и сотни миллионов людей. Ведущий повторяет, что агрегаторы исчезнут: у OpenAI информации о ресторанах и гостиницах больше, чем у любого агрегатора, и сам он спрашивает ChatGPT о местах в самолёте больше, чем Expedia или Booking. Революция начнётся, когда системы начнут опрашивать людей, — но этого не происходит, потому что компаниям нет разницы на людей: метрики меряют программирование, а не жизнь настоящего человека, умный дом и автопомощники, даже у Tesla, работают криво, и реального value пока мало.
Позиционирование Astra — система, которая меньше коммуницирует с человеком, — ведущий считает новым, но напоминает, что предыдущая тоже вопросов не задавала; второе его предположение — компании боятся сверхдоступа, который даст возможность опрашивать миллиард, сто или десять миллионов вовлечённых пользователей. Отсюда — токены: Opus 5.5 обещает тратить их на 30–50% меньше, но людям непонятно, что такое токены, а сравнивать надо конечный результат. Его кейс — датчик сердца, для которого он когда-то писал софт для Mac вместо MATLAB, а теперь всё делает через Codex: стартовать датчик на ночь, скачать данные, построить отчёт, отправить врачу, сравнить с трёхлетними кардиограммами. При этом GPT-6 Astra в режиме Pro потратила часы на отчёт за несколько дней, тогда как ChatGPT-5.5 или 5.0 тратили меньше при той же эффективности, а Claude на Fable 5.1 съел подписочные токены за два часа.
Тесты Opus 5.5 ведущий приводит с оговоркой: 66% в терминале против 55 у Fable и 57 у Astra, 54% в программировании против 50 у Fable, а Astra выигрывает лишь в научных задачах — 58 против 64. Заголовки про сайт, 3D-мир и восемьсот презентаций с одного промта его не впечатляют: ChatGPT Pro в режиме Extra High делал это полгода назад. Главный его вопрос: если Fable способна взламывать всё подряд, что тогда такое Opus 5.5, которая её опережает, — или Fable ухудшили, как в июле. Опрос на канале показал, что больше тридцати процентов зрителей даже не использовали новую Astra.
Отдельный узел — режимы и продукты. У ChatGPT токены чата не считаются вместе с токенами Codex и Work; Грег Брокман с конца весны или июня занимается объединением в одно приложение, но чат и Codex по-прежнему разъединены, а у Anthropic люди выбирают между Cowork, Code и просто Claude. У Opus 5.5 есть режимы от low до max с intelligence index 58 у max и 56 у extra high — собственной, по словам ведущего, шкалой Anthropic, — а Low стоит в десять раз меньше Max при индексе 42 против 58. Конкурентов не видно: Anthropic и OpenAI ушли в отрыв, Grok, Moonshot Kimi и DeepSeek остались в прошлом, Google держится за счёт поиска, а Siri в новом iPhone 18 никому не интересна.
В финале — ограничения и преимущество. Системы стали скользкими в вопросах о взломе, хотя могли бы по контексту понять, что делает человек, и предупредить о рисковой зоне; Anthropic после постановления правительства США заблокировала Fable для неграждан, включая собственных сотрудников, и непонятно, какую модель под этим именем используют теперь. Если же у компаний ограничений нет, почему они не забирают целые рынки одним-двумя процентами мощностей, — пример есть: ChatGPT Sites хостит, по словам Брокмана, больше десяти миллионов сайтов и забирает рынок CMS. Сверхвозможности получил ноль один процент мира, восемь из десяти сопротивляются, и люди в самолёте десять часов сидят в неудобных Excel, не открывая ChatGPT. Вопрос выпуска не в том, адаптируются ли они, а в том, даст ли это им по-настоящему эффект.
Выпуск ценен тем, что не повторяет пресс-релиз: рекорды Opus 5.5 ведущий сверяет с собственными задачами, где новые модели ведут себя хуже старых, а токены и режимы запутывают сильнее, чем помогают. Главный сдвиг, который он фиксирует, — гонка моделей идёт сама по себе, а найм, софт и процессы компаний почти не меняются, и преимущество получает ноль один процент людей, у которых хватило головы принять правильное решение. Вопрос «стоит ли переходить» он переворачивает: важнее, даст ли это по-настоящему эффект.
Расшифровка выпуска
Голосовая связка применена к 72 сегментам: 72 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Читать транскрипт на отдельной странице
Загрузка…