OpenAI показала Astra и начался скандал. Это прорыв или чужие идеи?
Действительно ли Astra решила задачу на миллион сама — и что важнее для обычного человека: доказательство, которое ещё не признано, или то, как ИИ уже меняет решения о покупках и почему по-прежнему не задаёт вопросов?
OpenAI сообщила, что GPT-6 Astra за 88 часов работы десяти тысяч агентов и 130 миллиардов токенов доказала существование и гладкость решения уравнения Навье — Стокса; математики, обсуждавшие промежуточный результат в ChatGPT и Claude, заподозрили использование их идей, а OpenAI ответила, что диалоги после 3 июля в обучение не шли, и не претендует на первенство в промежуточной части. На момент записи доказательство не признано. Спустя десять дней GPT-6 как чат не показала Александру разницы и ухудшила его личную задачу, а Ильнар полностью перешёл на неё с 5.6: бенчмарки разорваны, хуже не стало. Shopify показала трёхкратный рост посещений и заказов через ИИ при росте поиска на 30% за два года и на 15% больший средний чек. Ведущие показывают, что ИИ уже заменяет агрегаторы ресторанов и отелей, но не спрашивает пользователя о результате, и описывают следующий этап — проактивную систему за тысячу-две долларов в месяц. iPhone 18 они считают обновлением без причины, а складной Duo — выходом Apple на чужой рынок.
На что обратить внимание
Ключевые тезисы и выводы
Система с десятью тысячами агентов за 88 часов, по словам OpenAI, доказала существование и гладкость решения уравнения Навье — Стокса. Математики, работавшие над той же задачей, спросили, не использовала ли модель их идеи.
С 2000 года решена только одна — Перельманом, отказавшимся от премии. Уравнению Навье — Стокса больше девяноста лет, его пытались решить многие, и Институт Клэя пока никому не платил.
Математики обсуждали промежуточный результат в ChatGPT и Claude в середине августа. OpenAI говорит, что промпты не могли повлиять на модель, и не претендует на первенство в промежуточной части; на момент записи доказательство не признано.
Александр: математик не вложил бы таких денег, а система поглотила тексты, которые не прочитал бы ни один человек. Ильнар: без чужого направления токенов понадобилось бы в десять раз больше, а решение могло не найтись.
Результат в науке — маленький «пупырышек» на теле известного. Нейросети переносят идеи из одной области в другую, что человеку-эксперту в узкой области даётся труднее; заявлений авторитетных математиков о проверке пока нет.
Сверхэффекта уровня GPT-5.5 нет; задача, которую не удаётся решить месяц, после Astra стала хуже и стоила ресурсов сторонних систем. Ведущий продолжает с Fable 5.1, которая тоже пока не справилась.
На ARC-AGI около 99%, дальше проверять бессмысленно. Часть задач GPT-6 сразу не делает, и под неё приходится подстраиваться, но по другим стало лучше; десять тысяч агентов — на совести OpenAI, в Codex такого не снилось.
Пришедшие через ИИ покупают лучше: выше конверсия и на 15% средний чек. Александр: рост в разах не с чем сравнить без абсолютных цифр, но вовлечённость через ИИ действительно выше — выбор сводится к двум вариантам.
Ильнар доверяет рекомендации ChatGPT как эксперту, Александр — ИИ больше, чем поиску, с оговоркой о версиях; его друг ИИ в аналитике и продажах не доверяет. Часть задач ИИ делает плохо, часть — лучше человека, часть — не хуже.
Рейтинг Booking по-прежнему работает, но у полутора тысяч отзывов нет «звёздочки» на матрас, а хорошая локация в большом городе относительна. Ильнар: чатам всё равно нужен источник актуальных отзывов.
За две недели и сто пятьдесят ресторанов ChatGPT ни разу не спросил, куда ведущий пошёл. Оценщиков ответов покупают за несколько долларов, а живого пользователя «купить» дорого, хотя он готов ответить сам.
Ильнар: проактивный ассистент на сервере за тысячу-две долларов в месяц. Александр готов платить две тысячи, но для OpenAI это стоит почти две тысячи в день, и есть риск дообучения без контроля.
Новый ИИ-блок вдвое больше, но непонятно, что он ускоряет. Складной Duo за две тысячи долларов Александру неинтересен, Ильнар хочет проверить складку на экране, но покупать вряд ли будет; предзаказ — в конце октября.
О чём этот выпуск
Воскресный выпуск ToTheMoon с Александром Волчеком и Ильнаром Шафигуллиным. Главная новость — заявление OpenAI о том, что GPT-6 Astra решила уравнение Навье — Стокса, одну из «задач тысячелетия» Института Клэя с призом в миллион долларов. Александр попал в новость через резкий твит в адрес Сэма Альтмана и сразу задаёт вопросы: что за десять тысяч агентов, кто ими управлял и не маркетинг ли это. Ильнар видит знакомую закономерность: после каждой сильной модели OpenAI сообщает, что на обучении есть нечто ещё мощнее.
Ильнар объясняет контекст: в 2000 году Институт Клэя выбрал семь задач и назначил миллион за каждую; решена только одна — Перельманом. Уравнению Навье — Стокса больше девяноста лет. По версии OpenAI, интерес возник в конце августа, когда математик и сотрудник Anthropic получили промежуточный результат; после 88 часов работы десяти тысяч агентов компания объявила, что доказала существование и гладкость решения.
Скандал: математики обсуждали идеи в ChatGPT и Claude и заподозрили, что их использовали в обучении. OpenAI отвечает, что диалоги после 3 июля не использовались, обсуждения шли в середине августа, а первенства в промежуточной части компания не требует. На момент записи доказательство не признано. Александр считает нужной вставку про цену: 130 миллиардов токенов, 2,7 миллиона сообщений — больше миллиона долларов по внешним ценам; Ильнар напоминает, что учёный стоит на плечах гигантов, а нейросети особенно сильны на стыке областей.
Впечатления от GPT-6 спустя десять дней расходятся. Александр не увидел сверхэффекта уровня GPT-5.5: модель не решила его личную задачу, ухудшила её и потратила ресурсы сторонних систем, поэтому он продолжил с Fable 5.1. Ильнар полностью перешёл с 5.6 на 6: бенчмарки разорваны, ARC-AGI закрыт на 99%, часть задач требует подстройки, но хуже не стало. Десять тысяч одновременных агентов оба предлагают оставить на совести OpenAI — в исследовании Anthropic восемьдесят агентов мешали друг другу.
Между делом — голос: собеседник Александра в поездке не понял, что тот говорит с ChatGPT в CarPlay, и захотел оплатить такую версию. ChatGPT Voice за два месяца улучшился, но ведущие им не пользуются: Александр надиктовывает задания, Ильнар за компьютером набирает руками.
Shopify показала, что посещения и заказы через ИИ выросли втрое за год, поиск — на 30% за два года, а пришедшие через ИИ покупают с большей конверсией и на 15% большим чеком. Александр разбирает, чего в статистике нет — абсолютных цифр, — и соглашается с главным: вовлечённость через ИИ выше, выбор сводится к двум вариантам. Ильнар добавляет доверие к модели как к эксперту; в обществе идёт раскол между теми, кто доверяет ИИ, и теми, кто нет.
Решение о покупке уже переехало в чат: рестораны в поездках Александр выбирает через ChatGPT, агрегаторов для него больше нет, а Booking с его рейтингом проигрывает модели, которая перечитает Expedia, Booking и TripAdvisor вместе. Но модель не задаёт вопросов: за сто пятьдесят ресторанов она ни разу не спросила о результате, хотя живой пользователь — самый дорогой источник обучения. Следующий этап, по Ильнару, — проактивная система на сервере за тысячу-две долларов в месяц; Александр готов платить, но для OpenAI это стоит почти две тысячи в день, и есть риск дообучения без контроля.
В финале — iPhone 18 и складной Duo. Александр попросил ChatGPT сравнить только важное: процессор разницы не даёт, фокусное расстояние — плюс для тех, кто умеет им пользоваться, а удвоенный ИИ-блок непонятно что ускоряет. Duo ему неинтересен — Apple, по его мнению, пошла на чужой рынок; Ильнар вспоминает Vision Pro, хочет проверить складку на экране, но покупать вряд ли будет. Предзаказ — в конце октября.
Выпуск полезен тем, что разводит две вещи, которые в новостях сливаются: математический результат, который ещё должны проверить, и маркетинг вокруг него. Ведущие не отрицают ни силы модели, ни возможной работы на чужих идеях — они показывают, как устроен и тот и другой сценарий, и предлагают дождаться признания доказательства. Второй вывод практичнее: решение о покупке уже переезжает в чат, и следить надо не за выдачей поисковика, а за тем, что о вас говорят ChatGPT и Claude, — при этом сами модели пока не спрашивают человека, и это главный нерешённый вопрос интерфейса.
Расшифровка выпуска
Голосовая связка применена к 146 сегментам: 146 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Загрузка…