Grok 4 против OpenAI: тест и обзор новинок 2025 года
Почему скорость и амбиции Grok 4 ещё не делают его надёжным рабочим инструментом?
Проверять Grok 4 на повторяемой рабочей задаче: учитывать не только скорость и бенчмарки, но и интерфейс, доступ, цену, ограничения и контроль ошибок.
На что обратить внимание
Ключевые тезисы и выводы
Практический смысл темы «Grok 4 впечатляет скоростью и амбициями, но рабочий инструмент определяется не бенчмарком» в том, что Grok 4 Heavy, o3 Pro, Claude Code и новые функции ChatGPT сильны в разных местах: модель можно хвалить за поиск, скорость или рассуждение и всё равно не выбрать для ежедневной работы — интерфейс, цену, подписку и доступ к инструментам решают не меньше, чем результат теста.
Рабочий вывод из сцены «ИИ: США vs Россия: выпуск 23 июля» состоит в том, что это анонс отдельного выпуска по средам — сравнение США и России в ИИ; авторы обещают не развеивать мифы, а помочь зрителю понять, куда смотреть и что применять самому.
Оценивать тему «Grok 4 первые впечатления» нужно с учётом того, что уже на конкретных кейсах становится видно: победа в тесте и удобство в работе — две разные вещи.
Сцена «Grok 4 Heavy кейс использования: сравнение с OpenAI» подводит к рабочему выводу: Grok 4 Heavy можно ставить рядом с дорогими режимами OpenAI, но важен не только финальный ответ — сколько модель работала, какие источники брала, можно ли продолжить задачу и подключить файлы; если данные приходится таскать между терминалом, браузером и отдельным приложением, техническое преимущество съедает трение.
Сцена «ChatGPT O3 Pro: улучшения скорости и производительности» подводит к рабочему выводу: o3 Pro получает прирост скорости, и это меняет не место в рейтинге, а удобство ежедневной работы — важно не «кто быстрее в тесте», а что именно ускорилось в реальном сценарии и кто на этом выигрывает.
Практический смысл темы «Браузер от OpenAI» в том, что OpenAI планирует свой браузер, но браузер нового поколения — не то, что представляют сейчас: ChatGPT уже забрал у ведущего почти весь поиск в Google и почти все посещения сайтов, поэтому «браузер» станет чем-то другим — возможно, поэтому его и не выкатывают.
Для решения, обсуждаемого в сцене «Новая функция от ChatGPT», важен критерий: появилась удобная кнопка «спросить ChatGPT» по выделенному фрагменту ответа, но сделана коряво и почти не видна; реальная задача — не браузер, а решение проблемы линейности: распараллелить задачи в общее дерево, а не прятать их в проектные папки, которыми мало кто пользуется.
Для сцены «Claude Code от Anthropic: лучший для программистов?» решающим становится следующее: ценность Anthropic часто не в одном красивом ответе, а в том, что модель живёт рядом с кодом, видит проект и последовательно меняет файлы — для разработчика это может быть важнее места в общем рейтинге.
Граница применимости в сцене «Риски годовых подписок как в Grok» определяется так: годовая подписка на продукт, который меняется каждые несколько недель, — риск для пользователя: сегодня режим кажется лучшим, завтра меняются ограничения или интерфейс, а деньги уже заплачены.
Граница применимости в сцене «Как Grok анализирует и ищет информацию» определяется так: правильный тест начинается с собственной задачи — дать одинаковый контекст, проверить источники, посчитать время и посмотреть, сколько осталось ручного ремонта; Grok может выиграть поиск, Claude — код, OpenAI — привычный контур, и единого победителя нет, пока продукты решают разные части работы.
О чём этот выпуск
Grok 4 Heavy, o3 Pro, Claude Code и новые функции ChatGPT сильны в разных местах. Живые тесты показывают, что модель можно хвалить за поиск, скорость или рассуждение и всё равно не выбрать для ежедневной работы. Интерфейс, цена, подписка и доступ к инструментам решают не меньше результата теста.
Grok 4 вышел с заявкой на лидерство, и первое впечатление действительно сильное: модель быстро ищет информацию, умеет разворачивать исследование и в тяжёлом режиме пытается решать задачу несколькими траекториями. Но уже на конкретных кейсах становится видно, что победа в тесте и удобство в работе — две разные вещи.
Grok 4 Heavy можно сравнивать с дорогими режимами OpenAI, однако важно смотреть не только на финальный ответ. Сколько времени модель работала? Какие источники использовала? Можно ли продолжить задачу, подключить файлы и встроить результат в процесс? Если пользователь вынужден переносить данные между терминалом, браузером и отдельным приложением, техническое преимущество быстро съедается трением.
o3 Pro получает улучшения скорости, ChatGPT добавляет новые функции, а Claude Code остаётся одним из самых понятных инструментов для программистов. У Anthropic ценность часто не в одном красивом ответе, а в том, что модель живёт рядом с кодом, видит проект и последовательно меняет файлы.
Для разработчика это может быть важнее места в общем рейтинге.
xAI при этом заслуживает отдельного уважения за темп и прямоту презентации. Компания показывает, что именно хочет обогнать, и быстро наращивает инфраструктуру. Но годовая подписка на продукт, который меняется каждые несколько недель, — риск для пользователя. Сегодня режим кажется лучшим, завтра ограничения или интерфейс меняются, а деньги уже заплачены.
Правильный тест модели начинается с собственной задачи. Нужно дать одинаковый контекст, проверить источники, посчитать время и посмотреть, сколько ручного ремонта осталось. Grok может выиграть поиск, Claude — код, OpenAI — привычный рабочий контур. Это не слабость рынка, а его новая реальность: единственного победителя нет, пока продукты решают разные части работы.
На примере Grok и OpenAI видно: в гонке моделей побеждает не максимальный балл сам по себе, а система, которая повторяемо решает задачу и понятна пользователю по цене и ограничениям.
Расшифровка выпуска
Голосовая связка применена к 124 сегментам: 80 определено, 4 содержат несколько определённых участников, 15 вероятных, 25 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Читать транскрипт на отдельной странице
Загрузка…