К содержанию
OpenAI o3 · Google · OpenAIВыпуск 061 · 8 июня 2025 · 43:12

GPT-4o vs O3 Pro + Deep Research: какая модель рвёт в 2025?

Главный вопрос

Почему не существует одной сильнейшей модели и как выбирать ChatGPT под конкретную задачу?

Результат для читателя

Сравнить ChatGPT и Model Context Protocol на реальной задаче вместо выбора по одному тесту или анонсу; оценка должна сопоставлять качество, цену, доступ, память и контроль на конкретной задаче, а не по одному анонсу или тесту.

Главные линии разговора

На что обратить внимание

1Сопоставьте блоки «Различие моделей ChatGPT под разные задачи» и «Anthropic и инструмент "думать": как работает?»: они дают разные критерии оценки одной темы.
2Проверьте вывод из блока «DeepResearch и Google Drive — первый тест» на собственном сценарии — что действительно меняется в процессе, а что остаётся обещанием.
3До выбора продукта или подхода зафиксируйте ограничение, раскрытое в блоке «Alibaba: влияние на будущее AI».
4Определите владельца результата и метрику качества для ситуации, описанной в блоке «Память ChatGPT: обновление в бесплатной версии».
На что смотреть после выпуска
Следите за действиями Alibaba и Anthropic, которые подтверждают или опровергают ключевые тезисы выпуска.
Сравнивайте новые запуски и изменения условий с блоком «DeepResearch и Google Drive — первый тест»: поменялись ли доступ, качество, цена или ограничения.
Проверяйте, становится ли сценарий из блока «Память ChatGPT: обновление в бесплатной версии» повторяемой практикой, а не разовой демонстрацией.
Кому особенно полезно
руководителямпользователям ИИмедиамаркетологампродуктовым командампользователям интернета

Ключевые тезисы и выводы

00:00Граница пользы и ограничения: сегодня в выпуске

Для сцены «Сегодня в выпуске» решающим становится следующее: здесь важна не одна сумма: переход к следующему раунду, запас времени и доля закрытий показывают, выдерживает ли компания новую стоимость капитала.

00:59Разговор о том, какая модель «лучшая», быстро разваливается, как только вместо рейтинга появляется реальная задача

Из разговора о «Различие моделей ChatGPT под разные задачи» следует практическая проверка: фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.

03:52Что меняется в реальной работе: почему O3 лучше GPT-4O

Тема «Почему O3 лучше GPT-4O?» становится понятнее, если учитывать следующее: смысл упирается в исполнимость правила и распределение ответственности, а не в сам факт появления нового требования.

09:40В этом и заключается главная претензия к OpenAI

Сцена «Anthropic и инструмент "думать": как работает?» подводит к рабочему выводу: фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.

12:12Как тема переходит из новости в продукт: память ChatGPT: обновление в бесплатной версии

Рабочий вывод из сцены «Память ChatGPT: обновление в бесплатной версии» состоит в том, что анонс становится событием только тогда, когда меняет доступ, качество, цену или поведение пользователя в реальном сценарии.

12:43Deep Research показывает другую сторону развития

Из разговора о «DeepResearch и Google Drive — первый тест» следует практическая проверка: один тест измеряет узкую способность; рабочая ценность требует повторяемого результата, понятной цены и контроля ошибок.

14:44Где обещание сталкивается с реальностью: добавление сторонних сервисов в ИИ

Рабочий вывод из сцены «Добавление сторонних сервисов в ИИ» состоит в том, что прогноз можно проверить через конкретные сроки, действия компаний и изменения в продукте или рынке.

17:45Что определяет итог: галлюцинации ИИ: люди ошибаются чаще

Сцена «Галлюцинации ИИ: люди ошибаются чаще?» подводит к рабочему выводу: анонс имеет значение только тогда, когда меняет доступ, качество, цену или поведение пользователя в реальном сценарии.

21:53Почему одного анонса недостаточно: apple открывает AI-модели

Для решения, обсуждаемого в сцене «Apple открывает AI-модели», важен критерий: один тест измеряет узкую способность; рабочая ценность появляется только при повторяемом результате, понятной цене и контроле ошибок.

41:02Параллельно Apple рискует ещё сильнее отстать, если снова покажет обещание на будущий год вместо работающего продукта

Тема «Alibaba: влияние на будущее AI» становится понятнее, если учитывать следующее: фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.

О чём этот выпуск

GPT-4o, o3 Pro, Deep Research, Gemini и Claude дают разные результаты на длинных текстах, исследованиях, аудио и повседневных запросах. Главная проблема уже не в отсутствии мощных моделей, а в том, что пользователь должен сам разбираться, какая из них подходит конкретной работе и где она начнёт ошибаться.

Разговор о том, какая модель «лучшая», быстро разваливается, как только вместо рейтинга появляется реальная задача. Для длинного текста одна модель оказывается удобнее, для глубокого исследования — другая, для подключения Google Drive — третья.

Даже внутри ChatGPT приходится выбирать между GPT-4o, o3 и Deep Research, хотя нормальный продукт должен сам понимать, какой режим нужен человеку.

В этом и заключается главная претензия к OpenAI. Компания выпустила много сильных моделей, но оставила пользователю работу диспетчера. Нужно помнить названия, ограничения, длину контекста, цену и тип мышления. Если результат плохой, непонятно, виновата ли сама модель, неверно выбранный режим или интерфейс, который снова потерял часть запроса.

Deep Research показывает другую сторону развития. Когда исследование можно запускать по Google Drive и собственным материалам, модель перестаёт быть только собеседником и начинает работать с реальным архивом человека или компании. Но здесь сразу возникают вопросы хранения данных, тридцатидневных ограничений, доступа к файлам и того, почему для обычного сценария приходится подключать сторонние сервисы.

На бытовом уровне все проблемы видны ещё лучше. ChatGPT может помогать разбирать медицинские документы, советовать товары для сада или работать с диктофонной записью, но он же галлюцинирует, забывает часть разговора и превращает простую голосовую задачу в борьбу с интерфейсом. Польза огромна, однако доверять ответу без проверки нельзя — особенно там, где цена ошибки выше обычного неудобства.

Параллельно Apple рискует ещё сильнее отстать, если снова покажет обещание на будущий год вместо работающего продукта. Google уже размещает локальные модели на устройствах, а OpenAI и Anthropic платят огромные деньги за инженеров.

Гонка идёт не только за качеством ответа. Победит тот, кто уберёт хаос выбора, встроит модель в привычный процесс и сделает её полезной без обязательного курса по внутренней архитектуре ИИ.

Гонка идёт не только за качеством ответа. Поэтому победит тот, кто уберёт хаос выбора, встроит модель в привычный процесс и сделает её полезной без обязательного курса по внутренней архитектуре ИИ.

Расшифровка выпуска

Голосовая связка применена к 88 сегментам: 38 определено, 4 содержат несколько определённых участников, 23 вероятных, 23 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».

Загрузка…