К содержанию
OpenAI o3 · Google · OpenAIВыпуск 061 · 8 июня 2025 · 43:12

GPT-4o vs O3 Pro + Deep Research: какая модель рвёт в 2025?

Главный вопрос

Почему не существует одной сильнейшей модели и как выбирать ChatGPT под конкретную задачу?

Результат для читателя

Сравнить ChatGPT и Model Context Protocol на реальной задаче вместо выбора по одному тесту или анонсу; оценка должна сопоставлять качество, цену, доступ, память и контроль на конкретной задаче, а не по одному анонсу или тесту.

Главные линии разговора

На что обратить внимание

1Сопоставьте блоки «Различие моделей ChatGPT под разные задачи» и «Anthropic и инструмент "думать": как работает?»: они дают разные критерии оценки одной темы.
2Проверьте вывод из блока «DeepResearch и Google Drive — первый тест» на собственном сценарии — что действительно меняется в процессе, а что остаётся обещанием.
3До выбора продукта или подхода зафиксируйте ограничение, раскрытое в блоке «Alibaba: влияние на будущее AI».
4Определите владельца результата и метрику качества для ситуации, описанной в блоке «Память ChatGPT: обновление в бесплатной версии».
На что смотреть после выпуска
Следите за действиями Alibaba и Anthropic, которые подтверждают или опровергают ключевые тезисы выпуска.
Сравнивайте новые запуски и изменения условий с блоком «DeepResearch и Google Drive — первый тест»: поменялись ли доступ, качество, цена или ограничения.
Проверяйте, становится ли сценарий из блока «Память ChatGPT: обновление в бесплатной версии» повторяемой практикой, а не разовой демонстрацией.
Кому особенно полезно
руководителямпользователям ИИмедиамаркетологампродуктовым командампользователям интернета

Ключевые тезисы и выводы

00:00Граница пользы и ограничения: сегодня в выпуске

Для сцены «Сегодня в выпуске» решающим становится следующее: главная проблема уже не в нехватке мощных моделей, а в том, что пользователь сам должен понять, какая из GPT-4o, o3 Pro, Deep Research, Gemini и Claude подходит его задаче и где именно начнёт ошибаться.

00:59Разговор о том, какая модель «лучшая», быстро разваливается, как только вместо рейтинга появляется реальная задача

Из разговора о «Различие моделей ChatGPT под разные задачи» следует практическая проверка: спор о «лучшей» модели разваливается, как только вместо рейтинга появляется реальная задача — для длинного текста удобнее одна модель, для глубокого исследования другая, для подключения Google Drive третья.

03:52Что меняется в реальной работе: почему O3 лучше GPT-4O

Тема «Почему O3 лучше GPT-4O?» становится понятнее, если учитывать следующее: даже внутри самого ChatGPT приходится вручную выбирать между GPT-4o, o3 и Deep Research, хотя зрелый продукт должен сам определять, какой режим нужен под конкретный запрос.

09:40В этом и заключается главная претензия к OpenAI

Сцена «Anthropic и инструмент "думать": как работает?» подводит к рабочему выводу: главная претензия к OpenAI в том, что она выпустила много сильных моделей, но оставила пользователю роль диспетчера — помнить названия, лимиты, длину контекста, цену и тип мышления; а при плохом результате неясно, виновата ли модель, неверно выбранный режим или интерфейс, потерявший часть запроса.

12:12Как тема переходит из новости в продукт: память ChatGPT: обновление в бесплатной версии

Рабочий вывод из сцены «Память ChatGPT: обновление в бесплатной версии» состоит в том, что расширенная память в бесплатной версии — заметный шаг: чат начинает опираться на прежние разговоры, но польза упирается в то, что OpenAI хранит данные лишь тридцать дней и не находит старые чаты, к которым хочется вернуться.

12:43Deep Research показывает другую сторону развития

Из разговора о «DeepResearch и Google Drive — первый тест» следует практическая проверка: как только Deep Research можно запускать по Google Drive и собственным материалам, модель перестаёт быть просто собеседником и работает с реальным архивом человека или компании — но сразу встают вопросы хранения данных, тридцатидневного лимита, доступа к файлам и того, зачем для обычного сценария подключать сторонние сервисы.

14:44Где обещание сталкивается с реальностью: добавление сторонних сервисов в ИИ

Рабочий вывод из сцены «Добавление сторонних сервисов в ИИ» состоит в том, что подключение сторонних сервисов превращает Deep Research в конструктор: через MCP можно добавить, например, транскрибацию на базе Whisper и скормить модели аудио, которое она сама не распознаёт, — мощно, но это спор «iPhone против Android», где всё приходится настраивать руками.

17:45Что определяет итог: галлюцинации ИИ: люди ошибаются чаще

Сцена «Галлюцинации ИИ: люди ошибаются чаще?» подводит к рабочему выводу: пример с советами по саду показывает суть спора о галлюцинациях — модель дала подробный разбор и оказалась права там, где ошибся человек, но доверять ответу без проверки нельзя: как и совет человека, его стоит перепроверять, особенно где цена ошибки высока.

21:53Почему одного анонса недостаточно: apple открывает AI-модели

Для решения, обсуждаемого в сцене «Apple открывает AI-модели», важен критерий: Apple открывает свои ИИ-модели сторонним разработчикам, но вопрос — какие именно модели: компания сильно отстаёт, инсайдеры говорят, что поглощений она пока не делает, а Google уже ставит локальные Gemma на устройства; ещё одно обещание на будущий год вместо продукта только увеличит отставание.

41:02Параллельно Apple рискует ещё сильнее отстать, если снова покажет обещание на будущий год вместо работающего продукта

Тема «Alibaba: влияние на будущее AI» становится понятнее, если учитывать следующее: парадокс в том, что открытые модели Alibaba двигают американские стартапы generative AI сильнее, чем закрытые OpenAI, Google и Anthropic — на закрытых удобно стартовать на деньги инвесторов, но для оптимизации под массовые сценарии нужны open source модели, а у DeepSeek нет такой «печатной машины», как у Alibaba.

О чём этот выпуск

GPT-4o, o3 Pro, Deep Research, Gemini и Claude дают разные результаты на длинных текстах, исследованиях, аудио и повседневных запросах. Главная проблема уже не в отсутствии мощных моделей, а в том, что пользователь должен сам разбираться, какая из них подходит конкретной работе и где она начнёт ошибаться.

Разговор о том, какая модель «лучшая», быстро разваливается, как только вместо рейтинга появляется реальная задача. Для длинного текста одна модель оказывается удобнее, для глубокого исследования — другая, для подключения Google Drive — третья.

Даже внутри ChatGPT приходится выбирать между GPT-4o, o3 и Deep Research, хотя нормальный продукт должен сам понимать, какой режим нужен человеку.

В этом и заключается главная претензия к OpenAI. Компания выпустила много сильных моделей, но оставила пользователю работу диспетчера. Нужно помнить названия, ограничения, длину контекста, цену и тип мышления. Если результат плохой, непонятно, виновата ли сама модель, неверно выбранный режим или интерфейс, который снова потерял часть запроса.

Deep Research показывает другую сторону развития. Когда исследование можно запускать по Google Drive и собственным материалам, модель перестаёт быть только собеседником и начинает работать с реальным архивом человека или компании. Но здесь сразу возникают вопросы хранения данных, тридцатидневных ограничений, доступа к файлам и того, почему для обычного сценария приходится подключать сторонние сервисы.

На бытовом уровне все проблемы видны ещё лучше. ChatGPT может помогать разбирать медицинские документы, советовать товары для сада или работать с диктофонной записью, но он же галлюцинирует, забывает часть разговора и превращает простую голосовую задачу в борьбу с интерфейсом. Польза огромна, однако доверять ответу без проверки нельзя — особенно там, где цена ошибки выше обычного неудобства.

Параллельно Apple рискует ещё сильнее отстать, если снова покажет обещание на будущий год вместо работающего продукта. Google уже размещает локальные модели на устройствах, а OpenAI и Anthropic платят огромные деньги за инженеров.

Гонка идёт не только за качеством ответа. Победит тот, кто уберёт хаос выбора, встроит модель в привычный процесс и сделает её полезной без обязательного курса по внутренней архитектуре ИИ.

Гонка идёт не только за качеством ответа. Поэтому победит тот, кто уберёт хаос выбора, встроит модель в привычный процесс и сделает её полезной без обязательного курса по внутренней архитектуре ИИ.

Расшифровка выпуска

Голосовая связка применена к 88 сегментам: 38 определено, 4 содержат несколько определённых участников, 23 вероятных, 23 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».

Загрузка…