GPT-4o vs O3 Pro + Deep Research: какая модель рвёт в 2025?
Почему не существует одной сильнейшей модели и как выбирать ChatGPT под конкретную задачу?
Сравнить ChatGPT и Model Context Protocol на реальной задаче вместо выбора по одному тесту или анонсу; оценка должна сопоставлять качество, цену, доступ, память и контроль на конкретной задаче, а не по одному анонсу или тесту.
На что обратить внимание
Ключевые тезисы и выводы
Для сцены «Сегодня в выпуске» решающим становится следующее: главная проблема уже не в нехватке мощных моделей, а в том, что пользователь сам должен понять, какая из GPT-4o, o3 Pro, Deep Research, Gemini и Claude подходит его задаче и где именно начнёт ошибаться.
Из разговора о «Различие моделей ChatGPT под разные задачи» следует практическая проверка: спор о «лучшей» модели разваливается, как только вместо рейтинга появляется реальная задача — для длинного текста удобнее одна модель, для глубокого исследования другая, для подключения Google Drive третья.
Тема «Почему O3 лучше GPT-4O?» становится понятнее, если учитывать следующее: даже внутри самого ChatGPT приходится вручную выбирать между GPT-4o, o3 и Deep Research, хотя зрелый продукт должен сам определять, какой режим нужен под конкретный запрос.
Сцена «Anthropic и инструмент "думать": как работает?» подводит к рабочему выводу: главная претензия к OpenAI в том, что она выпустила много сильных моделей, но оставила пользователю роль диспетчера — помнить названия, лимиты, длину контекста, цену и тип мышления; а при плохом результате неясно, виновата ли модель, неверно выбранный режим или интерфейс, потерявший часть запроса.
Рабочий вывод из сцены «Память ChatGPT: обновление в бесплатной версии» состоит в том, что расширенная память в бесплатной версии — заметный шаг: чат начинает опираться на прежние разговоры, но польза упирается в то, что OpenAI хранит данные лишь тридцать дней и не находит старые чаты, к которым хочется вернуться.
Из разговора о «DeepResearch и Google Drive — первый тест» следует практическая проверка: как только Deep Research можно запускать по Google Drive и собственным материалам, модель перестаёт быть просто собеседником и работает с реальным архивом человека или компании — но сразу встают вопросы хранения данных, тридцатидневного лимита, доступа к файлам и того, зачем для обычного сценария подключать сторонние сервисы.
Рабочий вывод из сцены «Добавление сторонних сервисов в ИИ» состоит в том, что подключение сторонних сервисов превращает Deep Research в конструктор: через MCP можно добавить, например, транскрибацию на базе Whisper и скормить модели аудио, которое она сама не распознаёт, — мощно, но это спор «iPhone против Android», где всё приходится настраивать руками.
Сцена «Галлюцинации ИИ: люди ошибаются чаще?» подводит к рабочему выводу: пример с советами по саду показывает суть спора о галлюцинациях — модель дала подробный разбор и оказалась права там, где ошибся человек, но доверять ответу без проверки нельзя: как и совет человека, его стоит перепроверять, особенно где цена ошибки высока.
Для решения, обсуждаемого в сцене «Apple открывает AI-модели», важен критерий: Apple открывает свои ИИ-модели сторонним разработчикам, но вопрос — какие именно модели: компания сильно отстаёт, инсайдеры говорят, что поглощений она пока не делает, а Google уже ставит локальные Gemma на устройства; ещё одно обещание на будущий год вместо продукта только увеличит отставание.
Тема «Alibaba: влияние на будущее AI» становится понятнее, если учитывать следующее: парадокс в том, что открытые модели Alibaba двигают американские стартапы generative AI сильнее, чем закрытые OpenAI, Google и Anthropic — на закрытых удобно стартовать на деньги инвесторов, но для оптимизации под массовые сценарии нужны open source модели, а у DeepSeek нет такой «печатной машины», как у Alibaba.
О чём этот выпуск
GPT-4o, o3 Pro, Deep Research, Gemini и Claude дают разные результаты на длинных текстах, исследованиях, аудио и повседневных запросах. Главная проблема уже не в отсутствии мощных моделей, а в том, что пользователь должен сам разбираться, какая из них подходит конкретной работе и где она начнёт ошибаться.
Разговор о том, какая модель «лучшая», быстро разваливается, как только вместо рейтинга появляется реальная задача. Для длинного текста одна модель оказывается удобнее, для глубокого исследования — другая, для подключения Google Drive — третья.
Даже внутри ChatGPT приходится выбирать между GPT-4o, o3 и Deep Research, хотя нормальный продукт должен сам понимать, какой режим нужен человеку.
В этом и заключается главная претензия к OpenAI. Компания выпустила много сильных моделей, но оставила пользователю работу диспетчера. Нужно помнить названия, ограничения, длину контекста, цену и тип мышления. Если результат плохой, непонятно, виновата ли сама модель, неверно выбранный режим или интерфейс, который снова потерял часть запроса.
Deep Research показывает другую сторону развития. Когда исследование можно запускать по Google Drive и собственным материалам, модель перестаёт быть только собеседником и начинает работать с реальным архивом человека или компании. Но здесь сразу возникают вопросы хранения данных, тридцатидневных ограничений, доступа к файлам и того, почему для обычного сценария приходится подключать сторонние сервисы.
На бытовом уровне все проблемы видны ещё лучше. ChatGPT может помогать разбирать медицинские документы, советовать товары для сада или работать с диктофонной записью, но он же галлюцинирует, забывает часть разговора и превращает простую голосовую задачу в борьбу с интерфейсом. Польза огромна, однако доверять ответу без проверки нельзя — особенно там, где цена ошибки выше обычного неудобства.
Параллельно Apple рискует ещё сильнее отстать, если снова покажет обещание на будущий год вместо работающего продукта. Google уже размещает локальные модели на устройствах, а OpenAI и Anthropic платят огромные деньги за инженеров.
Гонка идёт не только за качеством ответа. Победит тот, кто уберёт хаос выбора, встроит модель в привычный процесс и сделает её полезной без обязательного курса по внутренней архитектуре ИИ.
Гонка идёт не только за качеством ответа. Поэтому победит тот, кто уберёт хаос выбора, встроит модель в привычный процесс и сделает её полезной без обязательного курса по внутренней архитектуре ИИ.
Расшифровка выпуска
Голосовая связка применена к 88 сегментам: 38 определено, 4 содержат несколько определённых участников, 23 вероятных, 23 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Загрузка…