Черный ящик в черном ящике: как работает новая модель OpenAI. Люди всё дальше от понимания ИИ
Что пользователь получает от модели, которая думает дольше, и почему выбор между моделями становится ещё сложнее?
Понять, когда более длинное рассуждение модели даёт рабочее преимущество, а когда лишь увеличивает цену, задержку и сложность выбора инструмента.
На что обратить внимание
Ключевые тезисы и выводы
Из разговора о «ToTheMoon - подкаст и привет из Кремниевой долины!» следует практическая проверка: анонс имеет значение только тогда, когда меняет доступ, качество, цену или поведение пользователя в реальном сценарии.
Из разговора о «Google Wallet - интересная новинка от Гугл» следует практическая проверка: один тест измеряет узкую способность; рабочая ценность появляется только при повторяемом результате, понятной цене и контроле ошибок.
Практический смысл темы «Мы не яблочные «хомячки»!» в том, что риск определяется объёмом доступа, масштабом последствий и тем, можно ли остановить систему и восстановить ход её действий.
Тема «Новая модель от OpenAI! Как работает o1-preview» становится понятнее, если учитывать следующее: фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.
Практический смысл темы «Техническая сторона o1-preview. Почему эта модель не похожа на все остальные» в том, что фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.
Практический смысл темы «Как обучали o1-preview» в том, что фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.
Сцена «B2C или B2B? Куда уйдут ИИ-решения» подводит к рабочему выводу: конфликт показывает, какие права, деньги и рычаги контроля стороны считают стратегическими.
Сцена «ChatGPT подорожает до 2000$ в месяц? Для кого?» подводит к рабочему выводу: анонс имеет значение только тогда, когда меняет доступ, качество, цену или поведение пользователя в реальном сценарии.
Рабочий вывод из сцены «Конкуренты ChatGPT. Почему мы говорим в основном об OpenAI» состоит в том, что фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.
Из разговора о «Черный ящик в черном ящике» следует практическая проверка: фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.
О чём этот выпуск
o1-preview показывает промежуточное рассуждение и лучше справляется с задачами, где одного быстрого ответа недостаточно. Вместе с ростом качества появляется новый хаос: пользователю нужно выбирать между несколькими моделями, компаниям — решать, делать массовый продукт или дорогой инструмент, а исследователям — признавать, что чёрный ящик стал ещё глубже.
Новая модель OpenAI интересна не тем, что отвечает ещё на несколько процентов лучше. Она меняет сам режим работы: перед ответом система тратит время на рассуждение и показывает, что «думала» несколько секунд.
Для сложной математики, программирования или проверки гипотез это важный шаг. Но для обычного пользователя появляется новая проблема — теперь нужно понимать, когда нужен быстрый ChatGPT-4o, когда o1, когда mini и зачем вообще выбирать между ними.
До этого разница между ведущими моделями часто была заметна только на отдельных задачах. С появлением o1 рынок движется к вертикализации: одна модель может быть удобнее для повседневного общения, другая — для кода, третья — для дорогого анализа.
Это усложняет интерфейс и повышает цену ошибки. Если человек выбирает неправильный режим, он либо переплачивает, либо получает слабый результат и делает вывод, что весь ИИ не работает.
Для Meta и других создателей открытых моделей возникает отдельная дилемма. Массовая Llama даёт разработчикам возможность дообучать систему под свои задачи, но сложная модель рассуждения может потребовать совершенно другой экономики и инфраструктуры.
Нельзя просто увеличить число параметров и получить тот же эффект. Поэтому открытый и закрытый рынок начинают расходиться не только по лицензии, но и по типу продукта.
OpenAI при этом всё заметнее движется в сторону потребительской компании. Anthropic сильна как платформа для разработчиков, Claude 3.5 Sonnet уже выигрывает у ChatGPT на части реальных задач, но у OpenAI есть шанс построить бренд уровня Apple: дорогой, массовый и понятный людям, которые не хотят разбираться в архитектуре. Отсюда и разговор о тарифах в сотни или даже тысячи долларов для профессиональных сценариев.
Парадокс o1 в том, что модель должна приблизить нас к более разумному ИИ, а одновременно делает его менее прозрачным. Мы видим красивое описание хода мысли, но не знаем, насколько оно отражает реальный внутренний процесс. Чёрный ящик научился объяснять другой чёрный ящик — и доверять ему стало не проще, а сложнее.
В гонке моделей побеждает не максимальный балл сам по себе, а система, которая повторяемо решает задачу и понятна пользователю по цене и ограничениям.
Расшифровка выпуска
Голосовая связка применена к 51 сегментам: 36 определено, 0 содержат несколько определённых участников, 9 вероятных, 6 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Загрузка…