К содержанию
OpenAI · OpenAI o1 · AppleВыпуск 024 · 22 сентября 2024 · 32:47

Черный ящик в черном ящике: как работает новая модель OpenAI. Люди всё дальше от понимания ИИ

Главный вопрос

Что пользователь получает от модели, которая думает дольше, и почему выбор между моделями становится ещё сложнее?

Результат для читателя

Понять, когда более длинное рассуждение модели даёт рабочее преимущество, а когда лишь увеличивает цену, задержку и сложность выбора инструмента.

Главные линии разговора

На что обратить внимание

1Сопоставьте блоки «Новая модель от OpenAI! Как работает o1-preview» и «Техническая сторона o1-preview. Почему эта модель не похожа на все остальные»: они дают разные критерии оценки одной темы.
2Проверьте вывод из блока «Как обучали o1-preview» на собственном сценарии — что действительно меняется в процессе, а что остаётся обещанием.
3До выбора продукта или подхода зафиксируйте ограничение, раскрытое в блоке «Конкуренты ChatGPT. Почему мы говорим в основном об OpenAI».
4Определите владельца результата и метрику качества для ситуации, описанной в блоке «Черный ящик в черном ящике».
На что смотреть после выпуска
→Следите за действиями Anthropic и Apple, которые подтверждают или опровергают ключевые тезисы выпуска.
→Сравнивайте новые запуски и изменения условий с блоком «Как обучали o1-preview»: поменялись ли доступ, качество, цена или ограничения.
→Проверяйте, становится ли сценарий из блока «Черный ящик в черном ящике» повторяемой практикой, а не разовой демонстрацией.
Кому особенно полезно
руководителямпродуктовым командампользователям ИИспециалистамтем, кто планирует карьерупредпринимателям

Ключевые тезисы и выводы

00:00Почему контекст важнее одного показателя: ToTheMoon - подкаст и привет из Кремниевой долины

Из разговора о «ToTheMoon - подкаст и привет из Кремниевой долины!» следует практическая проверка: o1-preview показывает промежуточное рассуждение и лучше справляется там, где одного быстрого ответа мало, но вместе с ростом качества приходит новый хаос: пользователю приходится выбирать между несколькими моделями, а чёрный ящик становится глубже.

01:19Как тема переходит из новости в продукт: google Wallet - интересная новинка от Гугл

Из разговора о «Google Wallet - интересная новинка от Гугл» следует практическая проверка: Google Wallet начал позволять добавлять паспорт, чтобы электронно предъявлять документ — сначала в США, в связке с системой TSA, где идентификатор уже сканируется на досмотре: документ окончательно переезжает в телефон.

03:36Практический смысл темы: мы не яблочные «хомячки

Практический смысл темы «Мы не яблочные «хомячки»!» в том, что упрёк комментаторов в «яблочном» перекосе участники принимают с оговоркой: телефоны у всех действительно Apple — из-за стиля, безопасности или привычки, — но следят они и за Android: возможность добавить идентификатор в Wallet у Google с Gemini разобрали первой.

05:13Новая модель OpenAI интересна не тем, что отвечает ещё на несколько процентов лучше

Тема «Новая модель от OpenAI! Как работает o1-preview» становится понятнее, если учитывать следующее: новинка меняет сам режим работы — перед ответом система тратит время на рассуждение и показывает, что «думала» несколько секунд; для сложной математики и кода это шаг вперёд, но пользователю теперь нужно понимать, когда брать быстрый 4o, когда o1, а когда mini.

06:31До этого разница между ведущими моделями часто была заметна только на отдельных задачах

Практический смысл темы «Техническая сторона o1-preview. Почему эта модель не похожа на все остальные» в том, что с появлением o1 рынок движется к вертикализации: одна модель удобнее для повседневного общения, другая — для кода, третья — для дорогого анализа; интерфейс усложняется, и неверно выбранный режим означает переплату или слабый результат.

10:37Для Meta и других создателей открытых моделей возникает отдельная дилемма

Практический смысл темы «Как обучали o1-preview» в том, что в обучении с подкреплением всегда нужна вспомогательная модель, проверяющая результаты первой, — и встроенная проверка снижает галлюцинации; участники ждут, что в течение года появится инструмент, который сам выбирает между 4o, o1 и mini — вручную это делать никто не будет.

16:06Рынок проверяет это применением: b2C или B2B? Куда уйдут ИИ-решения

Сцена «B2C или B2B? Куда уйдут ИИ-решения» подводит к рабочему выводу: у Meta и других создателей открытых моделей своя дилемма — массовую Llama разработчики дообучают под себя, но модель рассуждения требует совершенно другой экономики и инфраструктуры: открытый и закрытый рынок расходятся уже не по лицензии, а по типу продукта.

19:07Граница пользы и ограничения: chatGPT подорожает до 2000$ в месяц? Для кого

Сцена «ChatGPT подорожает до 2000$ в месяц? Для кого?» подводит к рабочему выводу: разговор о тарифах в сотни и даже тысячи долларов — это ставка на профессиональные сценарии: цена оправдана только там, где длинное рассуждение модели заменяет дорогой человеческий труд, а не просто ускоряет переписку.

23:51OpenAI при этом всё заметнее движется в сторону потребительской компании

Рабочий вывод из сцены «Конкуренты ChatGPT. Почему мы говорим в основном об OpenAI» состоит в том, что Anthropic сильна как платформа для разработчиков, и Claude 3.5 Sonnet уже выигрывает у ChatGPT на части реальных задач, но у OpenAI есть шанс построить бренд уровня Apple: дорогой, массовый и понятный людям, которые не хотят разбираться в архитектуре.

30:54Парадокс o1 в том, что модель должна приблизить нас к более разумному ИИ, а одновременно делает его менее прозрачным

Из разговора о «Черный ящик в черном ящике» следует практическая проверка: мы видим красивое описание хода мысли, но не знаем, насколько оно отражает реальный внутренний процесс: чёрный ящик научился объяснять другой чёрный ящик — и доверять ему стало не проще, а сложнее.

О чём этот выпуск

o1-preview показывает промежуточное рассуждение и лучше справляется с задачами, где одного быстрого ответа недостаточно. Вместе с ростом качества появляется новый хаос: пользователю нужно выбирать между несколькими моделями, компаниям — решать, делать массовый продукт или дорогой инструмент, а исследователям — признавать, что чёрный ящик стал ещё глубже.

Новая модель OpenAI интересна не тем, что отвечает ещё на несколько процентов лучше. Она меняет сам режим работы: перед ответом система тратит время на рассуждение и показывает, что «думала» несколько секунд.

Для сложной математики, программирования или проверки гипотез это важный шаг. Но для обычного пользователя появляется новая проблема — теперь нужно понимать, когда нужен быстрый ChatGPT-4o, когда o1, когда mini и зачем вообще выбирать между ними.

До этого разница между ведущими моделями часто была заметна только на отдельных задачах. С появлением o1 рынок движется к вертикализации: одна модель может быть удобнее для повседневного общения, другая — для кода, третья — для дорогого анализа.

Это усложняет интерфейс и повышает цену ошибки. Если человек выбирает неправильный режим, он либо переплачивает, либо получает слабый результат и делает вывод, что весь ИИ не работает.

Для Meta и других создателей открытых моделей возникает отдельная дилемма. Массовая Llama даёт разработчикам возможность дообучать систему под свои задачи, но сложная модель рассуждения может потребовать совершенно другой экономики и инфраструктуры.

Нельзя просто увеличить число параметров и получить тот же эффект. Поэтому открытый и закрытый рынок начинают расходиться не только по лицензии, но и по типу продукта.

OpenAI при этом всё заметнее движется в сторону потребительской компании. Anthropic сильна как платформа для разработчиков, Claude 3.5 Sonnet уже выигрывает у ChatGPT на части реальных задач, но у OpenAI есть шанс построить бренд уровня Apple: дорогой, массовый и понятный людям, которые не хотят разбираться в архитектуре. Отсюда и разговор о тарифах в сотни или даже тысячи долларов для профессиональных сценариев.

Парадокс o1 в том, что модель должна приблизить нас к более разумному ИИ, а одновременно делает его менее прозрачным. Мы видим красивое описание хода мысли, но не знаем, насколько оно отражает реальный внутренний процесс. Чёрный ящик научился объяснять другой чёрный ящик — и доверять ему стало не проще, а сложнее.

В гонке моделей побеждает не максимальный балл сам по себе, а система, которая повторяемо решает задачу и понятна пользователю по цене и ограничениям.

Расшифровка выпуска

Голосовая связка применена к 51 сегментам: 36 определено, 0 содержат несколько определённых участников, 9 вероятных, 6 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».

Читать транскрипт на отдельной странице

Загрузка…