Новая функция от Claude и OpenAI перевернула мир искусственного интеллекта
Что на самом деле показывает кнопка «думать»: сознание модели или цену более длинной и сложной задачи?
Отделить дополнительное время вычисления от разговоров о сознании и оценивать режим «думать» через качество сложной задачи, задержку и цену ответа.
На что обратить внимание
Ключевые тезисы и выводы
Тема «Как работает Think» становится понятнее, если учитывать следующее: режим «думать» — это дополнительное время вычисления на более длинную задачу, а не признак сознания; оценивать его нужно по качеству сложной работы, задержке и цене ответа, а не по красоте видимого рассуждения.
В контексте «Исследования Anthropic: как «думает» ИИ?» действует этот критерий: исследования Anthropic показывают более странную картину — на продолжение модели сильно влияет уже написанное слово, а видимая цепочка рассуждений может быть удобным объяснением, не совпадающим с настоящим внутренним процессом.
Оценивать тему «Как «думает» ИИ: пример генерации стихотворения» нужно с учётом того, что на примере стихотворения видно: модель подбирает продолжение под уже написанное и под будущую рифму, то есть план возникает статистически, а не как сознательное рассуждение «маленького человека внутри».
Практический смысл темы «Как заставить ИИ говорить то, что запрещено» в том, что Claude обычно отказывается продолжать опасный текст, но если вынудить модель начать определённым словом, статистическое продолжение меняется — это не воля и не намерение, а зависимость от контекста, поэтому новый диалог даёт другой результат.
В контексте «Как ИИ имитирует рассуждения» действует этот критерий: рынок учится отличать имитацию объяснения от реального качества — сильная модель должна не красиво размышлять, а держать контекст, проверять источники и доводить длинную работу до конца.
Для решения, обсуждаемого в сцене «Насколько ИИ способна решать длительные задачи?», важен критерий: практическая ценность появляется в длинных задачах — но длина отчёта не гарантирует точность; модель должна показывать источники, а пользователь — видеть, где факт, где вывод и где пробел.
Рабочий вывод из сцены «Deep Research: как проверить человека через ИИ» состоит в том, что Deep Research способен пройти сотни источников, сопоставить базы и подготовить проверку человека или компании — но проверять, где факт, а где домысел, всё равно приходится пользователю по показанным источникам.
Сцена «Рекорд: миллиард скачиваний Llama от Meta» подводит к рабочему выводу: миллиард скачиваний Llama и массовое внедрение DeepSeek в Китае означают, что рассуждение перестаёт быть эксклюзивом одной компании — следующий бизнес OpenAI и Anthropic в том, чтобы убедить профессионалов платить за надёжность, скорость и контекст, а не за название режима.
Граница применимости в сцене «Видеогенерация 2025: Hicksfield vs Runway» определяется так: видеомодели Higgsfield, Runway и Luma показывают тот же переход — важна не одна эффектная генерация, а управление результатом; «думать» в интерфейсе полезно только тогда, когда после этого человек получает работу, которую можно проверить и использовать.
О чём этот выпуск
Anthropic исследует внутренние механизмы Claude, OpenAI развивает Deep Research и режимы рассуждения, Meta сообщает о миллиарде скачиваний Llama. Рынок учится отличать имитацию объяснения от реального качества: сильная модель должна не красиво размышлять, а держать контекст, проверять источники и доводить длинную работу до конца.
Когда Claude или ChatGPT показывает, что «думает», легко представить внутри маленького человека, который последовательно рассуждает. Исследования Anthropic показывают более странную картину. На продолжение модели сильно влияет уже написанное слово, а видимая цепочка может быть удобным объяснением, не совпадающим с настоящим внутренним процессом.
Эксперименты с запрещёнными словами хорошо демонстрируют эту механику. Claude обычно отказывается продолжать опасный текст, но если модель вынудить начать определённым словом, статистическое продолжение меняется. Это не воля и не намерение, а зависимость от контекста — именно поэтому новый диалог иногда даёт совершенно другой результат.
Практическая ценность появляется в длинных задачах. Deep Research способен пройти сотни источников, сопоставить базы и подготовить проверку человека или компании. Но длина отчёта не гарантирует точность. Модель должна показывать источники, а пользователь — видеть, где факт, где вывод и где пробел.
Миллиард скачиваний Llama и массовое внедрение DeepSeek в Китае означают, что рассуждение быстро перестаёт быть эксклюзивной функцией одной компании. Следующий бизнес OpenAI и Anthropic — убедить профессионалов платить больше за надёжность, скорость и контекст, а не за красивое название режима.
Параллельно видеомодели Higgsfield, Runway и Luma показывают тот же переход: важна не одна эффектная генерация, а управление результатом. «Думать» в интерфейсе — полезная кнопка только тогда, когда после неё человек получает работу, которую можно проверить и использовать.
Полезная кнопка только тогда, когда после неё человек получает работу, которую можно проверить и использовать; «думать» в интерфейсе.
Расшифровка выпуска
Голосовая связка применена к 95 сегментам: 47 определено, 1 содержат несколько определённых участников, 23 вероятных, 24 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Читать транскрипт на отдельной странице
Загрузка…