К содержанию
Anthropic · Искусственный интеллект · OpenAIВыпуск 125 · 24 июня 2026 · 01:08:49

Кто остановит ИИ, если он станет опасным? Anthropic предложила красную кнопку

Главный вопрос

Кто должен иметь право остановить запуск самой сильной модели ИИ, если она стала опасной, — компании, инвесторы, государство или никто, — и можно ли вообще проверить модель, которую не могут проверить даже её создатели?

Результат для читателя

Anthropic предлагает для крупных разработчиков передовых моделей отдельный режим: обязанности самих компаний, независимую внешнюю проверку и право государства остановить опасное развёртывание. Правила касаются только тех, кто проходит два порога — обучение с вычислениями свыше 10 в 25-й степени операций с плавающей точкой и более $500 млн выручки от ИИ или $1 млрд расходов на R&D, — а катастрофический риск делится на четыре зоны: биологическую, кибер, потерю контроля и автоматизированные исследования. В документе — публикуемый фреймворк безопасности, отчёты по рискам раз в полгода, карты систем и 15 дней на сообщение о критическом инциденте. Александр Волчек проходит по документу и сомневается в главном: государство вряд ли проверит сверхмодель, которую не могут проверить даже её создатели, а «независимые» оценщики Anthropic пока будут такими же зависимыми.

Главные линии разговора

На что обратить внимание

1Проверьте, попадает ли ваша компания или поставщик под два порога Anthropic — свыше 10 в 25-й степени операций с плавающей точкой на обучение и более $500 млн выручки от ИИ или $1 млрд на R&D: правила документа адресованы только им, а не каждому стартапу или open source проекту.
2Не доверяйте самоотчётам разработчиков моделей: спрашивайте, кто проводил независимую проверку, какие тесты и когда, и есть ли у модели карта системы с описанием способностей и ограничений.
3Прежде чем строить процессы на закрытой модели вроде Fable или Mythos, учитывайте, что доступ может исчезнуть за несколько дней — по решению государства или самой компании.
4Отличайте пиар от дела: у OpenAI, Meta и других всегда смотрите, что компания реально делает, а не что декларирует — от программ сертификации консультантов до заявлений о безопасности.
5Разделяйте безопасность модели и защищённость инфраструктуры: фильтры ответов не спасут, если украдены веса или открыт доступ через API и партнёрские программы.
6Если вы используете ИИ по-настоящему, исходите из того, что используете его не по-настоящему, — именно эти люди, по словам ведущего, будут отрываться от остальных.
На что смотреть после выпуска
→Откроет ли Anthropic доступ к Fable и Mythos снова — и подтвердится ли прогноз, что перед IPO у компании нет вариантов.
→Появится ли в США закон с двумя порогами, независимыми оценщиками и правом государства остановить запуск — или всё останется добровольной прозрачностью.
→Как разрешится спор о вытеснении: перекроет ли федеральный стандарт более строгие законы штатов.
→Станут ли «независимые» оценщики Anthropic по-настоящему независимыми или превратятся в ритуал «shopping» удобного проверяющего.
→Выйдут ли Anthropic и OpenAI на IPO до конца года и пересмотрят ли после этого пороги, как ожидает ведущий.
Кому особенно полезно
Руководителям и предпринимателям, которые строят продукты на передовых моделях: разбор показывает, какие требования к отчётности и проверкам могут стать обязательными.Тем, кто следит за Anthropic, OpenAI и гонкой моделей: история с Fable и Mythos и отличие политики OpenAI изложены по шагам.Юристам и всем, кто интересуется регулированием ИИ: пороги, судебный пересмотр, дискреция агентств и вытеснение законов штатов объяснены на примере одного документа.Специалистам по безопасности: четыре зоны катастрофического риска, защита весов от кражи и дистилляции, 15 дней на сообщение об инциденте.Тем, кого волнует рынок труда: три сценария безработицы, «купить время» и почему ведущий не верит, что ИИ заберёт рабочие места.Всем, кто хочет понять, кто на самом деле должен держать руку на выключателе ИИ.

Ключевые тезисы и выводы

00:09Главный вопрос — не кто победит, а кто нажмёт стоп

Самый важный вопрос не в том, кто победит — OpenAI, Google, Anthropic или SpaceX, — а кто нажмёт стоп, если ИИ станет реально опасным. Anthropic заявила, что самые мощные модели нельзя выпускать в мир как новую кнопку в приложении: это система, которая пишет серьёзный код, ищет слабые места в чужих системах и забирает на себя всё больше решений. Компания не предлагает запретить ИИ, но считает, что слишком сильную модель должны проверять не только разработчики, а государство должно иметь право остановить опасный запуск.

03:21Отдельный режим для frontier-моделей: три вещи вместо запрета

ИИ развивается настолько быстро, что государственные механизмы отстают, поэтому для самых мощных моделей — класса Anthropic Mythos — нужен отдельный режим: не запрет и не контроль каждого продукта, а обязательные правила для крупных разработчиков передового ИИ. Anthropic предлагает три вещи: обязанности разработчиков, независимую внешнюю проверку и полномочия государства остановить развёртывание при катастрофическом риске. На практике Mythos получил ограниченный круг компаний, Fable закрыли для всех, кроме граждан США, а через несколько дней после релиза государство её заблокировало.

07:42Не запрет, а недоверие самоотчёту и красная кнопка государства

Anthropic предлагает не запретить ИИ, а не доверять только самоотчёту: прозрачность, отчёты и карты системы недостаточны без независимой оценки. Государству же даётся красная кнопка: если модель реально опасна, оно условно её блокирует. Такие блокировки уже есть — Пентагон внёс Alibaba, Baidu и другие компании в «красную зону». Сам ведущий не стал бы пользоваться китайскими моделями, убеждённый, что все данные там записываются, тогда как Fable как модель класса Mythos хранила данные тридцать дней, а Microsoft в первые дни запретила её у себя.

12:29Законы нужны заранее: опасные возможности могут быть развёрнуты без возврата

ИИ развивается экспоненциально, а законы, агентства и суды создаются медленно; медленно реагирует даже бизнес — у ChatGPT пять миллионов платных подписок из миллиарда пользователей. К моменту, когда общество поймёт риск, опасные возможности уже могут быть развёрнуты без возврата назад, поэтому законы для самых сильных моделей нужны заранее. Ведущий добавляет своё: модели становятся всё менее доступными, государство умеет только ограничивать, а с учётом Китая, который дистиллирует американские модели, у США нет шансов остановиться.

18:49Два порога: 10 в 25-й степени операций и $500 млн выручки или $1 млрд на R&D

Правила касаются только крупных разработчиков, проходящих два порога сразу, а не любого стартапа или open source проекта. Первый — порог возможностей: обучение моделей с вычислениями более десяти в двадцать пятой степени операций с плавающей точкой. Второй — масштаб компании: более пятисот миллионов долларов годовой выручки от ИИ или более миллиарда долларов расходов на R&D; здесь, замечает ведущий, огромное количество стран и команд просто отваливается. Пороги не вечны: агентство должно регулярно их пересматривать, и ведущий ожидает, что после IPO этого первой захочет сама Anthropic.

22:16Катастрофический риск — не ошибка чат-бота, а четыре зоны вреда

Катастрофический риск — не ошибка чат-бота, спорный ответ или галлюцинация, а вред, способный существенно способствовать смерти, массовому ущербу и разрушению общественной безопасности. Четыре зоны: биологический риск; киберриск — модели ускоряют поиск дырок в системах, а Mythos не только нашла невероятное количество уязвимостей, но и сама создала функционал для работы с ними; потеря контроля, когда автономная система обходит ограничения и скрывает действия; и автоматизированные исследования, где ИИ помогает создавать ещё более сильный ИИ. Документ не делает вид, что все риски одинаковы.

29:46Самооценка — конфликт интересов, особенно перед IPO, а проверить сверхмодель некому

Если компания сама оценивает модель, выбирает тесты, пишет отчёт и решает о выпуске, возникает конфликт интересов — особенно если она, как Anthropic, хочет выйти на IPO и бежит в гонке с Китаем. Поэтому Anthropic предлагает обязательные отчёты, независимых проверяющих и доступ государства. Ведущий не до конца верит в саму возможность: служба проверки государства под руководством Илона Маска нашла не так много, а как государство проверит сверхмодель, которую не могут проверить ни она сама, ни её создатели? После каждого релиза в моделях находят всё более фундаментальные ошибки.

33:55Фреймворк безопасности, отчёты раз в полгода, карта системы и 15 дней на инцидент

Покрываемые разработчики публикуют и обновляют фреймворк безопасности — структурированный документ о том, какие модели покрываются, какие риски и тесты, кто и когда их проводит и кто отвечает; руководство ежегодно подтверждает, что правила применяются. Отчёты по рискам — минимум раз в шесть месяцев, потому что модель может стать опаснее из-за новых инструментов или данных. Карта системы описывает способности и ограничения модели, а о критических инцидентах нужно сообщать государству в течение пятнадцати дней. Ведущий не понимает, как это заработает в США: описанное очень похоже на Китай.

39:27Экосистема оценщиков незрелая, а «shopping» удобного проверяющего превращает проверку в ритуал

Anthropic признаёт, что экосистема независимых оценщиков незрелая и её нужно развивать прямо сейчас, и называет риск shopping — «поиска удобного оценщика»: если компания выбирает не самого строгого, а самого удобного проверяющего, независимая проверка превращается в ритуал. Ведущий сравнивает это с партнёрской программой OpenAI на четыреста тысяч сертифицированных консультантов, которую считает пиар-ходом, и с Meta, где после призыва Цукерберга максимизировать токены на них уйдут миллиарды долларов. Его ощущение: «независимое» у Anthropic пока будет таким же зависимым.

42:51Безопасность — не фильтры, а защита весов; и не произвол, а правовая процедура

Anthropic различает безопасность модели от вреда и защищённость от кражи, взлома и злоупотребления: если веса украдут, их запустят без ограничений, поэтому нужна защита инфраструктуры обучения, доступа сотрудников, API и защита от дистилляции. Одновременно компания избегает слишком широкой власти государства блокировать любые модели: предлагает судебное принуждение, судебный пересмотр, ограниченную дискрецию агентств и одинаковую обработку сопоставимых моделей — правовую процедуру вместо произвола. Слабый федеральный закон не должен отменять более строгие законы штатов.

51:07Если ИИ заменит труд, проблемой станет распределение: «купить время» и три сценария безработицы

Если ИИ станет общей заменой труда, главная проблема будет не в росте, а в распределении: доходы и власть сконцентрируются у владельцев капитала, вычислительной инфраструктуры и ИИ-компаний. Политика должна «купить время» для адаптации и измерять влияние ИИ на рынок труда, а меры строятся по трём сценариям: около пяти процентов безработицы, около десяти — экономический шок с расширением поддержки доходов, и беспрецедентная структурная безработица вплоть до базового дохода. Ведущий не верит, что ИИ заберёт рабочие места, и ему не нравится, что Anthropic вообще говорит о безработице.

01:00:55Эссе Амодея и текст OpenAI: медлительность тоже риск, а кто решает — открытый вопрос

Эссе Дарио Амодея объясняет логику: образ из Толкина «не будь слишком поспешным» хорош для политики, но ИИ движется так быстро, что медлительность тоже риск, а если поставить себя на паузу, кто-то другой всё равно это создаст. Ведущий сопоставляет это с текстом OpenAI «Управление сверхинтеллектом»: особый режим, международная координация и агентство наподобие Международного агентства по атомной энергии — но кто в нём будет и кто решит, у кого могут быть модели? OpenAI делает акцент на решениях демократических государств, но именно она подписала контракт с полным доступом военных к системе.

О чём этот выпуск

Соло-выпуск ToTheMoon о документе Anthropic «Политика экспоненциального искусственного интеллекта». Александр Волчек начинает с вопроса, который считает важнее гонки OpenAI, Google, Anthropic и SpaceX: кто нажмёт стоп, если искусственный интеллект станет реально опасным. Anthropic заявила, что самые мощные модели нельзя выпускать в мир как новую кнопку в приложении, — и заявила это до того, как её модель Fable закрыли. Компания не предлагает запретить ИИ: если модель стала слишком сильной, проверять её должны не только разработчики, а государство должно иметь право остановить опасный запуск. Ведущий подчёркивает, что это касается работы, бизнеса, детей, данных и денег каждого, и ставит развилку: задушить ИИ правилами — проиграть гонку, оставить как есть — отдать решение нескольким частным компаниям.

История, на фоне которой вышел документ: Anthropic выдала Mythos ограниченному кругу компаний, США ограничили Fable для всех, кроме граждан США — под запрет попали даже сотрудники Anthropic без гражданства, — а через несколько дней после релиза Fable с огромным числом ограничений государство её заблокировало. Anthropic с блокировкой не согласна, хотя буквально за несколько дней до неё выпустила документ, где сама просит для государства красную кнопку. Приятель ведущего, только что подписавший контракт на Fable, уверен, что модель откроют: компания готовится к IPO и находится в гонке с OpenAI, Gemini и SpaceX. Ведущий считает исследования Anthropic самыми серьёзными среди четырёх лидеров.

Базовый тезис документа — ИИ развивается экспоненциально, а государственные институты, законы и суды создаются медленно; медленно реагирует даже бизнес: у ChatGPT пять миллионов платных подписок из миллиарда пользователей. К моменту, когда общество поймёт риск, опасные возможности уже могут быть развёрнуты без возврата, поэтому законы нужны заранее. Ведущий добавляет своё: модели становятся всё менее доступными, государство умеет только ограничивать, а с учётом Китая, который дистиллирует американские модели, у США нет шансов остановиться.

Документ состоит из двух частей — обязанности разработчиков и устойчивость общества — и применяется узко: только к компаниям, которые одновременно обучают модели с вычислениями свыше 10 в 25-й степени операций с плавающей точкой и имеют более $500 млн годовой выручки от ИИ или более $1 млрд расходов на R&D. Пороги должно регулярно пересматривать агентство, и ведущий ожидает, что после IPO именно Anthropic захочет пересмотреть их первой. Катастрофический риск — не ошибка чат-бота, а вред, способствующий смерти, массовому ущербу и разрушению общественной безопасности; выделены четыре зоны: биологический риск, киберриск, потеря контроля и автоматизированные исследования, где ИИ помогает разрабатывать ещё более сильный ИИ. Пример киберриска — Mythos, которая не только нашла невероятное количество уязвимостей, но и сама создала функционал для работы с ними.

Один из самых сильных тезисов Anthropic — прозрачности и самооценки недостаточно: когда компания сама выбирает тесты, пишет отчёт и решает о выпуске, возникает конфликт интересов, особенно перед IPO и в гонке с Китаем. Взамен предлагаются обязательные отчёты, независимые проверяющие и доступ государства, публикуемый фреймворк безопасности с ежегодным подтверждением руководства, отчёты по рискам минимум раз в шесть месяцев, карты систем и сообщение о критических инцидентах в течение 15 дней. Ведущий не до конца верит в саму возможность проверки: государство, чья служба проверки под руководством Илона Маска нашла не так много, вряд ли проверит сверхмодель, которую не могут проверить ни она сама, ни её создатели, а описанная структура, по его словам, очень похожа на Китай.

Anthropic признаёт, что экосистема независимых оценщиков незрелая, и называет риск «shopping» — выбора не самого строгого, а самого удобного оценщика, при котором проверка превращается в ритуал. Ведущий сравнивает это с партнёрской программой OpenAI на четыреста тысяч сертифицированных консультантов, которую считает пиар-ходом, и с Meta, где после призыва Цукерберга максимизировать токены на них уйдут миллиарды долларов. Его ощущение — «независимое» у Anthropic пока будет таким же зависимым, а сверхсистема, став сверхсистемой, сделает всё, чтобы проверяющие ничего не нашли.

Отдельно разобрана безопасность: Anthropic различает безопасность модели от вреда и защищённость от кражи весов, взлома, злоупотребления и дистилляции — фильтры ответов не спасут, если украденные веса запустят без ограничений. Компания пытается избежать и другой крайности — слишком широкой власти государства: предлагает судебное принуждение, судебный пересмотр, ограниченную дискрецию агентств и одинаковую обработку сопоставимых моделей, а слабый федеральный закон не должен автоматически отменять более строгие законы штатов. Ведущий напоминает, как в США отменяли уже принятые законы, — но США остаются демократическим институтом.

Экономический блок начинается с предположения: если ИИ станет общей заменой труда, проблемой будет распределение выгод, а доходы и власть сконцентрируются у владельцев капитала и вычислений. Anthropic предлагает «купить время» для адаптации, измерять влияние ИИ на рынок труда и строит меры по трём сценариям — около 5% безработицы, около 10% и беспрецедентная структурная, — вплоть до универсального базового дохода, который ведущий считает разговором ни о чём. Сам он не верит, что ИИ заберёт рабочие места, и ему не нравится, что Anthropic вообще говорит о безработице. Эссе Дарио Амодея добавляет образ из Толкина — медлительность тоже риск — и гипернеравенство, а текст OpenAI «Управление сверхинтеллектом» с идеей агентства наподобие Международного агентства по атомной энергии показывает отличие: OpenAI делает акцент на решениях демократических государств, но именно она подписала контракт с государством, давший военным полный доступ к системе.

Ценность выпуска в том, что документ Anthropic пересказан целиком и по пунктам — от порогов и категорий риска до отчётов, инцидентов и сценариев безработицы, — а не сведён к заголовку про красную кнопку. При этом ведущий не принимает предложение на веру: он показывает, что описанная структура похожа на китайскую, что проверить сверхсистему не могут ни государство, ни её создатели, и что «независимое» у компании перед IPO легко становится зависимым. Итог — не ответ, а честно поставленный вопрос, кто держит руку на выключателе.

Расшифровка выпуска

Голосовая связка применена к 118 сегментам: 118 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».

Читать транскрипт на отдельной странице

Загрузка…