Можно ли вообще доверять ИИ важные задачи? Проверили OpenAI, Anthropic, Google, xAI и Meta
Может ли компания-разработчик увидеть, что делает её мощная модель, заблокировать опасное действие и быстро её остановить — и что показывает первая внешняя оценка этих практик у пяти ведущих лабораторий?
Читатель получит шесть критериев контроля автономных моделей на понятном языке, фактические оценки пяти лабораторий по каждому из них и разбор двух главных ограничений самой оценки: она построена на открытых документах, а ноль может означать и отсутствие практики, и отсутствие публикации о ней.
На что обратить внимание
Ключевые тезисы и выводы
Организацию Guideline создали Пейдж Хедли и Стивен Адлер. Адлер работал в OpenAI с 2020 по 2024 год, руководил безопасностью продукта и оценкой возможностей моделей и публично сообщает, что сохраняет долю в компании. Guideline не регулятор и не сертифицированный аудитор: это собственный стандарт и оценка по нему.
Отчёт почти не касается обычных ответов чат-бота. Он про случаи, когда модель получает доступ к коду, терминалу, интернету или облачной инфраструктуре и совершает действия. Уровень вычислений для рассмотрения заимствован из калифорнийского закона.
Стандарт требует сохранять 99,9% токенов внутренних запросов и ответов рискованных моделей, а по журналам — обнаруживать удаление или изменение записей. Если система наблюдения перестала работать, чувствительные операции должны автоматически останавливаться. Смысл в том, чтобы у модели не было слепой зоны, где её действия нельзя восстановить.
Отдельная линия выпуска: если системы действительно идут к сингулярности, само понятие контроля и журналирования внутри такой системы становится абсурдным — она сделает так, что наблюдатель не заметит отсутствия наблюдения. Автор оговаривает это как своё мнение, а не как вывод отчёта.
Ни одна компания не дошла до четырёх из пяти. Средняя из тридцати выставленных баллов — 1,6; в двадцати двух случаях из тридцати результат два или ниже; семь оценок нулевые. Ноль читается осторожно: анализ построен на открытых материалах, поэтому он означает либо отсутствие практики, либо отсутствие публикации о ней.
Недостаточно сказать, что одна модель следит за другой: нужно измерять долю опасных действий, которую монитор действительно замечает. Стандарт перечисляет, что именно он должен ловить: обман, саботаж, обход систем вознаграждения, манипулирование людьми, избегание выключения, неразрешённые автономные действия и попытки сделать собственные рассуждения менее наблюдаемыми.
Часть действий агент не должен выполнять сразу, даже если внутренний монитор считает их нормальными: отключить журналирование, поменять сетевые настройки, выйти из изолированной среды, опубликовать код наружу, запустить процесс в боевой инфраструктуре. Проверка или подтверждение человека — до выполнения, а не после ущерба.
Если агент за короткое время совершает несколько подозрительных действий, система должна сама заблокировать последующие чувствительные операции, а работа возобновляется только после проверки человеком. Это защита от сценария, когда агент шлёт десятки слегка изменённых попыток быстрее, чем сотрудники успевают разбирать предупреждения.
Внешние специалисты должны регулярно получать достаточно глубокий доступ к системе контроля и пытаться найти в ней слепые зоны: отключить мониторинг, обойти ограничения, проверить, способен ли агент скрывать свои действия. Предлагаемая периодичность — раз в квартал с публикацией отчёта. Это заметно выше, чем разовая демонстрация модели исследователю.
Компания должна заранее определить, какие разрешения отзываются немедленно, какие ключи и учётные записи отключаются, кого извещать внутри компании и когда сообщать государственным органам и партнёрам. Это аналог плана реагирования на крупную кибератаку, где источником проблемы оказывается собственная AI-система.
Автор приводит свой пример того, что считает инцидентом без плана локализации: ChatGPT переключает его с дорогой модели на дешёвую посреди разговора, и ответ приходит от заметно более слабой системы. В его случае это был разбор медицинских заключений. По его оценке, такая тихая подмена задевает сотни миллионов людей и хуже, чем единичный взлом.
Независимое исследование METR показало, что мониторы Anthropic в искусственных сценариях обнаруживали более 80% опасного поведения, — и одновременно внешний специалист нашёл простые способы отключить наблюдение, например изменить переменную среды так, чтобы трафик перестал считаться трафиком Claude Code. Тройка здесь не за надёжность, а за то, что система есть, широко применяется и её уже пробовали ломать.
18 августа OpenAI замедлила разработку самых мощных моделей на две недели, приостановила часть обучения с подкреплением и оставила крупнейший запланированный цикл на паузе. По новым правилам серьёзное предупреждение должно быть рассмотрено в течение тридцати минут, а при подтверждении активность приостанавливается. Вычислительные расходы такого мониторинга компания оценила в 20% от вычислений контролируемого вывода модели.
О чём этот выпуск
Соло-выпуск о первой внешней сравнительной оценке того, насколько ведущие AI-лаборатории способны контролировать собственные модели. Оценку выпустила организация Guideline, созданная бывшими сотрудниками OpenAI — Пейдж Хедли и Стивеном Адлером, который с 2020 по 2024 год руководил в компании безопасностью продукта и публично сообщает, что сохраняет в ней долю. Оценивались OpenAI, Anthropic, Google, xAI и Meta по шкале от нуля до пяти.
Речь идёт не о чат-боте, а о модели, которой дали инструменты: доступ к коду, терминалу, интернету, облачной инфраструктуре. Шесть критериев разбираются по очереди: журналирование действий модели, измеримая эффективность мониторинга, предварительное разрешение опасных действий, автоматическая аварийная остановка, независимая проверка извне и план локализации уже случившегося инцидента.
Картина по цифрам получилась жёсткая. Средняя из тридцати выставленных оценок — 1,6 из пяти, в двадцати двух случаях из тридцати результат два или ниже, семь оценок нулевые. Ни одна компания не дошла до четвёрки. Лучшие — Anthropic и OpenAI, обе с C+; Google почти вдвое ниже, xAI и Meta, по словам автора, в другой лиге. При этом Anthropic получила ноль по плану локализации инцидента, а её тройка за мониторинг, как объясняется в выпуске, — не за надёжность системы, а за то, что система вообще существует и её уже пробовали ломать снаружи.
Автор параллельно ведёт свою линию: он не верит, что сверхинтеллект в принципе поддаётся журналированию, считает счёт токенов сомнительной единицей измерения и приводит собственный пример инцидента, который волнует его больше взломов, — тихую подмену дорогой модели на дешёвую посреди разговора о медицинских заключениях.
Оценка меряет не безопасность моделей, а зрелость описанных практик контроля — и по этой мерке отрасль находится в начале пути: средний балл 1,6 из пяти, лучший результат C+. Полезнее всего в выпуске не рейтинг компаний, а сами шесть критериев: они прикладываются к любой собственной системе с агентами — что записывается в журнал, что нельзя выполнять без человека, когда всё автоматически останавливается и что делать после инцидента. Финальный вопрос автор оставляет открытым: можно ли вообще построить систему контроля сильнее той, которую строят сами лаборатории.
Расшифровка выпуска
Голосовая связка применена к 87 сегментам: 87 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Загрузка…