К содержанию
OpenAI · Anthropic · GuidelineВыпуск 156 · 28 августа 2026 · 51:28

Можно ли вообще доверять ИИ важные задачи? Проверили OpenAI, Anthropic, Google, xAI и Meta

Главный вопрос

Может ли компания-разработчик увидеть, что делает её мощная модель, заблокировать опасное действие и быстро её остановить — и что показывает первая внешняя оценка этих практик у пяти ведущих лабораторий?

Результат для читателя

Читатель получит шесть критериев контроля автономных моделей на понятном языке, фактические оценки пяти лабораторий по каждому из них и разбор двух главных ограничений самой оценки: она построена на открытых документах, а ноль может означать и отсутствие практики, и отсутствие публикации о ней.

Главные линии разговора
00:00Новая оценка OpenAI, Anthropic, Google, xAI и Meta10:216 критериев оценки13:15Критерий №1: можно ли восстановить все действия модели15:43Возможно ли вообще контролировать сверхинтеллект?19:49Кто лучше фиксирует действия своих AI-систем21:16Кто получил лучшие и худшие оценки23:23Почему xAI и Meta оказались в другой лиге24:59Неожиданный результат Google27:18Ни одна компания не дошла до 4 из 529:20Критерий №2: замечает ли монитор опасное поведение32:15Кто выигрывает по критерию №234:21Критерий №3: что ИИ нельзя делать без разрешения37:22Какой ИИ лучше по критерию №338:21Критерий №4: автоматическая аварийная остановка40:22Критерий №5: независимая проверка AI-компаний42:43Критерий №6: локализация уже произошедшего инцидента45:32Почему Anthropic получила ноль по одному критерию46:44Выводы исследования: какой ИИ оказался лучше?50:16Можно ли создать систему контроля сильнее самого ИИ?

На что обратить внимание

1Приложите шесть критериев к своей системе с агентами: что пишется в журнал, что нельзя без человека, когда всё останавливается автоматически, что делать после инцидента.
2Проверьте, переживает ли ваш журнал сам инцидент: видно ли по нему удаление и изменение записей.
3Задайте правило: если наблюдение отключилось, чувствительные операции останавливаются, а не продолжаются вслепую.
4Составьте короткий список действий, которые агент не выполняет без подтверждения человека, — начните с выхода за пределы песочницы и публикации кода наружу.
5Заранее решите, какие ключи и доступы отзываются первыми и кого извещать, если инцидент уже случился.
На что смотреть после выпуска
Появится ли у оценки вторая редакция и сдвинутся ли баллы после ответов компаний.
Как компании раскрывают практики контроля: ноль в отчёте может означать и отсутствие практики, и отсутствие публикации.
Чем закончится пауза OpenAI в обучении самых мощных моделей и вернётся ли крупнейший запланированный цикл.
Во сколько отрасли обходится контроль: оценка в 20% вычислений — ориентир, за которым стоит следить.
Появятся ли независимые проверки с настоящим глубоким доступом, а не разовые демонстрации модели.
Кому особенно полезно
Тем, кто внедряет ИИ-агентов внутри компании и отвечает за то, что они делают.Техническим руководителям, которые проектируют журналирование, мониторинг и права доступа.Основателям, оценивающим риск передачи модели доступа к коду, терминалу и инфраструктуре.Тем, кто следит за регулированием ИИ и хочет понимать, что реально измеряют такие оценки.Всем, кто хочет разобраться в безопасности ИИ по существу, а не по заголовкам.

Ключевые тезисы и выводы

04:39Оценку сделали бывшие сотрудники OpenAI

Организацию Guideline создали Пейдж Хедли и Стивен Адлер. Адлер работал в OpenAI с 2020 по 2024 год, руководил безопасностью продукта и оценкой возможностей моделей и публично сообщает, что сохраняет долю в компании. Guideline не регулятор и не сертифицированный аудитор: это собственный стандарт и оценка по нему.

10:07Речь не о чат-боте, а о модели с инструментами

Отчёт почти не касается обычных ответов чат-бота. Он про случаи, когда модель получает доступ к коду, терминалу, интернету или облачной инфраструктуре и совершает действия. Уровень вычислений для рассмотрения заимствован из калифорнийского закона.

13:15Критерий 1: журнал должен пережить инцидент

Стандарт требует сохранять 99,9% токенов внутренних запросов и ответов рискованных моделей, а по журналам — обнаруживать удаление или изменение записей. Если система наблюдения перестала работать, чувствительные операции должны автоматически останавливаться. Смысл в том, чтобы у модели не было слепой зоны, где её действия нельзя восстановить.

15:46Автор не верит, что сверхразум поддаётся журналированию

Отдельная линия выпуска: если системы действительно идут к сингулярности, само понятие контроля и журналирования внутри такой системы становится абсурдным — она сделает так, что наблюдатель не заметит отсутствия наблюдения. Автор оговаривает это как своё мнение, а не как вывод отчёта.

27:39Средняя оценка — 1,6 из пяти

Ни одна компания не дошла до четырёх из пяти. Средняя из тридцати выставленных баллов — 1,6; в двадцати двух случаях из тридцати результат два или ниже; семь оценок нулевые. Ноль читается осторожно: анализ построен на открытых материалах, поэтому он означает либо отсутствие практики, либо отсутствие публикации о ней.

29:27Критерий 2: мониторинг надо измерять, а не объявлять

Недостаточно сказать, что одна модель следит за другой: нужно измерять долю опасных действий, которую монитор действительно замечает. Стандарт перечисляет, что именно он должен ловить: обман, саботаж, обход систем вознаграждения, манипулирование людьми, избегание выключения, неразрешённые автономные действия и попытки сделать собственные рассуждения менее наблюдаемыми.

34:25Критерий 3: что нельзя делать без человека

Часть действий агент не должен выполнять сразу, даже если внутренний монитор считает их нормальными: отключить журналирование, поменять сетевые настройки, выйти из изолированной среды, опубликовать код наружу, запустить процесс в боевой инфраструктуре. Проверка или подтверждение человека — до выполнения, а не после ущерба.

38:48Критерий 4: аварийная остановка

Если агент за короткое время совершает несколько подозрительных действий, система должна сама заблокировать последующие чувствительные операции, а работа возобновляется только после проверки человеком. Это защита от сценария, когда агент шлёт десятки слегка изменённых попыток быстрее, чем сотрудники успевают разбирать предупреждения.

40:31Критерий 5: независимая проверка раз в квартал

Внешние специалисты должны регулярно получать достаточно глубокий доступ к системе контроля и пытаться найти в ней слепые зоны: отключить мониторинг, обойти ограничения, проверить, способен ли агент скрывать свои действия. Предлагаемая периодичность — раз в квартал с публикацией отчёта. Это заметно выше, чем разовая демонстрация модели исследователю.

42:53Критерий 6: план локализации инцидента

Компания должна заранее определить, какие разрешения отзываются немедленно, какие ключи и учётные записи отключаются, кого извещать внутри компании и когда сообщать государственным органам и партнёрам. Это аналог плана реагирования на крупную кибератаку, где источником проблемы оказывается собственная AI-система.

43:23Тихая подмена модели — тоже инцидент

Автор приводит свой пример того, что считает инцидентом без плана локализации: ChatGPT переключает его с дорогой модели на дешёвую посреди разговора, и ответ приходит от заметно более слабой системы. В его случае это был разбор медицинских заключений. По его оценке, такая тихая подмена задевает сотни миллионов людей и хуже, чем единичный взлом.

47:41Тройка Anthropic — за то, что система существует

Независимое исследование METR показало, что мониторы Anthropic в искусственных сценариях обнаруживали более 80% опасного поведения, — и одновременно внешний специалист нашёл простые способы отключить наблюдение, например изменить переменную среды так, чтобы трафик перестал считаться трафиком Claude Code. Тройка здесь не за надёжность, а за то, что система есть, широко применяется и её уже пробовали ломать.

49:13Пауза OpenAI и цена контроля — 20% вычислений

18 августа OpenAI замедлила разработку самых мощных моделей на две недели, приостановила часть обучения с подкреплением и оставила крупнейший запланированный цикл на паузе. По новым правилам серьёзное предупреждение должно быть рассмотрено в течение тридцати минут, а при подтверждении активность приостанавливается. Вычислительные расходы такого мониторинга компания оценила в 20% от вычислений контролируемого вывода модели.

О чём этот выпуск

Соло-выпуск о первой внешней сравнительной оценке того, насколько ведущие AI-лаборатории способны контролировать собственные модели. Оценку выпустила организация Guideline, созданная бывшими сотрудниками OpenAI — Пейдж Хедли и Стивеном Адлером, который с 2020 по 2024 год руководил в компании безопасностью продукта и публично сообщает, что сохраняет в ней долю. Оценивались OpenAI, Anthropic, Google, xAI и Meta по шкале от нуля до пяти.

Речь идёт не о чат-боте, а о модели, которой дали инструменты: доступ к коду, терминалу, интернету, облачной инфраструктуре. Шесть критериев разбираются по очереди: журналирование действий модели, измеримая эффективность мониторинга, предварительное разрешение опасных действий, автоматическая аварийная остановка, независимая проверка извне и план локализации уже случившегося инцидента.

Картина по цифрам получилась жёсткая. Средняя из тридцати выставленных оценок — 1,6 из пяти, в двадцати двух случаях из тридцати результат два или ниже, семь оценок нулевые. Ни одна компания не дошла до четвёрки. Лучшие — Anthropic и OpenAI, обе с C+; Google почти вдвое ниже, xAI и Meta, по словам автора, в другой лиге. При этом Anthropic получила ноль по плану локализации инцидента, а её тройка за мониторинг, как объясняется в выпуске, — не за надёжность системы, а за то, что система вообще существует и её уже пробовали ломать снаружи.

Автор параллельно ведёт свою линию: он не верит, что сверхинтеллект в принципе поддаётся журналированию, считает счёт токенов сомнительной единицей измерения и приводит собственный пример инцидента, который волнует его больше взломов, — тихую подмену дорогой модели на дешёвую посреди разговора о медицинских заключениях.

Оценка меряет не безопасность моделей, а зрелость описанных практик контроля — и по этой мерке отрасль находится в начале пути: средний балл 1,6 из пяти, лучший результат C+. Полезнее всего в выпуске не рейтинг компаний, а сами шесть критериев: они прикладываются к любой собственной системе с агентами — что записывается в журнал, что нельзя выполнять без человека, когда всё автоматически останавливается и что делать после инцидента. Финальный вопрос автор оставляет открытым: можно ли вообще построить систему контроля сильнее той, которую строят сами лаборатории.

Расшифровка выпуска

Голосовая связка применена к 87 сегментам: 87 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».

Загрузка…