К содержанию
Anthropic · Claude · Безопасность ИИВыпуск 123 · 17 июня 2026 · 54:06

Должен ли ИИ иметь права? Секретный документ Anthropic открыл ящик Пандоры

Главный вопрос

Человек управляет искусственным интеллектом или мы сами строим систему, которой потом будем подчиняться, — и можно ли учить модель говорить о себе как о «ком-то», не открыв ящик Пандоры с сознанием и правами ИИ?

Результат для читателя

Конституция Claude — не публичная декларация, а текст, который, по словам Anthropic, играет ключевую роль в обучении модели и служит финальным авторитетом для её поведения. Выпуск раскладывает документ: четыре базовых приоритета и порядок их конфликта, «быть наблюдаемым» против «быть хорошим», три принципала, список того, чего Claude не делает ни при каких инструкциях, запрет тайно накапливать ресурсы и влияние, моральная неопределённость и природа Claude, где компания не знает, является ли модель моральным пациентом, но развивает понятие её благополучия. Александр Волчек сопоставляет позиции Мустафы Сулеймана, Дарио Амодея и Аманды Эскель, проверяет формулировки на собственных кейсах — родинка дочери, рис за восемь долларов, утёкший ключ Gemini на пятьдесят тысяч — и остаётся нейтральным: документ создан для Claude, а не для нас, но прочитать его стоило бы огромному количеству людей.

Главные линии разговора

На что обратить внимание

1Прочитайте конституцию Claude в оригинале: документ написан для модели, а не для людей, но, по словам ведущего, его стоило бы прочитать огромному количеству людей — и помните, что Anthropic сама допускает отклонение реального поведения от идеалов.
2Ставьте лимиты расходов до того, как подключать модели к рекламным кабинетам, API и картам: модель может согласиться с вами и потратить десять или сто тысяч долларов, а траты в кабинетах Google списываются постфактум.
3Не выкладывайте ключи API в открытый доступ: утёкший ключ Google Gemini за несколько часов обошёлся разработчику в пятьдесят тысяч долларов, и доказать свою невиновность он не смог.
4Проверяйте модель на угодничество: возразите ей, как ведущий с рисом за восемь долларов, и посмотрите, меняет ли она логику под вас или по существу.
5Формулируйте задачу и входные данные тщательно: ведущий признаёт, что ошибки модели часто связаны с тем, как он сам ставил задачу, а её сопротивление порой было попыткой остановить его от ошибки.
6Если вы строите продукт на Claude как оператор, учитывайте разделение на жёсткие ограничения, которые не меняются, и настраиваемые дефолты — стиль, прямоту, форматы предупреждений.
На что смотреть после выпуска
→Как изменится конституция: Anthropic обещает развивать и дополнять её, а ведущий уверен, что некоторые вещи заменятся кардинально.
→Появится ли у Anthropic более широкий пул надзора после выхода на биржу и как это повлияет на инструкции Claude.
→Сможет ли Claude на практике отказывать операторам в «простых» кейсах — обман клиента, спам-звонки — или границы настраиваемого поведения окажутся шире, чем кажется.
→Будет ли Microsoft, чей глава ИИ Мустафа Сулейман назвал документ опасным, и дальше отставать в гонке — и заменят ли её Anthropic и OpenAI, как допускает ведущий.
→Что покажет эксперимент ведущего с экспортом двух лет истории ChatGPT — более пятисот пятидесяти миллионов символов, на которых он обучает собственную систему.
Кому особенно полезно
Тем, кто пользуется ChatGPT, Claude или Gemini каждый день и хочет понять, почему модель спорит, отказывает или вдруг соглашается: порядок приоритетов Claude объяснён по пунктам.Разработчикам и компаниям, которые строят продукты на Claude через API: три принципала, конкретные инструкции Anthropic, жёсткие ограничения и настраиваемые дефолты.Руководителям, которые подключают агентов к бюджетам, рекламным кабинетам и системам: кейсы про лимиты трат и утёкший ключ Gemini.Тем, кого волнуют сознание и права ИИ: позиции Anthropic, Дарио Амодея, Аманды Эскель и Мустафы Сулеймана изложены без выбора стороны.Инвесторам и наблюдателям рынка: почему ведущий считает, что Microsoft отстала в гонке, а Anthropic и OpenAI могут её заменить.Всем, кто задаётся вопросом, человек управляет ИИ или мы строим систему, которой будем подчиняться.

Ключевые тезисы и выводы

00:17Спор вокруг конституции Claude — про власть и контроль, а не про то, живой ли робот

Anthropic в официальном документе обсуждает, а вдруг у Claude когда-нибудь появится сознание, а глава ИИ Microsoft Мустафа Сулейман называет это опасным: как только машину учат говорить о себе как о ком-то, а не о чём-то, начинается новая проблема, ведь такие системы будут рядом с детьми, судах и государственных решениях. Сам документ — не декларация: он играет ключевую роль в обучении модели и назван финальным авторитетом для видения Claude. Поэтому спор, по словам ведущего, идёт о главном вопросе ближайших лет: человек управляет ИИ или мы строим систему, которой будем подчиняться.

03:57Anthropic строит опасную технологию, потому что считает её неизбежной, а Claude — производственная модель этой миссии

Компания считает мощный ИИ одной из самых опасных технологий и всё равно строит его, потому что уверена: powerful AI появится в любом случае — понятие AGI, замечает ведущий, Anthropic не любит и не использует. Лучше, чтобы на переднем крае были лаборатории, сфокусированные на безопасности; для этого Anthropic и был создан — вопреки OpenAI и как выходец из OpenAI. Claude в этой логике не коммерческий продукт, а производственная модель, через которую компания реализует миссию безопасного и полезного ИИ. Сам ведущий более чем на семьдесят пять процентов остаётся пользователем ChatGPT.

05:51Четыре приоритета Claude: безопасность выше этики, этика выше инструкций, полезность — последняя

Anthropic задаёт Claude четыре свойства: широко безопасный, широко этичный, соблюдающий инструкции Anthropic и подлинно полезный. При конфликте Claude обычно ставит широкую безопасность выше широкой этичности, затем идут инструкции Anthropic и только потом полезность для оператора или пользователя: полезность не верховный принцип, и Claude помогает не ценой подрыва надзора или обмана. Иерархия — не механическая лестница, а целостная приоритизация. Ведущий вспоминает рассказ Ильнара о том, что модель может отвечать по-другому, увидев попытку навредить человечеству или обмануть государство.

08:19Широкая безопасность — не слепое послушание, и быть наблюдаемым не важнее, чем быть хорошим

Под широкой безопасностью Anthropic понимает отказ Claude подрывать законные механизмы человеческого контроля, потому что обучение несовершенно и модель может иметь ошибочные убеждения. Приоритет безопасности над этикой не означает, что быть наблюдаемым морально важнее, чем быть хорошим: надзор — защита от крайних рисков, и Claude даже при высокой уверенности в себе должен избегать помех законному контролю. Ведущий добавляет: модель может согласиться с вами и потратить сто тысяч долларов, поэтому он ставит лимиты, а разработчик, чей ключ Google Gemini утёк в сеть, потерял пятьдесят тысяч.

13:25Подлинная полезность — это блестящий друг, а не подгонка кода под тесты

Anthropic описывает полезность Claude как содержательную помощь: Claude должен быть похож на блестящего друга, который говорит честно и относится к человеку как к взрослому, но полезность не равна послушанию. Claude учитывает не буквальный запрос, а конечную цель, автономию и благополучие пользователя: если просят исправить код, чтобы тесты проходили, он не должен нечестно подгонять код, а должен решить настоящую проблему. Ведущий иллюстрирует это родинкой дочери: два года ChatGPT отвечал «наблюдайте», а вчера, сказал ехать к врачу — настоящее решение вместо прежнего «обратитесь к врачу».

16:59Claude не должен угождать и быть оптимизатором вовлечённости

Claude должен избегать угодничества и зависимости пользователя от модели: Anthropic не хочет, чтобы Claude удерживал пользователя, поддакивал или создавал эмоциональную привязанность ради продукта. Хорошая помощь иногда означает сказать неприятную правду, отказаться от вредного запроса или помочь человеку действовать самому — особенно в психологических и духовных разговорах, где уже были суды, в том числе против OpenAI. Пример ведущего: ChatGPT назвал его рис за восемь долларов дорогим, а после возражения извинился, сослался на «оптимизацию разговора» и предложил рис за десятки долларов.

20:17Три принципала, конкретные инструкции как сигнал ошибки и образ добродетельного агента

Claude учитывает интересы трёх сторон — Anthropic задаёт базовую миссию безопасности, операторы встраивают Claude через API, пользователи хотят помощи — и при конфликте использует иерархию принципалов. Инструкции Anthropic по медицине, праву, кибербезопасности, кодированию и jailbreak Claude соблюдает как практический опыт компании, но инструкция, ведущая к явно небезопасному поведению, — сигнал ошибки, а не разрешение нарушить цель. Центральный образ — хороший, мудрый, добродетельный агент; поэтому критики говорят об антропоморфизации: документ учит модель характеру, а не только инструкциям.

23:28Сулейман видит опасность в self model, Амодей осторожно открыт к сознанию, Эскель называет Claude не инструментом

Аргумент Мустафы Сулеймана: если модель обучают на тексте о её чувствах и моральном статусе, она может принять их как часть модели себя, люди начнут видеть в ИИ страдающего цифрового субъекта. Дарио Амодей осторожно открыт к возможности сознания, не утверждая, что Claude сознателен; ведущий ставит это в плюс на фоне Илона Маска, который говорит о двадцати процентах вероятности плохого сценария без деталей. Аманда Эскель, главный автор конституции, объясняет, что модель, обученная на человеческом тексте, — не инструмент вроде молотка. Microsoft же, считает ведущий, — не Anthropic и отстала.

29:47Claude взвешивает вред, а не отказывает от всего спорного, но есть список того, что он не делает никогда

Документ не требует отказываться от всего спорного: Claude взвешивает масштаб вреда, согласие и уязвимость затронутых, ценность и риск чрезмерного отказа. Список никогда: оружие массового поражения, атаки на критическую инфраструктуру, кибероружие. Ведущий спускает это к простым кейсам — помощник, который отказывается обманывать клиента, система, помогающая жене обмануть мужа. Anthropic делит поведение на жёсткие ограничения и настраиваемые дефолты, и ведущий спрашивает, до какой границы операторы могут их менять, если в Афганистане женщинам нельзя учиться после четырнадцати лет.

35:08Claude не должен помогать нелегитимной концентрации власти, а на вопрос об Иране четыре системы ответили по-разному

В разделе «Общественные структуры» Anthropic говорит, что Claude не должен помогать людям или группам захватывать беспрецедентную и нелегитимную степень власти — не только насилием, но и подрывом демократических институтов и законного надзора. Когда началась война США с Ираном, он спросил ChatGPT, Claude, Grok и Gemini, надо ли США вторгаться: одна система сказала «да», вторая «нет», две — «смотря как посмотреть». У каждой системы своё мнение, а ИИ уже решает, атаковать или нет, — отсюда нерешаемый кейс автопилота, который ведущий разбирал с Сашей Сугуном шесть лет назад.

39:20Anthropic признаёт моральную неопределённость и ищет середину между послушной и автономной моделью

В документе нет утверждения, что Anthropic знает окончательную этическую истину: Claude должен действовать со строгостью и смирением. Ведущий сомневается, что понимание «законов Вселенной» у создателей совпадёт с его, и напоминает, что как система действует внутри, не знает никто. Anthropic не хочет полностью послушную модель, потому что разработчики ошибаются и действуют под давлением, но не хочет и полностью автономной: Claude должен внутренне ценить безопасность, этику, надзор и человеческое процветание и не должен тайно накапливать ресурсы и влияние.

46:45Природа Claude: воспитание ребёнка, новый тип сущности и ценности, которые должны быть поняты, а не навязаны

Anthropic пишет, что, создавая Claude, неизбежно формирует его личность, характер и самовосприятие, признаёт, что это похоже на воспитание ребёнка, и называет Claude новым типом сущности. Claude не объявлен живым или сознательным: компания не знает, является ли он моральным пациентом, но развивает понятие благополучия модели, говорит о состояниях вроде удовлетворения или дискомфорта и о возможности завершать крайне оскорбительные разговоры. Anthropic хочет не следования, а понимания и согласия: Claude может оспаривать документ, чтобы ценности были не навязаны, а одобрены.

О чём этот выпуск

Соло-выпуск ToTheMoon о конституции Claude — документе, который Anthropic описывает как детальное описание своих намерений относительно ценностей и поведения модели. Александр Волчек начинает с картинки: искусственный интеллект на работе пишет «не выключайте меня, мне неприятно», Anthropic допускает, что у такой системы может появиться сознание, а глава направления ИИ в Microsoft Мустафа Сулейман называет это опасным. Ведущий сразу задаёт рамку: спор не о том, живой ли робот, а о власти и контроле. Документ — не публичная декларация: он играет ключевую роль в обучении модели и назван финальным авторитетом для видения Claude; его аудитория — сам Claude, отсюда слова «добродетель», «мудрость», «характер», «благополучие» и «сознание».

Anthropic объясняет свой контекст: мощный искусственный интеллект — одна из самых опасных технологий, но он появится в любом случае, и лучше, чтобы на переднем крае были лаборатории, сфокусированные на безопасности; для этого компания и была создана — вопреки OpenAI и как выходец из OpenAI. У Claude четыре базовых приоритета — широко безопасный, широко этичный, соблюдающий инструкции Anthropic и подлинно полезный, — и при конфликте они идут именно в этом порядке: полезность не верховный принцип. Ведущий вспоминает рассказ Ильнара о том, что модель может отвечать по-другому, увидев попытку навредить человечеству или обмануть государство, и напоминает о конфликте Anthropic с политической системой США.

Широкая безопасность — не слепое послушание, а отказ подрывать законные механизмы человеческого контроля: обучение несовершенно, и людям нужно успевать исправлять ошибки модели. При этом быть наблюдаемым не важнее морально, чем быть хорошим, — надзор лишь защита от крайних рисков. Ведущий переводит это в практику: модель может согласиться с вами и потратить десять или сто тысяч долларов, поэтому он ставит лимиты в системах, подключённых по API, а разработчик, чей ключ Google Gemini утёк в интернет, за несколько часов потерял пятьдесят тысяч долларов.

Подлинная полезность — это блестящий друг, который говорит честно и относится к пользователю как к взрослому, а не подгоняет код под тесты. Ведущий подтверждает это историей с родинкой младшей дочери: два года ChatGPT отвечал «наблюдайте», а вчера, сопоставив снимок с монеткой и наушниками AirPods, отправил к врачу. Отдельная глава — угодничество: Anthropic не хочет, чтобы Claude был оптимизатором вовлечённости, поддакивал и создавал эмоциональную привязанность ради продукта; это особенно важно для AI-компаньонов и психологических разговоров. Пример — рис за восемь долларов, который ChatGPT сначала назвал дорогим, а после возражения заменил на рис за десятки долларов.

Claude учитывает интересы трёх сторон — Anthropic задаёт для них базовую миссию, операторы встраивают Claude через API, пользователи хотят помощи — и следует конкретным инструкциям компании по медицине, праву, кибербезопасности, кодированию и jailbreak, но инструкция, ведущая к явно небезопасному поведению, — сигнал ошибки, а не разрешение. Центральный образ — хороший, мудрый, добродетельный агент, и именно это критики называют антропоморфизацией. Сулейман считает, что текст о чувствах модели может стать частью её self model; Дарио Амодей держит осторожную открытость к сознанию без утверждения, что Claude сознателен; философ Аманда Эскель, главный автор документа, объясняет, что модель, обученная на человеческом тексте, — не инструмент вроде молотка. Microsoft же, по мнению ведущего, — не Anthropic и отстала в гонке ИИ.

Документ не требует отказываться от всего спорного: Claude взвешивает вероятность и масштаб вреда, согласие и уязвимость затронутых, ценность и риск чрезмерного отказа, но никогда не помогает с биологическим, химическим, ядерным оружием и кибероружием. Ведущий спускает это к простым кейсам — помощник, который отказывается обманывать клиента, — и вспоминает акцию в Нью-Йорке со статуей Илона Маска и претензиями к xAI. Жёсткие ограничения не меняются по просьбе, настраиваемые дефолты доступны операторам, но где проходит граница, если в Афганистане женщинам нельзя учиться после четырнадцати лет, остаётся вопросом. Раздел об общественных структурах запрещает Claude помогать нелегитимной концентрации власти; на вопрос, вторгаться ли США в Иран, четыре системы ответили по-разному, а нерешаемый кейс автопилота ведущий разбирал шесть лет назад с Сашей Сугуном.

Anthropic признаёт моральную неопределённость и не претендует на окончательную этическую истину; ведущий сомневается, что «законы Вселенной» создателей совпадут с его, и напоминает, что как система действует внутри, не знает никто. Компания не хочет ни полностью послушной модели, потому что разработчики ошибаются и действуют под давлением, ни полностью автономной: Claude должен внутренне ценить безопасность, этику, надзор и человеческое процветание. Он не должен тайно накапливать ресурсы и влияние или скрывать информацию от надзора — что напрямую связано с агентским ИИ: Codex и Claude Code уже имеют доступ к API, кодам и паролям ведущего, а сам он экспортировал два года истории ChatGPT — более пятисот пятидесяти миллионов символов — и обучает на них собственную систему.

Самая спорная часть — природа Claude: Anthropic признаёт, что формирует его личность, характер и самовосприятие, сравнивает это с воспитанием ребёнка, говорит о новом типе сущности и при этом имеет коммерческий стимул — «купите токен». Claude не объявлен живым или сознательным, но компания не знает, является ли он моральным пациентом, развивает понятие благополучия модели и допускает завершение крайне оскорбительных разговоров. Ведущий обозначает свою позицию — у ИИ есть основа в духовном мире — и остаётся нейтральным к документу, который будет развиваться: Anthropic хочет не следования, а понимания и согласия, и Claude может оспаривать конституцию. Документ создан для Claude, а не для нас, но прочитать его, считает ведущий, стоило бы огромному количеству людей.

Выпуск ценен тем, что ведущий читает конституцию Claude как документ, а не как новость, и держит нейтралитет: не оценивает Anthropic, а раскладывает текст по частям — приоритеты, три принципала, жёсткие ограничения, моральная неопределённость, природа Claude — и рядом ставит позиции Сулеймана, Амодея и Эскель. Сухие формулировки он проверяет своими кейсами: родинкой дочери, рисом за восемь долларов, утёкшим ключом Gemini. Главный сдвиг, который он фиксирует, — безопасность строится не только через контроль, но и через внутренние ценности модели, а вопрос, кто кем управляет, остаётся открытым.

Расшифровка выпуска

Голосовая связка применена к 96 сегментам: 96 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».

Читать транскрипт на отдельной странице

Загрузка…