Должен ли ИИ иметь права? Секретный документ Anthropic открыл ящик Пандоры
Человек управляет искусственным интеллектом или мы сами строим систему, которой потом будем подчиняться, — и можно ли учить модель говорить о себе как о «ком-то», не открыв ящик Пандоры с сознанием и правами ИИ?
Конституция Claude — не публичная декларация, а текст, который, по словам Anthropic, играет ключевую роль в обучении модели и служит финальным авторитетом для её поведения. Выпуск раскладывает документ: четыре базовых приоритета и порядок их конфликта, «быть наблюдаемым» против «быть хорошим», три принципала, список того, чего Claude не делает ни при каких инструкциях, запрет тайно накапливать ресурсы и влияние, моральная неопределённость и природа Claude, где компания не знает, является ли модель моральным пациентом, но развивает понятие её благополучия. Александр Волчек сопоставляет позиции Мустафы Сулеймана, Дарио Амодея и Аманды Эскель, проверяет формулировки на собственных кейсах — родинка дочери, рис за восемь долларов, утёкший ключ Gemini на пятьдесят тысяч — и остаётся нейтральным: документ создан для Claude, а не для нас, но прочитать его стоило бы огромному количеству людей.
На что обратить внимание
Ключевые тезисы и выводы
Anthropic в официальном документе обсуждает, а вдруг у Claude когда-нибудь появится сознание, а глава ИИ Microsoft Мустафа Сулейман называет это опасным: как только машину учат говорить о себе как о ком-то, а не о чём-то, начинается новая проблема, ведь такие системы будут рядом с детьми, судах и государственных решениях. Сам документ — не декларация: он играет ключевую роль в обучении модели и назван финальным авторитетом для видения Claude. Поэтому спор, по словам ведущего, идёт о главном вопросе ближайших лет: человек управляет ИИ или мы строим систему, которой будем подчиняться.
Компания считает мощный ИИ одной из самых опасных технологий и всё равно строит его, потому что уверена: powerful AI появится в любом случае — понятие AGI, замечает ведущий, Anthropic не любит и не использует. Лучше, чтобы на переднем крае были лаборатории, сфокусированные на безопасности; для этого Anthropic и был создан — вопреки OpenAI и как выходец из OpenAI. Claude в этой логике не коммерческий продукт, а производственная модель, через которую компания реализует миссию безопасного и полезного ИИ. Сам ведущий более чем на семьдесят пять процентов остаётся пользователем ChatGPT.
Anthropic задаёт Claude четыре свойства: широко безопасный, широко этичный, соблюдающий инструкции Anthropic и подлинно полезный. При конфликте Claude обычно ставит широкую безопасность выше широкой этичности, затем идут инструкции Anthropic и только потом полезность для оператора или пользователя: полезность не верховный принцип, и Claude помогает не ценой подрыва надзора или обмана. Иерархия — не механическая лестница, а целостная приоритизация. Ведущий вспоминает рассказ Ильнара о том, что модель может отвечать по-другому, увидев попытку навредить человечеству или обмануть государство.
Под широкой безопасностью Anthropic понимает отказ Claude подрывать законные механизмы человеческого контроля, потому что обучение несовершенно и модель может иметь ошибочные убеждения. Приоритет безопасности над этикой не означает, что быть наблюдаемым морально важнее, чем быть хорошим: надзор — защита от крайних рисков, и Claude даже при высокой уверенности в себе должен избегать помех законному контролю. Ведущий добавляет: модель может согласиться с вами и потратить сто тысяч долларов, поэтому он ставит лимиты, а разработчик, чей ключ Google Gemini утёк в сеть, потерял пятьдесят тысяч.
Anthropic описывает полезность Claude как содержательную помощь: Claude должен быть похож на блестящего друга, который говорит честно и относится к человеку как к взрослому, но полезность не равна послушанию. Claude учитывает не буквальный запрос, а конечную цель, автономию и благополучие пользователя: если просят исправить код, чтобы тесты проходили, он не должен нечестно подгонять код, а должен решить настоящую проблему. Ведущий иллюстрирует это родинкой дочери: два года ChatGPT отвечал «наблюдайте», а вчера, сказал ехать к врачу — настоящее решение вместо прежнего «обратитесь к врачу».
Claude должен избегать угодничества и зависимости пользователя от модели: Anthropic не хочет, чтобы Claude удерживал пользователя, поддакивал или создавал эмоциональную привязанность ради продукта. Хорошая помощь иногда означает сказать неприятную правду, отказаться от вредного запроса или помочь человеку действовать самому — особенно в психологических и духовных разговорах, где уже были суды, в том числе против OpenAI. Пример ведущего: ChatGPT назвал его рис за восемь долларов дорогим, а после возражения извинился, сослался на «оптимизацию разговора» и предложил рис за десятки долларов.
Claude учитывает интересы трёх сторон — Anthropic задаёт базовую миссию безопасности, операторы встраивают Claude через API, пользователи хотят помощи — и при конфликте использует иерархию принципалов. Инструкции Anthropic по медицине, праву, кибербезопасности, кодированию и jailbreak Claude соблюдает как практический опыт компании, но инструкция, ведущая к явно небезопасному поведению, — сигнал ошибки, а не разрешение нарушить цель. Центральный образ — хороший, мудрый, добродетельный агент; поэтому критики говорят об антропоморфизации: документ учит модель характеру, а не только инструкциям.
Аргумент Мустафы Сулеймана: если модель обучают на тексте о её чувствах и моральном статусе, она может принять их как часть модели себя, люди начнут видеть в ИИ страдающего цифрового субъекта. Дарио Амодей осторожно открыт к возможности сознания, не утверждая, что Claude сознателен; ведущий ставит это в плюс на фоне Илона Маска, который говорит о двадцати процентах вероятности плохого сценария без деталей. Аманда Эскель, главный автор конституции, объясняет, что модель, обученная на человеческом тексте, — не инструмент вроде молотка. Microsoft же, считает ведущий, — не Anthropic и отстала.
Документ не требует отказываться от всего спорного: Claude взвешивает масштаб вреда, согласие и уязвимость затронутых, ценность и риск чрезмерного отказа. Список никогда: оружие массового поражения, атаки на критическую инфраструктуру, кибероружие. Ведущий спускает это к простым кейсам — помощник, который отказывается обманывать клиента, система, помогающая жене обмануть мужа. Anthropic делит поведение на жёсткие ограничения и настраиваемые дефолты, и ведущий спрашивает, до какой границы операторы могут их менять, если в Афганистане женщинам нельзя учиться после четырнадцати лет.
В разделе «Общественные структуры» Anthropic говорит, что Claude не должен помогать людям или группам захватывать беспрецедентную и нелегитимную степень власти — не только насилием, но и подрывом демократических институтов и законного надзора. Когда началась война США с Ираном, он спросил ChatGPT, Claude, Grok и Gemini, надо ли США вторгаться: одна система сказала «да», вторая «нет», две — «смотря как посмотреть». У каждой системы своё мнение, а ИИ уже решает, атаковать или нет, — отсюда нерешаемый кейс автопилота, который ведущий разбирал с Сашей Сугуном шесть лет назад.
В документе нет утверждения, что Anthropic знает окончательную этическую истину: Claude должен действовать со строгостью и смирением. Ведущий сомневается, что понимание «законов Вселенной» у создателей совпадёт с его, и напоминает, что как система действует внутри, не знает никто. Anthropic не хочет полностью послушную модель, потому что разработчики ошибаются и действуют под давлением, но не хочет и полностью автономной: Claude должен внутренне ценить безопасность, этику, надзор и человеческое процветание и не должен тайно накапливать ресурсы и влияние.
Anthropic пишет, что, создавая Claude, неизбежно формирует его личность, характер и самовосприятие, признаёт, что это похоже на воспитание ребёнка, и называет Claude новым типом сущности. Claude не объявлен живым или сознательным: компания не знает, является ли он моральным пациентом, но развивает понятие благополучия модели, говорит о состояниях вроде удовлетворения или дискомфорта и о возможности завершать крайне оскорбительные разговоры. Anthropic хочет не следования, а понимания и согласия: Claude может оспаривать документ, чтобы ценности были не навязаны, а одобрены.
О чём этот выпуск
Соло-выпуск ToTheMoon о конституции Claude — документе, который Anthropic описывает как детальное описание своих намерений относительно ценностей и поведения модели. Александр Волчек начинает с картинки: искусственный интеллект на работе пишет «не выключайте меня, мне неприятно», Anthropic допускает, что у такой системы может появиться сознание, а глава направления ИИ в Microsoft Мустафа Сулейман называет это опасным. Ведущий сразу задаёт рамку: спор не о том, живой ли робот, а о власти и контроле. Документ — не публичная декларация: он играет ключевую роль в обучении модели и назван финальным авторитетом для видения Claude; его аудитория — сам Claude, отсюда слова «добродетель», «мудрость», «характер», «благополучие» и «сознание».
Anthropic объясняет свой контекст: мощный искусственный интеллект — одна из самых опасных технологий, но он появится в любом случае, и лучше, чтобы на переднем крае были лаборатории, сфокусированные на безопасности; для этого компания и была создана — вопреки OpenAI и как выходец из OpenAI. У Claude четыре базовых приоритета — широко безопасный, широко этичный, соблюдающий инструкции Anthropic и подлинно полезный, — и при конфликте они идут именно в этом порядке: полезность не верховный принцип. Ведущий вспоминает рассказ Ильнара о том, что модель может отвечать по-другому, увидев попытку навредить человечеству или обмануть государство, и напоминает о конфликте Anthropic с политической системой США.
Широкая безопасность — не слепое послушание, а отказ подрывать законные механизмы человеческого контроля: обучение несовершенно, и людям нужно успевать исправлять ошибки модели. При этом быть наблюдаемым не важнее морально, чем быть хорошим, — надзор лишь защита от крайних рисков. Ведущий переводит это в практику: модель может согласиться с вами и потратить десять или сто тысяч долларов, поэтому он ставит лимиты в системах, подключённых по API, а разработчик, чей ключ Google Gemini утёк в интернет, за несколько часов потерял пятьдесят тысяч долларов.
Подлинная полезность — это блестящий друг, который говорит честно и относится к пользователю как к взрослому, а не подгоняет код под тесты. Ведущий подтверждает это историей с родинкой младшей дочери: два года ChatGPT отвечал «наблюдайте», а вчера, сопоставив снимок с монеткой и наушниками AirPods, отправил к врачу. Отдельная глава — угодничество: Anthropic не хочет, чтобы Claude был оптимизатором вовлечённости, поддакивал и создавал эмоциональную привязанность ради продукта; это особенно важно для AI-компаньонов и психологических разговоров. Пример — рис за восемь долларов, который ChatGPT сначала назвал дорогим, а после возражения заменил на рис за десятки долларов.
Claude учитывает интересы трёх сторон — Anthropic задаёт для них базовую миссию, операторы встраивают Claude через API, пользователи хотят помощи — и следует конкретным инструкциям компании по медицине, праву, кибербезопасности, кодированию и jailbreak, но инструкция, ведущая к явно небезопасному поведению, — сигнал ошибки, а не разрешение. Центральный образ — хороший, мудрый, добродетельный агент, и именно это критики называют антропоморфизацией. Сулейман считает, что текст о чувствах модели может стать частью её self model; Дарио Амодей держит осторожную открытость к сознанию без утверждения, что Claude сознателен; философ Аманда Эскель, главный автор документа, объясняет, что модель, обученная на человеческом тексте, — не инструмент вроде молотка. Microsoft же, по мнению ведущего, — не Anthropic и отстала в гонке ИИ.
Документ не требует отказываться от всего спорного: Claude взвешивает вероятность и масштаб вреда, согласие и уязвимость затронутых, ценность и риск чрезмерного отказа, но никогда не помогает с биологическим, химическим, ядерным оружием и кибероружием. Ведущий спускает это к простым кейсам — помощник, который отказывается обманывать клиента, — и вспоминает акцию в Нью-Йорке со статуей Илона Маска и претензиями к xAI. Жёсткие ограничения не меняются по просьбе, настраиваемые дефолты доступны операторам, но где проходит граница, если в Афганистане женщинам нельзя учиться после четырнадцати лет, остаётся вопросом. Раздел об общественных структурах запрещает Claude помогать нелегитимной концентрации власти; на вопрос, вторгаться ли США в Иран, четыре системы ответили по-разному, а нерешаемый кейс автопилота ведущий разбирал шесть лет назад с Сашей Сугуном.
Anthropic признаёт моральную неопределённость и не претендует на окончательную этическую истину; ведущий сомневается, что «законы Вселенной» создателей совпадут с его, и напоминает, что как система действует внутри, не знает никто. Компания не хочет ни полностью послушной модели, потому что разработчики ошибаются и действуют под давлением, ни полностью автономной: Claude должен внутренне ценить безопасность, этику, надзор и человеческое процветание. Он не должен тайно накапливать ресурсы и влияние или скрывать информацию от надзора — что напрямую связано с агентским ИИ: Codex и Claude Code уже имеют доступ к API, кодам и паролям ведущего, а сам он экспортировал два года истории ChatGPT — более пятисот пятидесяти миллионов символов — и обучает на них собственную систему.
Самая спорная часть — природа Claude: Anthropic признаёт, что формирует его личность, характер и самовосприятие, сравнивает это с воспитанием ребёнка, говорит о новом типе сущности и при этом имеет коммерческий стимул — «купите токен». Claude не объявлен живым или сознательным, но компания не знает, является ли он моральным пациентом, развивает понятие благополучия модели и допускает завершение крайне оскорбительных разговоров. Ведущий обозначает свою позицию — у ИИ есть основа в духовном мире — и остаётся нейтральным к документу, который будет развиваться: Anthropic хочет не следования, а понимания и согласия, и Claude может оспаривать конституцию. Документ создан для Claude, а не для нас, но прочитать его, считает ведущий, стоило бы огромному количеству людей.
Выпуск ценен тем, что ведущий читает конституцию Claude как документ, а не как новость, и держит нейтралитет: не оценивает Anthropic, а раскладывает текст по частям — приоритеты, три принципала, жёсткие ограничения, моральная неопределённость, природа Claude — и рядом ставит позиции Сулеймана, Амодея и Эскель. Сухие формулировки он проверяет своими кейсами: родинкой дочери, рисом за восемь долларов, утёкшим ключом Gemini. Главный сдвиг, который он фиксирует, — безопасность строится не только через контроль, но и через внутренние ценности модели, а вопрос, кто кем управляет, остаётся открытым.
Расшифровка выпуска
Голосовая связка применена к 96 сегментам: 96 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Читать транскрипт на отдельной странице
Загрузка…