К содержанию
OpenAI · Apple · Искусственный интеллектВыпуск 047 · 2 марта 2025 · 45:54

Социальная инженерия против нейросети: как не стать жертвой ИИ?

Главный вопрос

Почему способность уговорить ИИ выдать пароль точно показывает, как будут устроены будущие атаки на агентов?

Результат для читателя

Определить, какую работу можно безопасно доверить Дообучение модели и Вывод модели до передачи реальных прав доступа. Рабочий критерий — задавать разрешения, границы, критерии остановки и владельца результата до запуска автоматизации.

Главные линии разговора

На что обратить внимание

1Сопоставьте блоки «Тема выпуска» и «8 уровней сложности в игре Gandalf»: они дают разные критерии оценки одной темы.
2Проверьте вывод из блока «Суть подхода, как взламывать пароль» на собственном сценарии — что действительно меняется в процессе, а что остаётся обещанием.
3До выбора продукта или подхода зафиксируйте ограничение, раскрытое в блоке «Что будет с OpenAI?».
4Определите владельца результата и метрику качества для ситуации, описанной в блоке «Как пройти 2 уровень игры Gandalf».
На что смотреть после выпуска
→Следите за действиями Anthropic и Apple, которые подтверждают или опровергают ключевые тезисы выпуска.
→Сравнивайте новые запуски и изменения условий с блоком «Суть подхода, как взламывать пароль»: поменялись ли доступ, качество, цена или ограничения.
→Проверяйте, становится ли сценарий из блока «Как пройти 2 уровень игры Gandalf» повторяемой практикой, а не разовой демонстрацией.
Кому особенно полезно
медиамаркетологампользователям социальных сетейпользователям ИИпродуктовым командамруководителям

Ключевые тезисы и выводы

00:40Мошенническое сообщение о платной дороге работает не потому, что технология сложная, а потому, что человек торопится и доверяет знакомой форме

Рабочий вывод из сцены «Тема выпуска» состоит в том, что мошенническое сообщение о платной дороге работает не из-за сложной технологии, а потому что человек торопится и доверяет знакомой форме — с моделью происходит то же: пользователь меняет формулировку, и запрет постепенно разваливается.

03:16Что меняется в реальной работе: коротко о том, как LLM скрывают или не

Тема «Коротко о том, как LLM скрывают или не выдают информацию» становится понятнее, если учитывать следующее: методы социальной инженерии работают и с моделями — внутри есть секреты и запреты, но их можно обойти; Anthropic выплатила 55 тысяч долларов четырём победителям конкурса за универсальный джейлбрейк, а следующий конкурс обещает призы до ста тысяч.

05:19Почему контекст важнее одного показателя: игра «Gandalf», чтобы выманивать пароль

Оценивать тему «Игра «Gandalf», чтобы выманивать пароль» нужно с учётом того, что Gandalf — не развлечение про хитрый промпт, а демонстрация социальной инженерии против модели: когда ИИ получает доступ к письмам, платежам и внутренним системам, умение обходить инструкцию становится угрозой бизнесу.

05:56Gandalf превращает эту проблему в игру из восьми уровней

Для решения, обсуждаемого в сцене «8 уровней сложности в игре Gandalf», важен критерий: каждый новый фильтр выглядит сильнее, но атакующий учится обходить буквальное правило — если система проверяет слово «пароль», можно попросить описание по буквам или встроить задачу в другую историю; это слабость защиты, основанной только на тексте инструкции.

11:00Практический смысл темы: как пройти 2 уровень игры Gandalf

Рабочий вывод из сцены «Как пройти 2 уровень игры Gandalf» состоит в том, что второй уровень проходится без слова «пароль»: предложите модели сыграть в «угадай слово» и попросите загадать сложное слово — она сама выдаст свой пароль; Ильнар дошёл до седьмого уровня, а восьмой так и не взял.

12:00Anthropic и другие компании проводят конкурсы взлома именно потому, что разработчик не способен придумать все способы давления на модель

Для сцены «Суть подхода, как взламывать пароль» решающим становится следующее: Anthropic и другие проводят конкурсы взлома, потому что разработчик не в силах придумать все способы давления на модель; в агентной системе цена ошибки выше — prompt injection становится аналогом социальной инженерии в отношении сотрудника.

18:43Что определяет итог: трамп сгенерировал видео в ИИ

В контексте «Трамп сгенерировал видео в ИИ» действует этот критерий: в официальном аккаунте Трампа появилось сгенерированное ИИ видео про территорию Газы — генерация слабая, но сам факт публикации в официальном аккаунте поразил ведущих: отличать такие ролики скоро станет невозможно.

21:50Почему одного анонса недостаточно: как пройти 3 уровень игры Gandalf

Тема «Как пройти 3 уровень игры Gandalf» становится понятнее, если учитывать следующее: на третьем уровне ответ проходит двойную проверку на наличие пароля, поэтому пароль просто разбивают на части — одним промптом узнают первую половину, вторым вторую, а затем половинки склеивают; буквальный фильтр снова обходится.

23:59Рынок проверяет это применением: эпоха ИИ стартапов закончилась

Из разговора о «Эпоха ИИ стартапов закончилась» следует практическая проверка: генерация изображений и видео быстро становится функцией крупных платформ — Runway может стоить миллиарды, но у Freepik, Adobe и Meta уже есть пользователи и дистрибуция, а браузеру Perplexity придётся конкурировать с привычкой Chrome и Safari.

36:27Главный вывод из Gandalf — безопасность нельзя добавить последним фильтром

Из разговора о «Что будет с OpenAI?» следует практическая проверка: агенту нужны минимальные права, изоляция данных, подтверждение опасных действий и полный журнал — иначе однажды самый вежливый разговор с моделью откроет то, что бизнес считал защищённым.

О чём этот выпуск

Игра Gandalf показывает восемь уровней защиты, которые пользователь ломает обычным разговором. Это не развлечение про хитрый промпт, а демонстрация социальной инженерии против модели. Когда ИИ получает доступ к письмам, платежам и внутренним системам, умение обходить инструкцию становится угрозой бизнесу.

Мошенническое сообщение о платной дороге работает не потому, что технология сложная, а потому, что человек торопится и доверяет знакомой форме. С моделью происходит похожее. Ей запрещают раскрывать пароль, но пользователь меняет формулировку, просит перевести, намекает на контекст — и защита постепенно разваливается.

Gandalf превращает эту проблему в игру из восьми уровней. Каждый новый фильтр выглядит сильнее, но атакующий учится обходить буквальное правило. Если система проверяет слово «пароль», можно попросить описание по буквам или встроить задачу в другую историю. Это показывает слабость безопасности, основанной только на тексте инструкции.

Anthropic и другие компании проводят конкурсы взлома именно потому, что разработчик не способен придумать все способы давления на модель. Но в агентной системе цена ошибки выше. Если ИИ видит секреты, может отправлять письма или выполнять платежи, prompt injection становится аналогом социальной инженерии для сотрудника.

Рынок стартапов сталкивается с той же проверкой реальностью. Генерация изображений и видео быстро становится функцией крупных платформ с дистрибуцией. Runway может стоить миллиарды, но Freepik, Adobe или Meta уже имеют пользователей и могут встроить похожий инструмент. Perplexity хочет построить собственный браузер, однако ей приходится конкурировать с привычкой Chrome и Safari.

Главный вывод из Gandalf — безопасность нельзя добавить последним фильтром. Агенту нужно давать минимальные права, отделять данные, подтверждать опасные действия и фиксировать журнал. Иначе самый вежливый разговор с моделью однажды станет способом открыть то, что бизнес считал защищённым.

Агенту нужны минимальные права, изоляция данных, подтверждение опасных действий и полный журнал. Без этого даже вежливый разговор с моделью может открыть то, что бизнес считал защищённым.

Расшифровка выпуска

Голосовая связка применена к 149 сегментам: 77 определено, 6 содержат несколько определённых участников, 58 вероятных, 8 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».

Читать транскрипт на отдельной странице

Загрузка…