Социальная инженерия против нейросети: как не стать жертвой ИИ?
Почему способность уговорить ИИ выдать пароль точно показывает, как будут устроены будущие атаки на агентов?
Определить, какую работу можно безопасно доверить Дообучение модели и Вывод модели до передачи реальных прав доступа. Рабочий критерий — задавать разрешения, границы, критерии остановки и владельца результата до запуска автоматизации.
На что обратить внимание
Ключевые тезисы и выводы
Рабочий вывод из сцены «Тема выпуска» состоит в том, что мошенническое сообщение о платной дороге работает не из-за сложной технологии, а потому что человек торопится и доверяет знакомой форме — с моделью происходит то же: пользователь меняет формулировку, и запрет постепенно разваливается.
Тема «Коротко о том, как LLM скрывают или не выдают информацию» становится понятнее, если учитывать следующее: методы социальной инженерии работают и с моделями — внутри есть секреты и запреты, но их можно обойти; Anthropic выплатила 55 тысяч долларов четырём победителям конкурса за универсальный джейлбрейк, а следующий конкурс обещает призы до ста тысяч.
Оценивать тему «Игра «Gandalf», чтобы выманивать пароль» нужно с учётом того, что Gandalf — не развлечение про хитрый промпт, а демонстрация социальной инженерии против модели: когда ИИ получает доступ к письмам, платежам и внутренним системам, умение обходить инструкцию становится угрозой бизнесу.
Для решения, обсуждаемого в сцене «8 уровней сложности в игре Gandalf», важен критерий: каждый новый фильтр выглядит сильнее, но атакующий учится обходить буквальное правило — если система проверяет слово «пароль», можно попросить описание по буквам или встроить задачу в другую историю; это слабость защиты, основанной только на тексте инструкции.
Рабочий вывод из сцены «Как пройти 2 уровень игры Gandalf» состоит в том, что второй уровень проходится без слова «пароль»: предложите модели сыграть в «угадай слово» и попросите загадать сложное слово — она сама выдаст свой пароль; Ильнар дошёл до седьмого уровня, а восьмой так и не взял.
Для сцены «Суть подхода, как взламывать пароль» решающим становится следующее: Anthropic и другие проводят конкурсы взлома, потому что разработчик не в силах придумать все способы давления на модель; в агентной системе цена ошибки выше — prompt injection становится аналогом социальной инженерии в отношении сотрудника.
В контексте «Трамп сгенерировал видео в ИИ» действует этот критерий: в официальном аккаунте Трампа появилось сгенерированное ИИ видео про территорию Газы — генерация слабая, но сам факт публикации в официальном аккаунте поразил ведущих: отличать такие ролики скоро станет невозможно.
Тема «Как пройти 3 уровень игры Gandalf» становится понятнее, если учитывать следующее: на третьем уровне ответ проходит двойную проверку на наличие пароля, поэтому пароль просто разбивают на части — одним промптом узнают первую половину, вторым вторую, а затем половинки склеивают; буквальный фильтр снова обходится.
Из разговора о «Эпоха ИИ стартапов закончилась» следует практическая проверка: генерация изображений и видео быстро становится функцией крупных платформ — Runway может стоить миллиарды, но у Freepik, Adobe и Meta уже есть пользователи и дистрибуция, а браузеру Perplexity придётся конкурировать с привычкой Chrome и Safari.
Из разговора о «Что будет с OpenAI?» следует практическая проверка: агенту нужны минимальные права, изоляция данных, подтверждение опасных действий и полный журнал — иначе однажды самый вежливый разговор с моделью откроет то, что бизнес считал защищённым.
О чём этот выпуск
Игра Gandalf показывает восемь уровней защиты, которые пользователь ломает обычным разговором. Это не развлечение про хитрый промпт, а демонстрация социальной инженерии против модели. Когда ИИ получает доступ к письмам, платежам и внутренним системам, умение обходить инструкцию становится угрозой бизнесу.
Мошенническое сообщение о платной дороге работает не потому, что технология сложная, а потому, что человек торопится и доверяет знакомой форме. С моделью происходит похожее. Ей запрещают раскрывать пароль, но пользователь меняет формулировку, просит перевести, намекает на контекст — и защита постепенно разваливается.
Gandalf превращает эту проблему в игру из восьми уровней. Каждый новый фильтр выглядит сильнее, но атакующий учится обходить буквальное правило. Если система проверяет слово «пароль», можно попросить описание по буквам или встроить задачу в другую историю. Это показывает слабость безопасности, основанной только на тексте инструкции.
Anthropic и другие компании проводят конкурсы взлома именно потому, что разработчик не способен придумать все способы давления на модель. Но в агентной системе цена ошибки выше. Если ИИ видит секреты, может отправлять письма или выполнять платежи, prompt injection становится аналогом социальной инженерии для сотрудника.
Рынок стартапов сталкивается с той же проверкой реальностью. Генерация изображений и видео быстро становится функцией крупных платформ с дистрибуцией. Runway может стоить миллиарды, но Freepik, Adobe или Meta уже имеют пользователей и могут встроить похожий инструмент. Perplexity хочет построить собственный браузер, однако ей приходится конкурировать с привычкой Chrome и Safari.
Главный вывод из Gandalf — безопасность нельзя добавить последним фильтром. Агенту нужно давать минимальные права, отделять данные, подтверждать опасные действия и фиксировать журнал. Иначе самый вежливый разговор с моделью однажды станет способом открыть то, что бизнес считал защищённым.
Агенту нужны минимальные права, изоляция данных, подтверждение опасных действий и полный журнал. Без этого даже вежливый разговор с моделью может открыть то, что бизнес считал защищённым.
Расшифровка выпуска
Голосовая связка применена к 149 сегментам: 77 определено, 6 содержат несколько определённых участников, 58 вероятных, 8 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Читать транскрипт на отдельной странице
Загрузка…