К содержанию
OpenAI · Apple · Искусственный интеллектВыпуск 047 · 2 марта 2025 · 45:54

Социальная инженерия против нейросети: как не стать жертвой ИИ?

Главный вопрос

Почему способность уговорить ИИ выдать пароль точно показывает, как будут устроены будущие атаки на агентов?

Результат для читателя

Определить, какую работу можно безопасно доверить Дообучение модели и Вывод модели до передачи реальных прав доступа. Рабочий критерий — задавать разрешения, границы, критерии остановки и владельца результата до запуска автоматизации.

Главные линии разговора

На что обратить внимание

1Сопоставьте блоки «Тема выпуска» и «8 уровней сложности в игре Gandalf»: они дают разные критерии оценки одной темы.
2Проверьте вывод из блока «Суть подхода, как взламывать пароль» на собственном сценарии — что действительно меняется в процессе, а что остаётся обещанием.
3До выбора продукта или подхода зафиксируйте ограничение, раскрытое в блоке «Что будет с OpenAI?».
4Определите владельца результата и метрику качества для ситуации, описанной в блоке «Как пройти 2 уровень игры Gandalf».
На что смотреть после выпуска
Следите за действиями Anthropic и Apple, которые подтверждают или опровергают ключевые тезисы выпуска.
Сравнивайте новые запуски и изменения условий с блоком «Суть подхода, как взламывать пароль»: поменялись ли доступ, качество, цена или ограничения.
Проверяйте, становится ли сценарий из блока «Как пройти 2 уровень игры Gandalf» повторяемой практикой, а не разовой демонстрацией.
Кому особенно полезно
медиамаркетологампользователям социальных сетейпользователям ИИпродуктовым командамруководителям

Ключевые тезисы и выводы

00:40Мошенническое сообщение о платной дороге работает не потому, что технология сложная, а потому, что человек торопится и доверяет знакомой форме

Рабочий вывод из сцены «Тема выпуска» состоит в том, что фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.

03:16Что меняется в реальной работе: коротко о том, как LLM скрывают или не

Тема «Коротко о том, как LLM скрывают или не выдают информацию» становится понятнее, если учитывать следующее: смысл упирается в исполнимость правила и распределение ответственности, а не в сам факт появления нового требования.

05:19Почему контекст важнее одного показателя: игра «Gandalf», чтобы выманивать пароль

Оценивать тему «Игра «Gandalf», чтобы выманивать пароль» нужно с учётом того, что практическая граница проходит по правам агента, видимости его действий, журналу операций и возможности остановить выполнение.

05:56Gandalf превращает эту проблему в игру из восьми уровней

Для решения, обсуждаемого в сцене «8 уровней сложности в игре Gandalf», важен критерий: фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.

11:00Практический смысл темы: как пройти 2 уровень игры Gandalf

Рабочий вывод из сцены «Как пройти 2 уровень игры Gandalf» состоит в том, что конфликт показывает, какие права, деньги и рычаги контроля стороны считают стратегическими.

12:00Anthropic и другие компании проводят конкурсы взлома именно потому, что разработчик не способен придумать все способы давления на модель

Для сцены «Суть подхода, как взламывать пароль» решающим становится следующее: практическая граница проходит по правам агента, видимости его действий, журналу операций и возможности остановить выполнение.

18:43Что определяет итог: трамп сгенерировал видео в ИИ

В контексте «Трамп сгенерировал видео в ИИ» действует этот критерий: один тест измеряет узкую способность; рабочая ценность появляется только при повторяемом результате, понятной цене и контроле ошибок.

21:50Почему одного анонса недостаточно: как пройти 3 уровень игры Gandalf

Тема «Как пройти 3 уровень игры Gandalf» становится понятнее, если учитывать следующее: один тест измеряет узкую способность; рабочая ценность появляется только при повторяемом результате, понятной цене и контроле ошибок.

23:59Рынок проверяет это применением: эпоха ИИ стартапов закончилась

Из разговора о «Эпоха ИИ стартапов закончилась» следует практическая проверка: здесь важны не одна сумма и не один раунд: запас времени, переход к следующему финансированию и способность удержать клиента показывают устойчивость бизнеса.

36:27Главный вывод из Gandalf — безопасность нельзя добавить последним фильтром

Из разговора о «Что будет с OpenAI?» следует практическая проверка: фрагмент уточняет механизм, который стоит за темой, и показывает ограничение, без которого общий вывод был бы слишком простым.

О чём этот выпуск

Игра Gandalf показывает восемь уровней защиты, которые пользователь ломает обычным разговором. Это не развлечение про хитрый промпт, а демонстрация социальной инженерии против модели. Когда ИИ получает доступ к письмам, платежам и внутренним системам, умение обходить инструкцию становится угрозой бизнесу.

Мошенническое сообщение о платной дороге работает не потому, что технология сложная, а потому, что человек торопится и доверяет знакомой форме. С моделью происходит похожее. Ей запрещают раскрывать пароль, но пользователь меняет формулировку, просит перевести, намекает на контекст — и защита постепенно разваливается.

Gandalf превращает эту проблему в игру из восьми уровней. Каждый новый фильтр выглядит сильнее, но атакующий учится обходить буквальное правило. Если система проверяет слово «пароль», можно попросить описание по буквам или встроить задачу в другую историю. Это показывает слабость безопасности, основанной только на тексте инструкции.

Anthropic и другие компании проводят конкурсы взлома именно потому, что разработчик не способен придумать все способы давления на модель. Но в агентной системе цена ошибки выше. Если ИИ видит секреты, может отправлять письма или выполнять платежи, prompt injection становится аналогом социальной инженерии для сотрудника.

Рынок стартапов сталкивается с той же проверкой реальностью. Генерация изображений и видео быстро становится функцией крупных платформ с дистрибуцией. Runway может стоить миллиарды, но Freepik, Adobe или Meta уже имеют пользователей и могут встроить похожий инструмент. Perplexity хочет построить собственный браузер, однако ей приходится конкурировать с привычкой Chrome и Safari.

Главный вывод из Gandalf — безопасность нельзя добавить последним фильтром. Агенту нужно давать минимальные права, отделять данные, подтверждать опасные действия и фиксировать журнал. Иначе самый вежливый разговор с моделью однажды станет способом открыть то, что бизнес считал защищённым.

Агенту нужны минимальные права, изоляция данных, подтверждение опасных действий и полный журнал. Без этого даже вежливый разговор с моделью может открыть то, что бизнес считал защищённым.

Расшифровка выпуска

Голосовая связка применена к 149 сегментам: 77 определено, 6 содержат несколько определённых участников, 58 вероятных, 8 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».

Загрузка…