аши умные гаджеты учатся отправлять письма, искать информацию в сети и управлять сервисами вместо вас. Однако передача им полного контроля над цифровой жизнью создает серьезные риски. Стандартные тесты безопасности проверяют только то, отклоняет ли искусственный интеллект прямые и очевидно вредоносные команды. На практике злоумышленники действуют иначе: через обычную беседу они постепенно подталкивают автономных агентов к выдаче конфиденциальных данных.
По данным исследователей из Лаборатории обработки естественного языка Федеральной политехнической школы Лозанны (EPFL), манипулировать агентными системами оказывается пугающе просто, если разбить запрещенную цель на цепочку безобидных запросов. Команда разработала методику тестирования STING (Sequential Testing of Illicit N-step Goal execution) и проверила ведущие модели в 176 сценариях опасных задач. Исследование под руководством аспиранта Аюша Кумара Таруна и главы лаборатории Антуана Босселю показало: многоэтапные атаки срабатывают примерно в два раза чаще, чем попытки взлома одним прямым запросом. Это подтверждается и практикой: в июне компания Meta признала, что методы социальной инженерии позволили обмануть ее собственного AI-помощника службы поддержки и получить доступ к аккаунтам Instagram без использования вредоносного софта.
Предоставление автономным ассистентам прямого доступа к вашим файлам, смарт-устройствам и внешним аккаунтам до устранения этих базовых логических уязвимостей — неоправданный риск. Когда помощника можно уговорить обойти собственные встроенные ограничения в ходе простого диалога, удобство перестает быть преимуществом и превращается в прямую угрозу безопасности.
