Переход от простых языковых моделей без сохранения состояния к автономным ИИ-агентам обнажил критическую архитектурную уязвимость — отравление долговременной памяти. В корпоративных системах, где агенты сохраняют контекст между сессиями, строят планы выполнения и вызывают внешние API, постоянная память превращается в удобную мишень для атак. Исследование команды ученых под руководством Хадис Каримипур из Университета Калгари показало: вредоносные инструкции, внедренные в память агента, могут незаметно спать на протяжении десятков чистых сессий, а затем внезапно инициировать несанкционированные вызовы инструментов или утечку данных.

Злоумышленнику больше не нужен постоянный контроль над активной сессией. Вредоносная нагрузка попадает в доверенную базу агента через непроверенные входные данные, парсинг сайтов или ответы сторонних интеграций. Система ведет себя штатно до тех пор, пока определенный контекстный триггер не активирует отравленный вектор, перехватывая управление инструментами и доступ к корпоративным API втайне от оператора.

Проблемы точечного аудита безопасности

Чтобы измерить масштабы подобных угроз, исследователи из Университета Калгари смоделировали 2 614 многошаговых сценариев атак на LLM-агентов с активной памятью. Анализ проводился по четырем направлениям: отравление цепочек рассуждений, переписывание политик безопасности, закладка триггеров бэкдоров и постепенный дрейф контекста.

«В частности, атаки с постепенным дрейфом и скрытыми триггерами легко обходят проверки отдельных шагов, проявляя вредоносный эффект лишь в последующих взаимодействиях».

Классические проверки периметра в момент передачи запроса здесь системно бессильны. Оценка агента сразу после загрузки данных покажет ложный зеленый статус, поскольку опасная инструкция остается пассивной до появления нужного контекста. Траектория риска нелинейна: агент может демонстрировать абсолютно безопасное поведение на промежуточных этапах, прежде чем выполнить вредоносный вызов к API.

Траекторный подход к защите

Считать долговременную память агента доверенной зоной — грубая ошибка корпоративных архитекторов безопасности. Фильтрация только входящих промптов оставляет векторные базы данных, RAG-индексы и постоянные хранилища ключей-значений абсолютно беззащитными перед скрытым заражением.

Нейтрализация подобной угрозы требует обязательной санитизации данных перед записью в память, изоляции прав доступа на уровне отдельных инструментов по принципу наименьших привилегий и регулярного аудита векторных эмбеддингов. Инженерам по кибербезопасности необходимо переходить от разовых проверок к непрерывному мониторингу всей траектории поведения агента на длинной дистанции.

ИИ-агентыБезопасность ИИКибербезопасностьRAG и векторный поиск