ИИ-агенты все чаще выполняют сложные многоэтапные задачи в корпоративной среде, напрямую взаимодействуя с контактами, календарями, файлами, браузером, платежными шлюзами, почтой и системными настройками через различные фреймворки и утилиты. В таких составных цепочках защита на уровне отдельных промптов или вызовов инструментов не спасает от общесистемных нарушений политик безопасности, поскольку угроза часто возникает лишь при последовательном выполнении безобидных по отдельности операций.
Например, бухгалтерский агент может запросить данные по зарплатам через закрытый API, передать их финансовому агенту для подготовки отчета по бюджету, а агент по продажам отправит этот документ внешнему клиенту. Хотя каждый шаг выглядит стандартно, итоговый процесс выводит конфиденциальные зарплатные данные во внешний канал без каких-либо вредоносных действий со стороны отдельных компонентов.
Разделение контуров управления с OpenAgentFlow
Чтобы устранить эту структурную уязвимость, исследователи Дуншэн Чэнь и Сюэтао Вэй из Южного университета науки и технологий, Сянъюй Чжао из Городского университета Гонконга и Синь Яо из Университета Линнань представили систему OpenAgentFlow. Архитектура разделяет уровень управления (control-plane) и уровень исполнения (action-plane), перенося проверку правил безопасности непосредственно на границу фиксации действий.
OpenAgentFlow стандартизирует действия, генерируемые графическими интерфейсами, API, внешними инструментами и языковыми моделями, в единый поток событий AgentEvent, направляя их через общий предпусковой узел контроля политик.
«Мы представляем OpenAgentFlow — архитектуру с разделением уровней управления и исполнения, которая превращает границу фиксации действий в единый интерфейс контроля безопасности».
Как пояснила команда исследователей, такое разделение позволяет вынести состояние сессии, историю происхождения данных, журналы аудита и сами политики безопасности за пределы среды выполнения конкретных агентов. Поскольку правила находятся во внешнем контуре управления, администраторы могут мгновенно внедрять обновленные регламенты для всех рабочих процессов через GUI, API и внешние инструменты без модификации или перезапуска самих агентов.
Практическая проверка в рабочих процессах
Оценка надежности системы в гетерогенных средах требует измерения как эффективности блокировки атак, так и частоты ложных срабатываний при выполнении обычных задач. В серии из 300 контролируемых тестов OpenAgentFlow продемонстрировал общую точность 94,00% и предотвратил 95,35% атак.
На полном наборе тестов AgentDojo-Traj бенчмарка TS-Bench (1220 сценариев) фреймворк сохранил точность на уровне 97,62%, зафиксировал полноту обнаружения небезопасных действий 96,59% и показал лишь 1,96% ложных вмешательств. Система столь же эффективно отслеживает сессии одиночных агентов — например, перехватывает попытки переместить контактные данные в заметки календаря перед их отправкой через почтовый клиент.
Технические реалии и внедрение в бизнесе
OpenAgentFlow подтверждает: контроль корпоративных мультиагентных систем требует сквозного отслеживания происхождения данных по всей сессии, а не изоляции отдельных моделей с помощью хрупких фильтров. Перенос проверки политик на внешнюю границу фиксации действий обеспечивает централизованную наблюдаемость без переписывания кода агентов. Однако инженерным командам следует учитывать статус прототипа: задержки обработки при перехвате событий в высоконагруженных пайплайнах и стандартизация нестандартных API определят реальную стоимость владения и интеграции перед выходом технологии в прод.