Языковые модели, заменяющие отсутствующих сотрудников на онлайн-совещаниях, сталкиваются с фундаментальной проблемой координации. Дело не в качестве генерации текста: ИИ-делегаты попросту не способны вовремя распознавать моменты для реплик в реальном времени. Стандартные решения на базе прямых промптов во время активных дискуссий почти всегда молчат, оставляя интересы отсутствующих участников без защиты.
Провал простых промптов
Когда ИИ-делегаты работают исключительно за счет подачи расшифровки диалога в промпт, они полностью теряют тайминг беседы. В тестах на корпусе AMI такие агенты промолчали в 51,4% случаев, когда отсутствующий человек должен был взять слово. Подобная пассивность возникает из-за неспособности базовых LLM отслеживать право на реплику, позиции участников и степень закрытия конкретных тем повестки.
В тестах на базе AMI простые промпт-агенты молчат в 51,4% ситуаций, требующих прямого вмешательства делегата.
Простое увеличение контекстного окна не спасает положение. Исследователи зафиксировали: масштабирование контекста не помогает вовремя вступить в диалог, так как длинные стенограммы сами по себе не улучшают логику отслеживания динамики групповой беседы.
Модульный цикл и структурирование состояний
Чтобы преодолеть этот барьер, исследователи Муниб Хан, Фредерик Кирштайн, Терри Руас и Бела Гипп из Гёттингенского университета разработали CAPA (Collaborative Agent Predictive Architecture). Система опирается на контур принятия решений в реальном времени, который разделяет анализ состояния дискуссии и генерацию реплик с помощью специализированных модулей.
В ядре системы компонент Perceiver обновляет структурированное состояние встречи после каждой реплики. CAPA отслеживает критически важные поля: тему, решения, вопросы, позиции сторон, раскрытие повестки и владение словом. Модуль Predictor прогнозирует развитие беседы, а Controller решает, нужно ли вмешиваться, и выбирает нужный тезис. Generator формулирует высказывание в персональном стиле сотрудника, а два судьи оценивают точность прогноза и действия относительно следующей реальной реплики, передавая данные модулю Recalibrator для корректировки следующих шагов.
Результаты тестов и снижение пассивности
Явное представление состояния встречи кратно повысило точность реакций агента. На выборке из 137 встреч корпуса AMI архитектура CAPA сократила долю неуместного молчания ИИ-делегата с 51,4% до 2,5%.
Кроме того, система вдвое увеличила показатель успешных своевременных интервенций — с 26,1 до 52,2 пункта при уровне галлюцинаций всего 0,6%. Эксперименты подтверждают: ключевым фактором стало именно поддержание структурированного состояния диалога. Это сместило ошибки модели с полного пропуска реплик на мелкие неточности в формулировках.
Переход от пассивной генерации саммари к полноценному автономному представительству на совещаниях требует постоянного учета динамики диалога, а не простой передачи контекста в LLM. Хотя CAPA решила проблему пассивности на бенчмарках, практическое внедрение в корпоративные процессы теперь зависит от устойчивости системы к перебиваниям и работе с узкой терминологией в условиях строгих ограничений по задержке ответа.