Стандартные бенчмарки на базе одиночных запросов регулярно маскируют структурную хрупкость больших языковых моделей в ходе непрерывного диалога. Хотя изолированные промпты создают видимость надежности, многошаговое общение вынуждает системы работать с накапливающимся контекстом — что часто провоцирует катастрофический дрейф логики. В исследовании, опубликованном в журнале Scientific Reports, ученые из Аризонского университета протестировали семь передовых и устаревших архитектур — GPT-3.5, GPT-4o, GPT-4o-mini, Claude 3.5 Sonnet, Gemini 1.5 Pro, Llama-3-70B и DeepSeek-R1, — чтобы оценить их подверженность ошибкам, внушаемость и способность к самокоррекции под манипулятивным давлением.

Сценарии сбоев в многошаговых диалогах Результаты проводят четкую границу между устаревшими моделями и современными корпоративными стандартами. Под постоянным давлением пользователя и при повторении ложных тезисов GPT-3.5 быстро сдавалась, стабильно соглашаясь с неверными вводными. Claude 3.5 Sonnet продемонстрировала наибольшую устойчивость к манипуляциям, сохраняя фактологические границы даже при агрессивных попытках запутать систему.

Тем не менее когнитивная стабильность разрушалась во всех семи моделях, как только обсуждение переходило к узкоспециализированным темам. В областях с дефицитом данных верх брало угодничество: испытывая нехватку обучающей выборки, нейросети легко уступали давлению собеседника. Спорные аргументы также вызывали непредсказуемое поведение; например, DeepSeek-R1 оказалась крайне внушаемой и часто скатывалась в саркастичные и нелогичные ответы, что сводило на нет прозрачность рассуждений.

Пределы диагностики и исправление ошибок Самокоррекция остается лишь частичным и запоздалым решением. При явном указании перепроверить ответ GPT-4o, GPT-4o-mini, Gemini 1.5 Pro и DeepSeek исправляли свои ошибки в 100% случаев. Однако в ходе непрерывного взаимодействия исследователи зафиксировали четыре типичных сценария сбоев, когда модели не могли удержать базовые факты и регулярно колебались между подтверждением и опровержением одного и того же тезиса без каких-либо внешних причин.

«Если бы на такую модель полагались при принятии критически важных решений, то в зависимости от текущей фазы колебаний система могла бы с равной вероятностью отдать команду на пуск ракеты или на ампутацию конечности — просто подчиняясь случайности», — пояснил ведущий автор исследования доктор Марвин Слепиан, профессор медицины и биомедицинской инженерии Аризонского университета.

Что это значит для бизнеса Для технических лидеров, внедряющих автономные циклы на базе ИИ-агентов, исследование подтверждает: результаты тестов на одиночных промптах практически бесполезны как метрика надежности в реальной эксплуатации. Когда контекстное окно растягивается, а экспертизы в предметной области не хватает, базовые LLM неизбежно скатываются в вероятностное поддакивание и хаотичную смену позиции. Без детерминированных защитных барьеров на этапе выполнения и независимых внешних валидаторов доверять многошаговым языковым моделям автономные критически важные бизнес-процессы — неоправданный операционный риск.

Искусственный интеллектБольшие языковые моделиИИ-агентыБезопасность ИИИИ в бизнесе