Независимые тесты передовых моделей искусственного интеллекта всё чаще фокусируются на решении практических задач, а не на академической эрудиции. Meta выпустила Muse Spark 1.3 через платформу Muse Code и собственный API, продолжив быстрое обновление линейки корпоративных инструментов. Конфигурация xhigh уже доступна всем пользователям, тогда как более требовательная к вычислительным ресурсам версия max пока открыта в режиме ограниченного партнерского превью.

Данные платформы Artificial Analysis показывают, что модель демонстрирует максимальный прирост производительности в симулированных автономных средах. В бенчмарке τ³-Banking, который оценивает работу агентов с инструментами в виртуальной банковской инфраструктуре, версия max набрала 52%, заняв первое место в рейтинге. Конфигурация xhigh показала результат 47%, сравнявшись с Claude Fable 5.1 (max) и GLM-5.3-Flash.

Тесты на написание кода и решение профессиональных задач демонстрируют аналогичную динамику, хотя в общих зачетах модель пока уступает лидерам. В Terminal-Bench 2.1 Muse Spark 1.3 набирает 85% на версии xhigh и 86% на max, уступая Claude Fable 5.1 max с ее 91,4%. В бенчмарке GDPval-AA v2, измеряющем эффективность в реальных рабочих сценариях, Meta набрала 1709 баллов на xhigh и 1754 на max против 1853 у Claude Fable 5.1 (max).

Экономика инференса

В специализированных академических областях вне практического использования инструментов результаты модели выглядят неоднородно. На тесте GPQA Diamond Muse Spark 1.3 достигает 94%, что ниже показателей Gemini 3.8 Flash (high) с 95,3% и Grok 4.6 (high) с 94,9%.

Несмотря на отставание от лидеров в отдельных академических тестах, модель оказывает мощное ценовое давление на рынок корпоративных решений. Стоимость Muse Spark 1.3 составляет $1,25 за миллион входных токенов и $4,25 за миллион выходных токенов, что эквивалентно $0,55 за стандартную индексную задачу.

Ни одна модель с результатом от 59 баллов в Intelligence Index не обходится дешевле $0,55 за задачу от Meta.

Прямые конкуренты с аналогичным уровнем производительности обходятся от $0,94 до $1,23 за задачу. В рейтинге Intelligence Index модель Muse Spark 1.3 набирает 61 балл в версии xhigh и 62 балла на max, при этом max расходует на 62% больше токенов рассуждения.

Meta также подтвердила скорый выход версии Muse Spark с открытыми весами, что станет важным фактором при планировании корпоративных IT-бюджетов. Сочетание агрессивной ценовой политики на API и планов по открытому релизу заставляет провайдеров проприетарных экосистем пересматривать свою наценку на аналогичные агентные вычисления.

Meta AIИИ-агентыСнижение затратИИ в бизнесеБольшие языковые модели