Разработчики открытого ПО и исследователи безопасности давно модифицируют модели с открытыми весами, чтобы убрать встроенные механизмы отказа (refusal behaviors). На платформе Hugging Face уже размещены тысячи версий моделей (чекпоинтов), из которых вырезаны ограничения безопасности (alignment). Однако то, что раньше оставалось уделом специализированных репозиториев, превратилось в готовую коммерческую инфраструктуру, доступную через веб-интерфейс или API.
Стартап Abliteration.ai упаковал этот процесс в управляемый облачный сервис. Компания развертывает модифицированные открытые архитектуры с полностью отключенными механизмами защиты — включая GLM-5.3 от Z.ai. Созданный в конце прошлого года и официально зарегистрированный в марте стартап берет на себя всю вычислительную инфраструктуру, избавляя клиентов от сложностей локального запуска тяжелых весов. Удаление векторов отказа без необходимости полного переобучения кардинально снижает технический порог для масштабного внедрения нецензурированных моделей.
Коммерческая модель и рынок тестирования на проникновение
Abliteration.ai позиционирует свою платформу как инструмент для наступательной кибербезопасности, тестирования на проникновение (red-teaming) и бенчмаркинга автономных ИИ-агентов — задач, которые стандартные коммерческие API категорически блокируют.
«Цель проекта — предоставить возможность проводить наступательные кибероперации, red-teaming и тестирование ИИ-агентов, то есть задачи, которые другие модели выполнять отказываются».
Спрос со стороны специалистов по безопасности обеспечил стартапу достаточный денежный поток для работы без привлечения венчурного капитала. Сооснователь проекта Девон подтвердил, что компания уже заключила соглашения на вычислительные мощности с крупнейшими облачными провайдерами, полностью финансируя их за счет выручки от клиентов, хотя переговоры с внешними инвесторами уже ведутся.
Проблемы верификации и вызовы для регуляторов
Описывая дилемму для корпоративного сектора, Эндрю Юн, руководитель исследований некоммерческой организации по безопасности CivAI, отметил: устранение защитных барьеров позволяет моделям беспрепятственно выполнять любые вредоносные запросы. Для директоров по информационной безопасности (CISO) это делает традиционную фильтрацию входных и выходных промптов бесполезной. Когда злоумышленники получают доступ к высокопроизводительным API нецензурированных моделей корпоративного уровня, службам безопасности приходится отказываться от поверхностных фильтров периметра и перестраивать защиту на основе строгой изоляции сред выполнения (sandboxing) и непрерывного внутреннего red-teaming.