Операционные расходы на инференс языковых моделей по-прежнему жестко привязаны к пропускной способности памяти, форматам представления параметров и строгим аппаратным ограничениям. Хотя обучение сверхнизкобитных архитектур с нуля требует колоссальных вычислительных бюджетов, пост-тренировочная конвертация позволяет сжимать уже готовые чекпоинты. В техническом препринте исследователи OneBit AI Анирудх Малик, Пуджит Деван и М. Спарш Мехра оценили сквозной пайплайн пост-тренировочной тернаризации, применив его напрямую к модели Qwen3-4B с инструктивным дообучением.
Пайплайн квантования и объем памяти
Экспериментальный рабочий процесс объединяет вращение KOTMS, тернаризацию E2M-ATQ и компенсацию ошибок GPTQ для создания весового формата W1.58A16, сохраняя активации модели в полной 16-битной точности. Конвертация затронула только линейные слои, обеспечив эффективный бюджет в 1,641 бита на вес.
Такое агрессивное сокращение параметров напрямую привело к резкому уменьшению объема занимаемой оперативной памяти при физической упаковке весов.
«Компрессия успешно продемонстрирована, однако ускорение работы в продакшене остается нерешенной инженерной задачей».
Согласно данным бенчмарков OneBit AI, упаковка весов без потерь позволила сжать исходный чекпоинт с 8,29 ГиБ до 3,96 ГиБ. Математическая решетка тернарных весов занимает вдвое меньше места в хранилище без потери точности нелинейных слоев. Это открывает реалистичный путь для запуска моделей класса 4B на бюджетном потребительском оборудовании и слабых периферийных устройствах.
Компромиссы по точности и узкие места производительности
Вполне ожидаемо, что столь радикальное сжатие отразилось на возможностях модели. В десяти оценочных бенчмарках средняя точность снизилась с 64,5% в FP16 до 54,7% в W1.58A16 — падение составило 9,8 процентного пункта. Перплексия моделирования языка ухудшилась аналогично: на датасете WikiText-2 показатель вырос с 13,639 в FP16 до 18,748 в W1.58A16, продемонстрировав схожую деградацию на PTB и C4.
Качественное ухудшение результатов оказалось крайне неравномерным. Базовые рассуждения на основе здравого смысла и удержание контекста сохранились на приемлемом уровне, тогда как поиск фактологической информации пострадал значительно сильнее. Но главное ограничение кроется в другом: сокращение физического размера весов не принесло никакого реального ускорения выполнения инференса.
Для технических лидеров пост-тренировочная тернаризация доказывает, что модель на 4B параметров можно уместить в лимит 3,96 ГиБ RAM без дорогостоящего цикла переобучения. Однако до появления специализированных низкобитных вычислительных ядер этот подход лишь обменивает фактологическую глубину на экономию памяти. Это жизнеспособный компромисс для автономных агентов на edge-устройствах с жестким лимитом RAM, но узкое место для задач, требующих высокой скорости генерации.