Эпоха налога на видеопамять подходит к концу. Долгое время высокая стоимость корпоративного вывода данных служила защитным рвом для бигтеха: модели с 70 миллиардами параметров требовали дорогостоящих GPU-кластеров только для того, чтобы уместиться в памяти. AirLLM фактически пробил эту стену, изменив экономический расчет и позволив запускать те же массивные модели на потребительском оборудовании. Согласно технической документации, фреймворк позволяет моделям 70B функционировать на одной видеокарте с 4 ГБ памяти — и не за счет привычных компромиссов вроде квантования или прунинга, а благодаря хирургически точной технике послойной загрузки, которая использует видеопамять как транзитную станцию, а не постоянный склад.

Технический финал аппаратных ограничений

Настоящий сдвиг парадигмы заключается в том, как AirLLM v3.0 работает с архитектурами Sparse Mixture of Experts (MoE). Благодаря внедрению потоковой передачи экспертов (expert-streaming), фреймворк теперь может запускать DeepSeek-V3 — гиганта на 671 млрд параметров — примерно на 12 ГБ VRAM. Кульминацией этого процесса стала поддержка Kimi K3, крупнейшей на данный момент опенсорс-модели с 2,8 трлн параметров.

Для работы Kimi K3 требуются три условия: сжатые тензоры, flash-attn и сборка torch под CUDA 12, что позволяет модели на 2,8 Т запускаться на VRAM объемом менее 4 ГБ.

За счет потоковой передачи только тех конкретных экспертов, к которым фактически направляется токен, AirLLM удерживает объем занимаемой памяти Kimi K3 на уровне всего 3,72 ГБ на RTX 6000 Ada. Это эффективно отделяет интеллект модели от масштаба аппаратного обеспечения. Узкое место сместилось: чистый объем памяти GPU больше не является потолком; теперь темп работы диктует эффективность локального стека данных и пропускная способность при передаче с диска на GPU.

Перенос капитальных затрат с кластеров на периферийные устройства

Для технических директоров и владельцев бизнеса это прямой удар по традиционной стратегии развития инфраструктуры. Развертывание модели уровня Llama 3.1 405B раньше требовало либо огромных капитальных вложений в многоузловые системы, либо разорительных регулярных счетов за облачные вычисления. Данные AirLLM показывают, что Llama 3.1 405B теперь может работать на 8 ГБ VRAM, в то время как модель Qwen2.5-235B обходится всего 3 ГБ.

AirLLM радикально снижает потребление памяти при инференсе, позволяя большим языковым моделям 70B работать на одной видеокарте с 4 ГБ памяти без квантования, дистилляции или прунинга.

Разумеется, стоит учитывать реальное положение дел: за это приходится платить задержкой. Загрузка весов с диска по определению медленнее, чем их хранение в видеопамяти. Однако с введением предварительной выборки (prefetching) в версии 2.5 для совмещения вычислений и загрузки, AirLLM удалось отыграть 10% скорости. Для компаний, которые ставят конфиденциальность данных и экономию выше скорости чата в реальном времени — например, при асинхронной обработке документов или решении сложных логических задач, — серверный кластер официально превратился из технической необходимости в роскошь для нетерпеливых.

Локальный инференс перестал быть привилегией для тех, у кого глубокие карманы; теперь он возможен на стандартном MacBook или бюджетном ПК. По мере того как модели вроде Kimi K3 приближают опенсорсный интеллект к отметке в 3 триллиона параметров, возможность запускать их на 4 ГБ VRAM демократизирует ИИ передового уровня. Главным препятствием для локального корпоративного ИИ теперь является не стоимость железа, а инженерная воля к оптимизации того, что уже стоит на рабочем столе.

Большие языковые моделиЛокальный ИИОпенсорс ИИСнижение затратПроизводительность