Aikido Security выпустила Altar-1 — свою первую открытую модель безопасности. Это сжатая версия GLM-5.3 от Z.AI, рассчитанная на работу внутри инфраструктуры заказчика. Altar-1 лежит в основе Aikido Machine — автономного пентест-аппарата компании для локальных и изолированных от интернета сетей.
Веса опубликованы на Hugging Face и запускаются через vLLM на одном узле с четырьмя GPU NVIDIA H200.
Зачем понадобилась своя модель
Закрытые фронтирные модели работают на чужой инфраструктуре. Их использование означает отправку исходного кода, архитектурной документации и неисправленных находок за пределы сети. Aikido указывает на банки с требованиями к резидентности данных и операторов АСУ ТП без маршрута в интернет.
Открытые по весам модели решают проблему резидентности, но создают разрыв в развёртывании. MoE-модели вынуждены хранить всех экспертов, даже когда нагрузка задействует лишь часть из них. Агенты безопасности к тому же накапливают длительный контекст: KV-кэш конкурирует с весами модели за одну и ту же память GPU.
Как сжимали GLM-5.3
GLM-5.3 — MoE-модель на 753 млрд параметров. Каждый токен маршрутизируется к 8 из 256 экспертов на слой, что даёт около 40 млрд активных параметров.
Aikido применила два шага сжатия:
- Квантизация. Altar-1 стартует с чекпойнта
cyankiwi GLM-5.3-AWQ-INT4. AWQ хранит веса маршрутизируемых экспертов в 4 битах при 16-битных активациях (W4A16). Внимание, общий эксперт, плотные слои и голова остаются в BF16. - Прунинг экспертов. Использован Cerebras REAP (Router-weighted Expert Activation Pruning). REAP оценивает каждого эксперта по весу маршрутизатора и величине выхода, а не только по частоте выбора. Altar-1 сохраняет 168 из 256 маршрутизируемых экспертов на слой и удаляет 88 (34,4%). Дообучение не проводится.
Для калибровки использовались трассы пентест-стенда Aikido, а также код, вызов инструментов, рассуждения и многоязычные тексты Wikipedia. Компания заявляет, что данные клиентов не применялись. Каждый эксперт оценивается по его наибольшей доле в маршрутизируемой работе отдельного домена — это защищает специализированных экспертов для кода, редких языков и структурированного вывода.
Маршрутизация не изменилась: роутер по-прежнему выбирает 8 экспертов на токен, теперь из 168, при примерно 40 млрд активных параметров.
| Чекпойнт | Хранимые веса |
|---|---|
| GLM-5.3, BF16 | 1506,7 ГБ |
| GLM-5.3, AWQ INT4 | 488,2 ГБ |
| Altar-1, pruned W4A16 | 328,0 ГБ |
Altar-1 на 78,2% меньше BF16-версии и на 32,8% меньше родительского AWQ-чекпойнта. По точности расхождение (KL divergence) с полным BF16 составляет 0,506 нат на закрытой панели из 25 запросов. Сборка того же варианта в формате EXL3 даёт 0,511. Подробности — в публичном исследовании точности.
Что показал бенчмарк по CVE
Aikido протестировала Altar-1 на внутреннем бенчмарке по CVE: 32 известные уязвимости в 30 репозиториях, по 3 прогона на случай.
| Модель | Средний recall за прогон | Найдено хотя бы раз |
|---|---|---|
| GLM-5.3, BF16 | 65,6% | 25 из 32 |
| GLM-5.3, AWQ INT4 | 61,5% | 23 из 32 |
| Altar-1 | 60,4% | 23 из 32 |
По сравнению с AWQ-чекпойнтом прунинг стоил около 1 пункта recall и не сократил покрытие. Относительно родительской модели Altar-1 сохраняет 23 из 25 покрытых уязвимостей (92%) при recall ниже на 5,2 пункта.
Охват бенчмарка узкий: он измеряет повторное нахождение заданных CVE внутри конвейера, где соседние стадии выполняют другие модели. Он не измеряет слепой поиск, проверку эксплойтов или предложения по исправлению. Aikido также сообщает, что Altar-1 нашла реальную уязвимость критической severity во время производственного пентеста клиента, — это единичный результат, о котором рассказал сам вендор.
Развёртывание и лицензия
Карточка модели требует GPU Hopper (H100 или H200). Aikido утверждает, что 328 ГБ на четырёх H200 оставляют место для KV-кэша контекста 128k при производственных размерах батча.
vllm serve AikidoSec/altar-1 --tensor-parallel-size 4 --trust-remote-code --max-model-len 131072
vLLM выбирает ядро Marlin MoE автоматически. Узел с четырьмя H100 по 80 ГБ располагает лишь 320 ГБ памяти — меньше 328 ГБ весов.
Altar-1 наследует лицензию GLM-5.3. Она разрешает коммерческое использование, модификацию и распространение. Операторы Model-as-a-Service с выручкой более 10 млрд долларов за 12 месяцев должны сначала пройти проверку безопасности Z.AI. Altar-1 — открытая по весам, но не одобренная OSI открытая модель.
Помимо Aikido Machine, Altar-1 работает в Aikido Attack, AI Code Analysis и Deep Review. Дальше компания планирует пробовать форматы с меньшей разрядностью вроде EXL3, чтобы сохранять больше экспертов, а также дообучать модели под задачи безопасности.
Смежные темы: открытая модель NVIDIA NemotronLabs VoiceChat 11B с вызовом инструментов и маршрутизатор локального инференса NVIDIA PAIR — оба сюжета про запуск моделей на своём железе. Тех, кто экономит память, заинтересует и Ternary Bonsai 2 27B, ужатая до 5,93 ГБ.
Частые вопросы
Кого касается выход Altar-1?
Тех, кто не может отдавать исходный код и находки внешним облачным моделям: банки с требованиями к резидентности данных, операторы АСУ ТП и команды, работающие в изолированных сетях. Модель рассчитана на запуск внутри собственного контура.
Какой минимум железа нужен для запуска?
Один узел с четырьмя GPU NVIDIA H100 или H200. По данным Aikido, 328 ГБ весов на четырёх H200 оставляют запас под KV-кэш контекста 128k при производственных батчах.
Поместится ли модель на четыре H100 по 80 ГБ?
Нет. Такой узел даёт 320 ГБ памяти, а веса занимают 328 ГБ. Карточка модели требует именно Hopper-поколение, то есть H100 или H200.
Насколько модель потеряла в качестве?
На внутреннем бенчмарке Aikido recall за прогон упал с 65,6% у полного BF16 до 60,4% у Altar-1. Покрытие при этом почти не пострадало: модель находит хотя бы раз 23 уязвимости из 32 — столько же, сколько родительский AWQ-чекпойнт.
Что такое REAP и зачем он нужен?
Это метод прунинга экспертов от Cerebras: каждый эксперт оценивается по весу маршрутизатора и величине выхода, а не только по частоте срабатывания. Так удаётся убрать 88 из 256 экспертов на слой, не потеряв специализированные — для кода, редких языков и структурированного вывода.
Нужно ли дообучать модель после прунинга?
Нет. Aikido не проводила дообучения: сжатие свелось к квантизации AWQ INT4 и прунингу экспертов, а маршрутизация осталась прежней — 8 экспертов на токен, теперь из 168.
Можно ли использовать Altar-1 коммерчески?
Да, лицензия GLM-5.3 разрешает коммерческое использование, модификацию и распространение. Исключение — операторы Model-as-a-Service с выручкой свыше 10 млрд долларов за 12 месяцев: им нужно сначала пройти проверку безопасности Z.AI.
Это открытый исходный код?
Нет. Altar-1 открыта по весам, но не одобрена OSI как открытая модель. Лицензия накладывает дополнительное условие на крупных MaaS-операторов.
Бенчмарк доказывает, что модель находит уязвимости в реальности?
Нет. Бенчмарк измеряет повторное нахождение заранее известных CVE и не проверяет слепой поиск, валидацию эксплойтов или предложения по исправлению. Сообщение о найденной критической уязвимости в производственном пентесте — единичный результат от самого вендора.
Какие планы у Aikido дальше?
Компания собирается пробовать форматы с меньшей разрядностью, например EXL3, чтобы сохранять больше экспертов, и дообучать модели под задачи безопасности.
Источник: marktechpost.com