FreeToken: движок инференса MoE запускает 753B GLM-5.2 на одной рабочей станции

Исследователи из UC Berkeley и UT Austin представили FreeToken — движок инференса для Mixture-of-Experts моделей, который превращает персональный компьютер в единую эластичную платформу для запуска больших языковых моделей. Вместо того чтобы требовать кластер из датацентровых GPU, FreeToken непрерывно распределяет вычисления и состояние модели между GPU, CPU, памятью и пропускной способностью шины, которые реально есть в машине.

Результаты впечатляют: модель на 35 млрд параметров работает с интерактивной скоростью на ноутбучной видеокарте с 8 ГБ памяти, 284B — на игровом десктопе, а флагманская GLM-5.2 (753B параметров) — на одной видеокарте рабочей станции. Это особенно актуально на фоне того, как GLM-5.3 без переобучения базовой модели показывает скачок в коде и кибербезопасности.

Почему локальный инференс стал возможен

Архитектура Mixture-of-Experts делает локальный запуск frontier-моделей арифметически возможным. Например, DeepSeek-V4-Flash активирует лишь 6 из 256 экспертов в каждом из 43 слоёв, поэтому в обработке одного токена участвуют только 13 из 284 млрд параметров. Однако разреженность не уменьшает общий объём экспертов: при квантизации FP4 полный набор занимает около 140 ГБ.

Исследователи выделили три ключевые проблемы существующих движков (llama.cpp, KTransformers, Ollama, MoE-Infinity):

  • Prefill разрушает разреженность: тысячи токенов на слой направляются почти ко всем экспертам, поэтому prefill-фаза передаёт весь пул через PCIe — около двух секунд на RTX 5090, пять на десктопах с PCIe 4.0 и десять и более на линках x8, типичных для ноутбуков.
  • Статическое размещение игнорирует decode-трафик: llama.cpp назначает тензоры MoE при загрузке, KTransformers закрепляет «горячее» подмножество. Но маршрутизация меняется для каждого токена, поэтому большинство вычислений экспертов падает на CPU, пока GPU и шина PCIe простаивают.
  • Потребительские CPU не справляются с остатком: двухканальная DDR5 выдаёт 80–90 ГБ/с против 1–1.8 ТБ/с, которые RTX 4090 или 5090 получают из встроенной памяти.

Три механизма FreeToken

Адаптивное к полосе пропускания исполнение (политика q*). Поскольку DMA-передачи и исполнение экспертов на CPU читают из одной подсистемы памяти, насыщенный линк PCIe оставляет остаточную полосу B_H − B_P. FreeToken разделяет кэш-промахи каждого шага: q* ≈ m × B_P / B_H экспертов заполняются в кэш GPU, остальные вычисляются на CPU, а две частичные суммы объединяются точно — без аппроксимации и модификации роутера. Обе полосы профилируются на целевой машине (команда ft bench bw): измеренное соотношение B_P:B_H составляет 52.7:77.3 на сервере с RTX 5090, но 11.8:47.5 на ноутбуке с RTX 4060.

Семантическое кэширование. Во время prefill полная двухуровневая буферизация передаёт слой l+1, пока GPU вычисляет слой l. Контрольные точки рекуррентного состояния привязаны к границам специальных токенов — блоков рассуждений, вызовов инструментов, их результатов — именно там, где агентные обвязки обрезают контекст. Поэтому повторный prefill после правки обрабатывает только новый суффикс. Во время decode общий LRU-кэш экспертов, охватывающий все слои MoE, следует за роутером, а не за размещением, зафиксированным при загрузке.

Эластичное управление памятью. В безопасных точках планировщика кэш экспертов GPU перестраивается под изменённый бюджет VRAM без перезапуска движка и перезагрузки пула в памяти хоста. Эксперты читаются с диска сразу в финальную раскладку памяти хоста и затем закрепляются; прогрев GPU не требуется — первый запрос обслуживается с холодным кэшем.

Результаты тестов

На RTX 5090 FreeToken выдаёт 77–83 ток/с для Qwen3.6-35B-A3B (BF16) и 22–25 ток/с для DeepSeek-V4-Flash (MXFP4) — в 1.5–2.3 раза быстрее сильнейшего базового движка. Скорость декодинга остаётся в пределах 12% от одноходового темпа на трёх агентных нагрузках. Худший TTFT не превышает 44 секунд; у llama.cpp этот показатель достигает 232 с, у Ollama — 179 с, у KTransformers — 946 с, что превышает таймауты агентных клиентов.

При равной ёмкости кэша (37% пула Qwen3.6) глобальный LRU-кэш пропускает 16% чтений экспертов при декодинге против 41% у KTransformers и 62% у llama.cpp. На ноутбуке с RTX 4060 (8 ГБ) сборка NVFP4 обслуживает модель 35B со скоростью 39.3 ток/с. На одной RTX PRO 6000 модель GLM-5.2 (753B, 40B активных) работает на скорости 14.9 ток/с против 7.3 ток/с у llama.cpp.

Аудит заявлений

Независимая проверка Reality Check от Marktechpost (по состоянию на 23 августа 2026) выявила несколько нюансов в подаче результатов:

  • Сравнение с Codex смешивает метрики: 39.3 ток/с — это чистая скорость декодинга, тогда как 33.9 ток/с из TraceLab — нормализованная скорость, включающая TTFT. Чистая медианная скорость декодинга Codex — 57.1 ток/с.
  • Заявление «92% от скорости RTX 4090» сравнивает 4-битную сборку (NVFP4) с 16-битной (BF16).
  • Заголовок «753B на одной видеокарте» опускает требования к хосту: для GLM-5.2 нужно 512 ГБ DDR5 на Xeon Platinum 8559C, для 284B — 192 ГБ.
  • Базовые движки в тестах работали на 6 потоках CPU, что особенно важно для KTransformers, чьё преимущество — многоядерные AMX-ядра CPU.

При этом внутренняя арифметика безупречна: все опубликованные соотношения пересчитываются из собственных графиков без ошибок. Из 16 проверенных утверждений 9 помечены как самоотчётные — код стал публичным лишь за шесть дней до аудита, независимого воспроизведения пока нет.

Как начать использовать

FreeToken распространяется под лицензией Apache-2.0, опубликован на PyPI как пакет freetoken версии 0.1.2. Установка: uv pip install "freetoken[accel]". Также доступно однокнопочное десктопное приложение для Windows и Linux на flashml.ai. CLI ориентирован на Linux x86_64 с NVIDIA GPU на драйвере r580+ (CUDA 13).

Команда ft serve открывает OpenAI- и Anthropic-совместимые эндпоинты на порту 1919, а ft launch claude подключает Claude Code, Codex, OpenCode или OpenClaw к вашему собственному компьютеру.

Инструмент рассчитан на соло-разработчиков, стартапы и инженерные команды малого бизнеса, чьи счета за агентные токены уже превышают стоимость собственной GPU. Для предприятий это путь для air-gapped или регулируемых нагрузок, а не замена датацентра. Наиболее сильные индустриальные применения — здравоохранение и юриспруденция (данные не покидают машину), оборона, финансы и R&D с интенсивной интеллектуальной собственностью. Учитывая, как управление GPU влияет на загрузку оборудования, эффективное использование одной карты становится ключевым навыком.

Частые вопросы

Что такое FreeToken и зачем он нужен?

FreeToken — это open-source движок инференса для MoE-моделей, который позволяет запускать большие языковые модели на обычных компьютерах, а не только в датацентрах. Он решает проблему стоимости: современные открытые модели с миллиардами параметров требуют кластеров GPU, тогда как FreeToken эффективно использует ресурсы одной машины.

Какие модели поддерживает FreeToken?

Движок протестирован с Qwen3.6-35B-A3B, DeepSeek-V4-Flash и GLM-5.2 (753B). В документации репозитория перечислено около 17 подтверждённых MoE-контрольных точек, хотя в анонсе заявлена поддержка более 20 моделей.

Какое железо нужно для запуска?

Для модели 35B достаточно ноутбука с 8 ГБ видеопамяти. Для 284B — игрового десктопа с 192 ГБ оперативной памяти. Для GLM-5.2 (753B) требуется одна рабочая станция с 512 ГБ DDR5 и топовой видеокартой.

Как установить FreeToken?

Установка через pip: uv pip install "freetoken[accel]". Также доступно десктопное приложение для Windows и Linux на сайте flashml.ai. Требуется Linux x86_64 с NVIDIA GPU и драйвером r580+ (CUDA 13).

Насколько честны заявленные цифры производительности?

Внутренняя арифметика в статье проверена и не содержит ошибок, но большинство замеров пока не воспроизведены независимо. Сравнение с Codex использует разные метрики, а сравнение с RTX 4090 смешивает разную точность вычислений. Стоит воспринимать цифры как ориентировочные.

Чем FreeToken отличается от llama.cpp или Ollama?

FreeToken использует адаптивное к полосе пропускания исполнение и семантическое кэширование, что даёт 1.5–2.3× ускорение декодинга по сравнению с этими движками. Он динамически распределяет вычисления между GPU и CPU на основе реальных замеров, а не статически назначает тензоры при загрузке.

Подходит ли FreeToken для бизнеса?

Да, особенно для здравоохранения, юриспруденции, финансов и обороны, где данные не должны покидать машину. Для предприятий это путь для air-gapped или регулируемых нагрузок, но не замена датацентра для массового инференса.

Какие ограничения у FreeToken?

Для больших моделей требуется значительный объём оперативной памяти хоста: 192–512 ГБ. Базовые конкуренты в тестах работали на 6 потоках CPU, что может занижать их реальную производительность. Независимого воспроизведения заявленных результатов пока нет.

Источник: marktechpost.com