Исследователи из UC Berkeley и UT Austin представили FreeToken — движок инференса для Mixture-of-Experts моделей, который превращает персональный компьютер в единую эластичную платформу для запуска больших языковых моделей. Вместо того чтобы требовать кластер из датацентровых GPU, FreeToken непрерывно распределяет вычисления и состояние модели между GPU, CPU, памятью и пропускной способностью шины, которые реально есть в машине.
Результаты впечатляют: модель на 35 млрд параметров работает с интерактивной скоростью на ноутбучной видеокарте с 8 ГБ памяти, 284B — на игровом десктопе, а флагманская GLM-5.2 (753B параметров) — на одной видеокарте рабочей станции. Это особенно актуально на фоне того, как GLM-5.3 без переобучения базовой модели показывает скачок в коде и кибербезопасности.
Почему локальный инференс стал возможен
Архитектура Mixture-of-Experts делает локальный запуск frontier-моделей арифметически возможным. Например, DeepSeek-V4-Flash активирует лишь 6 из 256 экспертов в каждом из 43 слоёв, поэтому в обработке одного токена участвуют только 13 из 284 млрд параметров. Однако разреженность не уменьшает общий объём экспертов: при квантизации FP4 полный набор занимает около 140 ГБ.
Исследователи выделили три ключевые проблемы существующих движков (llama.cpp, KTransformers, Ollama, MoE-Infinity):
- Prefill разрушает разреженность: тысячи токенов на слой направляются почти ко всем экспертам, поэтому prefill-фаза передаёт весь пул через PCIe — около двух секунд на RTX 5090, пять на десктопах с PCIe 4.0 и десять и более на линках x8, типичных для ноутбуков.
- Статическое размещение игнорирует decode-трафик: llama.cpp назначает тензоры MoE при загрузке, KTransformers закрепляет «горячее» подмножество. Но маршрутизация меняется для каждого токена, поэтому большинство вычислений экспертов падает на CPU, пока GPU и шина PCIe простаивают.
- Потребительские CPU не справляются с остатком: двухканальная DDR5 выдаёт 80–90 ГБ/с против 1–1.8 ТБ/с, которые RTX 4090 или 5090 получают из встроенной памяти.
Три механизма FreeToken
Адаптивное к полосе пропускания исполнение (политика q*). Поскольку DMA-передачи и исполнение экспертов на CPU читают из одной подсистемы памяти, насыщенный линк PCIe оставляет остаточную полосу B_H − B_P. FreeToken разделяет кэш-промахи каждого шага: q* ≈ m × B_P / B_H экспертов заполняются в кэш GPU, остальные вычисляются на CPU, а две частичные суммы объединяются точно — без аппроксимации и модификации роутера. Обе полосы профилируются на целевой машине (команда ft bench bw): измеренное соотношение B_P:B_H составляет 52.7:77.3 на сервере с RTX 5090, но 11.8:47.5 на ноутбуке с RTX 4060.
Семантическое кэширование. Во время prefill полная двухуровневая буферизация передаёт слой l+1, пока GPU вычисляет слой l. Контрольные точки рекуррентного состояния привязаны к границам специальных токенов — блоков рассуждений, вызовов инструментов, их результатов — именно там, где агентные обвязки обрезают контекст. Поэтому повторный prefill после правки обрабатывает только новый суффикс. Во время decode общий LRU-кэш экспертов, охватывающий все слои MoE, следует за роутером, а не за размещением, зафиксированным при загрузке.
Эластичное управление памятью. В безопасных точках планировщика кэш экспертов GPU перестраивается под изменённый бюджет VRAM без перезапуска движка и перезагрузки пула в памяти хоста. Эксперты читаются с диска сразу в финальную раскладку памяти хоста и затем закрепляются; прогрев GPU не требуется — первый запрос обслуживается с холодным кэшем.
Результаты тестов
На RTX 5090 FreeToken выдаёт 77–83 ток/с для Qwen3.6-35B-A3B (BF16) и 22–25 ток/с для DeepSeek-V4-Flash (MXFP4) — в 1.5–2.3 раза быстрее сильнейшего базового движка. Скорость декодинга остаётся в пределах 12% от одноходового темпа на трёх агентных нагрузках. Худший TTFT не превышает 44 секунд; у llama.cpp этот показатель достигает 232 с, у Ollama — 179 с, у KTransformers — 946 с, что превышает таймауты агентных клиентов.
При равной ёмкости кэша (37% пула Qwen3.6) глобальный LRU-кэш пропускает 16% чтений экспертов при декодинге против 41% у KTransformers и 62% у llama.cpp. На ноутбуке с RTX 4060 (8 ГБ) сборка NVFP4 обслуживает модель 35B со скоростью 39.3 ток/с. На одной RTX PRO 6000 модель GLM-5.2 (753B, 40B активных) работает на скорости 14.9 ток/с против 7.3 ток/с у llama.cpp.
Аудит заявлений
Независимая проверка Reality Check от Marktechpost (по состоянию на 23 августа 2026) выявила несколько нюансов в подаче результатов:
- Сравнение с Codex смешивает метрики: 39.3 ток/с — это чистая скорость декодинга, тогда как 33.9 ток/с из TraceLab — нормализованная скорость, включающая TTFT. Чистая медианная скорость декодинга Codex — 57.1 ток/с.
- Заявление «92% от скорости RTX 4090» сравнивает 4-битную сборку (NVFP4) с 16-битной (BF16).
- Заголовок «753B на одной видеокарте» опускает требования к хосту: для GLM-5.2 нужно 512 ГБ DDR5 на Xeon Platinum 8559C, для 284B — 192 ГБ.
- Базовые движки в тестах работали на 6 потоках CPU, что особенно важно для KTransformers, чьё преимущество — многоядерные AMX-ядра CPU.
При этом внутренняя арифметика безупречна: все опубликованные соотношения пересчитываются из собственных графиков без ошибок. Из 16 проверенных утверждений 9 помечены как самоотчётные — код стал публичным лишь за шесть дней до аудита, независимого воспроизведения пока нет.
Как начать использовать
FreeToken распространяется под лицензией Apache-2.0, опубликован на PyPI как пакет freetoken версии 0.1.2. Установка: uv pip install "freetoken[accel]". Также доступно однокнопочное десктопное приложение для Windows и Linux на flashml.ai. CLI ориентирован на Linux x86_64 с NVIDIA GPU на драйвере r580+ (CUDA 13).
Команда ft serve открывает OpenAI- и Anthropic-совместимые эндпоинты на порту 1919, а ft launch claude подключает Claude Code, Codex, OpenCode или OpenClaw к вашему собственному компьютеру.
Инструмент рассчитан на соло-разработчиков, стартапы и инженерные команды малого бизнеса, чьи счета за агентные токены уже превышают стоимость собственной GPU. Для предприятий это путь для air-gapped или регулируемых нагрузок, а не замена датацентра. Наиболее сильные индустриальные применения — здравоохранение и юриспруденция (данные не покидают машину), оборона, финансы и R&D с интенсивной интеллектуальной собственностью. Учитывая, как управление GPU влияет на загрузку оборудования, эффективное использование одной карты становится ключевым навыком.
Частые вопросы
Что такое FreeToken и зачем он нужен?
FreeToken — это open-source движок инференса для MoE-моделей, который позволяет запускать большие языковые модели на обычных компьютерах, а не только в датацентрах. Он решает проблему стоимости: современные открытые модели с миллиардами параметров требуют кластеров GPU, тогда как FreeToken эффективно использует ресурсы одной машины.
Какие модели поддерживает FreeToken?
Движок протестирован с Qwen3.6-35B-A3B, DeepSeek-V4-Flash и GLM-5.2 (753B). В документации репозитория перечислено около 17 подтверждённых MoE-контрольных точек, хотя в анонсе заявлена поддержка более 20 моделей.
Какое железо нужно для запуска?
Для модели 35B достаточно ноутбука с 8 ГБ видеопамяти. Для 284B — игрового десктопа с 192 ГБ оперативной памяти. Для GLM-5.2 (753B) требуется одна рабочая станция с 512 ГБ DDR5 и топовой видеокартой.
Как установить FreeToken?
Установка через pip: uv pip install "freetoken[accel]". Также доступно десктопное приложение для Windows и Linux на сайте flashml.ai. Требуется Linux x86_64 с NVIDIA GPU и драйвером r580+ (CUDA 13).
Насколько честны заявленные цифры производительности?
Внутренняя арифметика в статье проверена и не содержит ошибок, но большинство замеров пока не воспроизведены независимо. Сравнение с Codex использует разные метрики, а сравнение с RTX 4090 смешивает разную точность вычислений. Стоит воспринимать цифры как ориентировочные.
Чем FreeToken отличается от llama.cpp или Ollama?
FreeToken использует адаптивное к полосе пропускания исполнение и семантическое кэширование, что даёт 1.5–2.3× ускорение декодинга по сравнению с этими движками. Он динамически распределяет вычисления между GPU и CPU на основе реальных замеров, а не статически назначает тензоры при загрузке.
Подходит ли FreeToken для бизнеса?
Да, особенно для здравоохранения, юриспруденции, финансов и обороны, где данные не должны покидать машину. Для предприятий это путь для air-gapped или регулируемых нагрузок, но не замена датацентра для массового инференса.
Какие ограничения у FreeToken?
Для больших моделей требуется значительный объём оперативной памяти хоста: 192–512 ГБ. Базовые конкуренты в тестах работали на 6 потоках CPU, что может занижать их реальную производительность. Независимого воспроизведения заявленных результатов пока нет.
Источник: marktechpost.com