Google перевела федерированное обучение в TEE: Gboard обучается с проверяемой дифференциальной приватностью

Google Research представила систему федерированного обучения (Federated Learning, FL) нового поколения, построенную на доверенных средах исполнения (Trusted Execution Environments, TEE). Заявлено, что впервые для FL обеспечены внешне проверяемые гарантии центральной дифференциальной приватности (Differential Privacy, DP).

Федерированное обучение Google внедрила ещё в 2017 году — на нём работают предсказание следующего слова и Smart Compose в Gboard, подсказки ответов в Google Messages и Smart Text Selection в Android. Но у прежних схем был разрыв в доверии: устройства загружали данные для немедленной агрегации, однако сторонний наблюдатель не мог убедиться, что эти данные не логировались и не просматривались. Secure Aggregation добавляла криптографическую защиту, но была несовместима с передовыми алгоритмами центральной DP вроде matrix factorization DP-FTRL. Кроме того, приходилось доверять Google в том, что шум DP добавляется корректно.

Что изменилось: вычисления переехали на сервер

Новая архитектура переносит вычисление клиентских градиентов на сервер и делает эту серверную логику аттестуемой — доверие к оператору больше не требуется. Система опирается на более раннюю работу Google по confidential federated analytics и координирует четыре ключевых компонента.

Загрузка данных. Устройства шифруют обучающие примеры локально и заранее задают политику доступа — перечень TEE-вычислений, которым разрешено обрабатывать эти данные. Политики обязаны попадать в публичный журнал прозрачности.

KMS и проверка политик. Система управления ключами (Key Management System), построенная из TEE, работающих на протоколе консенсуса RAFT, выдаёт ключи только тем рабочим нагрузкам, которые соответствуют политике.

Исполнение нагрузок. Корневая TEE запускает цикл обучения на Python и делегирует подзадачи рабочим TEE. Оркестрация использует Federated Language, производный от TensorFlow Federated. Наружу отдаются только веса DP-модели.

Отказоустойчивое восстановление. Каждый раунд сохраняет зашифрованное через KMS состояние восстановления на случай сбоя корневой или рабочей TEE.

Почему гарантию приватности можно проверить

Политики доступа публикуются в Rekor — публичном журнале прозрачности от Sigstore. Внешние аудиторы могут отследить каждую серверную нагрузку, которой устройство потенциально может отдать данные. KMS и бинарники обработки данных воспроизводимо собираются из открытого исходного кода.

Политики напрямую описывают программу обучения на Python. Чтобы защитить проприетарные архитектуры моделей, TEE поддерживают подгрузку сериализованной логики во время выполнения. Но вся логика, значимая для приватности, должна оставаться жёстко зашитой в аттестуемой программе. Операторы нагрузок видят только метрики и веса DP-модели. Зашифрованные данные можно расшифровать лишь ограниченное время после загрузки.

Что получил Gboard

На новой системе Gboard запустил модели предсказания следующего слова для английского и японского языков — с более сильными гарантиями приватности и улучшенной точностью. Этому способствовали два проектных решения.

Во-первых, все загрузки собираются до запуска серверного обучения. Суточные колебания доступности устройств больше не замедляют тренировку: программа может рассчитать оптимальный график участия и подстроить параметры DP. Кривые соотношения приватности и полезности Google получила, обучив английскую модель за 5000 раундов на когортах из 6500 устройств в обеих системах.

Во-вторых, узкое место сместилось на сервер. Раньше обучение каждой FL-модели занимало от 1 до 2 месяцев. Теперь тренировка распараллеливается по машинам и ограничена только доступностью ресурсов TEE. Google сообщает о существенно более быстрых вычислениях, но конкретную цифру ускорения не публикует.

Как это соотносится с другими FL-фреймворками

Google противопоставляет свою систему нескольким известным проектам. Клиентские обновления в ней вычисляются в серверных TEE, тогда как NVIDIA FLARE считает их на каждом участвующем узле, Flower — на клиентах, а Apple pfl-research — только в симуляции и не предназначен для сторонних развёртываний.

Аппаратная поддержка TEE есть у решения Google (на базе Project Oak) и у NVIDIA FLARE (AMD SEV-SNP, Intel TDX, NVIDIA GPU confidential computing), но не входит в ядро Flower и отсутствует у pfl-research. Центральная DP с внешней проверяемостью заявлена только у Google; у NVIDIA FLARE — DP-фильтры и DP-SGD через Opacus, у Flower — центральная и локальная DP, у pfl-research — локальные и центральные механизмы. Публичный журнал прозрачности серверного кода ведёт только Google (Sigstore Rekor), воспроизводимые сборки TEE тоже только у него. Лицензия у всех четырёх проектов — Apache 2.0.

Что это значит для инженера

Практическая ценность схемы в том, что доверие к оператору заменяется проверяемыми артефактами: журналом Rekor, воспроизводимыми сборками и аттестацией TEE. Для команд, которые строят собственные федеративные пайплайны, это ориентир: приватность становится свойством инфраструктуры, а не обещанием в документации. Обратная сторона — цена: серверные TEE, KMS на RAFT и журнал прозрачности требуют инфраструктуры, которой у большинства небольших проектов нет. Посмотреть, как Google строит ИИ-инструменты вокруг приватности, можно и на других примерах — например, в разборе набора навыков Mantis для ИИ-агентов и в материале про локальные модели Hermes Desktop.

Частые вопросы

Что такое TEE простыми словами?

Доверенная среда исполнения — изолированная область процессора, которая выполняет код так, что даже оператор сервера не может заглянуть внутрь или подменить логику. В системе Google именно в TEE идёт обучение, а наружу отдаются только веса DP-модели.

Чем это отличается от обычного федерированного обучения?

В классической схеме градиенты считаются на устройствах, а сервер лишь агрегирует их. Здесь вычисление клиентских градиентов перенесено на серверные TEE, а серверная логика сделана аттестуемой, поэтому доверять оператору не требуется.

Почему Secure Aggregation оказалась недостаточной?

Она давала криптографическую защиту, но была несовместима с передовыми алгоритмами центральной DP, например matrix factorization DP-FTRL. Кроме того, корректность добавления шума DP всё равно оставалась на доверии к Google.

Как сторонний аудитор проверяет приватность?

Политики доступа публикуются в Rekor, публичном журнале прозрачности Sigstore. Аудитор может проследить, какие серверные нагрузки могли получить данные устройства, а KMS и бинарники обработки данных воспроизводимо собираются из открытого кода.

Где это уже работает?

В Gboard — на моделях предсказания следующего слова для английского и японского языков. Они запущены с более сильными гарантиями приватности и улучшенной точностью.

Насколько быстрее стало обучение?

Раньше каждая FL-модель обучалась от 1 до 2 месяцев. Теперь тренировка распараллеливается по машинам и упирается только в доступность ресурсов TEE. Google сообщает о существенном ускорении, но точную цифру не приводит.

Под какой лицензией открыт код?

Apache 2.0 — как и у проектов для сравнения (NVIDIA FLARE, Flower, Apple pfl-research). Открыты основные бинарники TEE и Federated Language.

Можно ли развернуть это у себя?

Google публикует репозиторий Confidential Federated Compute и описывает компоненты системы, но для работы нужны серверные TEE, KMS на RAFT и журнал прозрачности — инфраструктура, доступная далеко не каждой организации.

Источник: marktechpost.com