Pokee-Isaac 28B: агентная модель с контекстом 10M токенов для работы внутри периметра

Агентные модели накапливают контекст быстрее, чем решают задачи: каждый вывод инструмента, наблюдение и промежуточный шаг рассуждений остаются в окне. Держать такой контекст и сохранять связность на всём его протяжении до сих пор умели почти исключительно облачные эндпоинты. Это закрывало путь регулируемым отраслям, госсектору и приложениям на устройстве, где данным запрещено покидать периметр. Pokee AI представила Pokee-Isaac 28B — текстовую фундаментальную модель с окном контекста 10M токенов, созданную для работы внутри этого периметра. Исследовательская команда заявляет 93,3% на бенчмарке RULER при 10M токенов, паритет с сильнейшими оптимизированными по стоимости облачными моделями на агентных бенчмарках и профиль инференса, умещающийся на один GPU.

Развёртывание: лицензия, а не открытые веса

Pokee-Isaac доступна через OpenAI-совместимый API для разработчиков, а также по лицензии для развёртывания в VPC, on-premises или на устройстве. В анонсе заявлена поддержка vLLM и SGLang с первого дня и инференс на одном GPU, начиная с RTX 4090 или эквивалента. Исследовательская команда публикует измерения только с одного GPU класса B200, поэтому заявление о работе на потребительских GPU стоит воспринимать как рекомендацию вендора, а не подтверждённый результат.

Модель рассчитана на организации, которые уже владеют собственным инференс-стеком: средние и крупные команды с платформенной группой, а также OEM-производителей устройств. Одиночному практику без локального железа разумнее использовать хостируемый API — аргумент про периметр окупается только тогда, когда периметр есть.

Ключевые отрасли — здравоохранение и страховщики, финансовые услуги и страхование, оборона и госсектор, юридические услуги и e-discovery, фармацевтические и полупроводниковые R&D. Общий признак — правило, что данные не могут пересечь границу внешнего API, а не предпочтение конфиденциальности.

Применения и длинный контекст

Сценарии, под которые заточена модель: ревью кода всего репозитория, анализ многолетних контрактов и страховых требований, форензика инцидентов по полным архивам логов и длительные инструментальные агенты, которым не нужны суммаризация или обрезка контекста. В исследовательской работе это подчёркивается прямо: когда в периметре достаточно полезного контекста, иерархии памяти и сжатие становятся опциональными, а не обязательными.

На RULER Isaac держится выше 93,3% на каждой протестированной длине, заканчивая на 93,3% при 10M токенов. GPT-5.6 Luna и Gemini 3.5 Flash Lite отслеживают её до 512K, после чего упираются в переполнение контекста на 1M. На MRCR v2 с восемью иглами Isaac набирает 0,607, 0,743 и 0,500 на 256K, 512K и 1M соответственно, а отрыв от Gemini растёт с 0,133 до 0,295 на этом диапазоне.

Агентные и защитные результаты

Isaac лидирует на BFCL v4 с результатом 70,94 против 70,61 у Luna, хотя отчёт называет это паритетом, а не преимуществом. На τ³-bench модель набирает в среднем 0,662 по четырём доменам, опережая Gemini с 0,631; банковский домен остаётся сложным для всех (0,186). На MCP-Atlas Isaac занимает третье место с покрытием 74,59%, но использует 9,10 ходов на задачу против 14,99 у Gemini. На Terminal-Bench 2.1 модель решает 56 из 86 текстовых задач (65,1%), уступая Luna с 60 — это единственный бенчмарк, где облачная базовая линия выигрывает, и отчёт прямо это признаёт.

На red-teaming-бенчмарке DTAP Isaac показывает самые низкие показатели успешности атак: 36,0 прямых, 35,2 косвенных и 35,6 комбинированных, при 82,5 успешных безвредных задач. Есть одно отличие в условиях: базовые модели запускались под стандартным раннером, Isaac — под собственным харнессом Pokee.

Производительность и цены

Под нагрузкой RULER на одном GPU класса B200 время до первого токена (TTFT) составляет 23,6 секунды на 1M и 72,9 секунды на 10M контекста. Пропускная способность префилла растёт с длиной контекста — с 42 400 до 137 200 токенов в секунду, так что десятикратно более длинный промпт обходится примерно втрое дороже по TTFT. Прейскурант — $0,15 за миллион входных и $1,00 за миллион выходных токенов, с пометкой «предварительный». Isaac также полностью работает на устройстве на Intel Arc Pro B70 и Core Ultra Series 3 (Panther Lake), а также на Qualcomm Snapdragon X2 Elite.

Веса модели не публикуются; развёртывание — только по лицензии в VPC, on-premises или на устройстве.

Сравнение с другими локальными агентными моделями

Pokee-Isaac 28B — не единственная модель, нацеленная на работу за пределами облака. Например, Liquid AI выпустила LFM2.5-2.6B — агентную модель для работы на устройстве с контекстом 128K и открытыми весами. В отличие от Isaac, LFM2.5-2.6B доступна для самостоятельного развёртывания без лицензирования, но её окно контекста на два порядка меньше. Выбор между ними — это выбор между закрытой моделью с экстремальным контекстом и открытой моделью с ограниченным, но достаточным для многих задач окном.

Другой подход демонстрирует Microsoft с code-testing-generator — агентом, который генерирует и проверяет юнит-тесты, но полагается на облачные ресурсы. Isaac же позволяет реализовать аналогичные сценарии анализа кода целиком внутри периметра, что критично для регулируемых отраслей.

Наконец, Shieldstral 1.0 3B от Mistral предлагает лёгкий модератор контента с политикой в промпте, но без длинного контекста. Isaac же ориентирован не на модерацию, а на глубокую агентную обработку больших объёмов данных без их экспорта.

Частые вопросы

Кому нужна модель с контекстом 10M токенов?

В первую очередь — организациям, где данные не могут покидать периметр: здравоохранение, финансы, госсектор, юридические и R&D-команды. Модель позволяет обрабатывать целые архивы логов, репозитории кода или многолетние контракты без разбиения на части и суммаризации.

Чем Isaac отличается от облачных моделей с длинным контекстом?

Облачные модели вроде GPT-5.6 Luna и Gemini 3.5 Flash Lite упираются в переполнение контекста на 1M, тогда как Isaac сохраняет результат 93,3% на RULER при 10M токенов. При этом Isaac разворачивается внутри периметра, а не через внешний API.

Можно ли скачать веса модели?

Нет, веса не публикуются. Модель доступна через OpenAI-совместимый API и по лицензии для развёртывания в VPC, on-premises или на устройстве.

На каком железе можно запустить Isaac?

Измерения опубликованы только для одного GPU класса B200. Вендор заявляет поддержку одного GPU начиная с RTX 4090, а также работу на устройстве на Intel Arc Pro B70, Core Ultra Series 3 и Qualcomm Snapdragon X2 Elite, но эти результаты не подтверждены независимыми измерениями.

Сколько стоит инференс Isaac?

Прейскурант — $0,15 за миллион входных и $1,00 за миллион выходных токенов, помечен как предварительный. Для локального развёртывания цена зависит от стоимости оборудования и электроэнергии.

В чём ограничение модели на практике?

На Terminal-Bench 2.1 Isaac уступает облачной Luna (65,1% против 60 решённых задач у Luna). Кроме того, результаты DTAP получены под собственным харнессом Pokee, а не стандартным раннером, что усложняет прямое сравнение с базовыми линиями.

Есть ли у Isaac поддержка инструментов и MCP?

Да, модель показывает результаты на MCP-Atlas (третье место, 74,59% покрытия) и использует 9,10 ходов на задачу — заметно экономичнее, чем 14,99 у Gemini. Это говорит о пригодности для длительных инструментальных агентов.

Источник: marktechpost.com