Агентные модели накапливают контекст быстрее, чем решают задачи: каждый вывод инструмента, наблюдение и промежуточный шаг рассуждений остаются в окне. Держать такой контекст и сохранять связность на всём его протяжении до сих пор умели почти исключительно облачные эндпоинты. Это закрывало путь регулируемым отраслям, госсектору и приложениям на устройстве, где данным запрещено покидать периметр. Pokee AI представила Pokee-Isaac 28B — текстовую фундаментальную модель с окном контекста 10M токенов, созданную для работы внутри этого периметра. Исследовательская команда заявляет 93,3% на бенчмарке RULER при 10M токенов, паритет с сильнейшими оптимизированными по стоимости облачными моделями на агентных бенчмарках и профиль инференса, умещающийся на один GPU.
Развёртывание: лицензия, а не открытые веса
Pokee-Isaac доступна через OpenAI-совместимый API для разработчиков, а также по лицензии для развёртывания в VPC, on-premises или на устройстве. В анонсе заявлена поддержка vLLM и SGLang с первого дня и инференс на одном GPU, начиная с RTX 4090 или эквивалента. Исследовательская команда публикует измерения только с одного GPU класса B200, поэтому заявление о работе на потребительских GPU стоит воспринимать как рекомендацию вендора, а не подтверждённый результат.
Модель рассчитана на организации, которые уже владеют собственным инференс-стеком: средние и крупные команды с платформенной группой, а также OEM-производителей устройств. Одиночному практику без локального железа разумнее использовать хостируемый API — аргумент про периметр окупается только тогда, когда периметр есть.
Ключевые отрасли — здравоохранение и страховщики, финансовые услуги и страхование, оборона и госсектор, юридические услуги и e-discovery, фармацевтические и полупроводниковые R&D. Общий признак — правило, что данные не могут пересечь границу внешнего API, а не предпочтение конфиденциальности.
Применения и длинный контекст
Сценарии, под которые заточена модель: ревью кода всего репозитория, анализ многолетних контрактов и страховых требований, форензика инцидентов по полным архивам логов и длительные инструментальные агенты, которым не нужны суммаризация или обрезка контекста. В исследовательской работе это подчёркивается прямо: когда в периметре достаточно полезного контекста, иерархии памяти и сжатие становятся опциональными, а не обязательными.
На RULER Isaac держится выше 93,3% на каждой протестированной длине, заканчивая на 93,3% при 10M токенов. GPT-5.6 Luna и Gemini 3.5 Flash Lite отслеживают её до 512K, после чего упираются в переполнение контекста на 1M. На MRCR v2 с восемью иглами Isaac набирает 0,607, 0,743 и 0,500 на 256K, 512K и 1M соответственно, а отрыв от Gemini растёт с 0,133 до 0,295 на этом диапазоне.
Агентные и защитные результаты
Isaac лидирует на BFCL v4 с результатом 70,94 против 70,61 у Luna, хотя отчёт называет это паритетом, а не преимуществом. На τ³-bench модель набирает в среднем 0,662 по четырём доменам, опережая Gemini с 0,631; банковский домен остаётся сложным для всех (0,186). На MCP-Atlas Isaac занимает третье место с покрытием 74,59%, но использует 9,10 ходов на задачу против 14,99 у Gemini. На Terminal-Bench 2.1 модель решает 56 из 86 текстовых задач (65,1%), уступая Luna с 60 — это единственный бенчмарк, где облачная базовая линия выигрывает, и отчёт прямо это признаёт.
На red-teaming-бенчмарке DTAP Isaac показывает самые низкие показатели успешности атак: 36,0 прямых, 35,2 косвенных и 35,6 комбинированных, при 82,5 успешных безвредных задач. Есть одно отличие в условиях: базовые модели запускались под стандартным раннером, Isaac — под собственным харнессом Pokee.
Производительность и цены
Под нагрузкой RULER на одном GPU класса B200 время до первого токена (TTFT) составляет 23,6 секунды на 1M и 72,9 секунды на 10M контекста. Пропускная способность префилла растёт с длиной контекста — с 42 400 до 137 200 токенов в секунду, так что десятикратно более длинный промпт обходится примерно втрое дороже по TTFT. Прейскурант — $0,15 за миллион входных и $1,00 за миллион выходных токенов, с пометкой «предварительный». Isaac также полностью работает на устройстве на Intel Arc Pro B70 и Core Ultra Series 3 (Panther Lake), а также на Qualcomm Snapdragon X2 Elite.
Веса модели не публикуются; развёртывание — только по лицензии в VPC, on-premises или на устройстве.
Сравнение с другими локальными агентными моделями
Pokee-Isaac 28B — не единственная модель, нацеленная на работу за пределами облака. Например, Liquid AI выпустила LFM2.5-2.6B — агентную модель для работы на устройстве с контекстом 128K и открытыми весами. В отличие от Isaac, LFM2.5-2.6B доступна для самостоятельного развёртывания без лицензирования, но её окно контекста на два порядка меньше. Выбор между ними — это выбор между закрытой моделью с экстремальным контекстом и открытой моделью с ограниченным, но достаточным для многих задач окном.
Другой подход демонстрирует Microsoft с code-testing-generator — агентом, который генерирует и проверяет юнит-тесты, но полагается на облачные ресурсы. Isaac же позволяет реализовать аналогичные сценарии анализа кода целиком внутри периметра, что критично для регулируемых отраслей.
Наконец, Shieldstral 1.0 3B от Mistral предлагает лёгкий модератор контента с политикой в промпте, но без длинного контекста. Isaac же ориентирован не на модерацию, а на глубокую агентную обработку больших объёмов данных без их экспорта.
Частые вопросы
Кому нужна модель с контекстом 10M токенов?
В первую очередь — организациям, где данные не могут покидать периметр: здравоохранение, финансы, госсектор, юридические и R&D-команды. Модель позволяет обрабатывать целые архивы логов, репозитории кода или многолетние контракты без разбиения на части и суммаризации.
Чем Isaac отличается от облачных моделей с длинным контекстом?
Облачные модели вроде GPT-5.6 Luna и Gemini 3.5 Flash Lite упираются в переполнение контекста на 1M, тогда как Isaac сохраняет результат 93,3% на RULER при 10M токенов. При этом Isaac разворачивается внутри периметра, а не через внешний API.
Можно ли скачать веса модели?
Нет, веса не публикуются. Модель доступна через OpenAI-совместимый API и по лицензии для развёртывания в VPC, on-premises или на устройстве.
На каком железе можно запустить Isaac?
Измерения опубликованы только для одного GPU класса B200. Вендор заявляет поддержку одного GPU начиная с RTX 4090, а также работу на устройстве на Intel Arc Pro B70, Core Ultra Series 3 и Qualcomm Snapdragon X2 Elite, но эти результаты не подтверждены независимыми измерениями.
Сколько стоит инференс Isaac?
Прейскурант — $0,15 за миллион входных и $1,00 за миллион выходных токенов, помечен как предварительный. Для локального развёртывания цена зависит от стоимости оборудования и электроэнергии.
В чём ограничение модели на практике?
На Terminal-Bench 2.1 Isaac уступает облачной Luna (65,1% против 60 решённых задач у Luna). Кроме того, результаты DTAP получены под собственным харнессом Pokee, а не стандартным раннером, что усложняет прямое сравнение с базовыми линиями.
Есть ли у Isaac поддержка инструментов и MCP?
Да, модель показывает результаты на MCP-Atlas (третье место, 74,59% покрытия) и использует 9,10 ходов на задачу — заметно экономичнее, чем 14,99 у Gemini. Это говорит о пригодности для длительных инструментальных агентов.
Источник: marktechpost.com