Microsoft SkillOpt: навыки ИИ-агентов переносятся между Codex и Claude Code

SkillOpt — оптимизатор в текстовом пространстве, разработанный командой исследователей из Microsoft, Шанхайского университета Цзяо Тун, Университета Тунцзи и Университета Фудань. Инструмент обучает один документ-навык на естественном языке, пока целевая модель остаётся замороженной. Модель-оптимизатор читает оценки прогонов и предлагает ограниченные правки: добавить, удалить или заменить. Отдельная валидационная выборка принимает правку только тогда, когда оценка строго улучшается. Итоговый артефакт — один файл best_skill.md.

Перенос между моделями: внутри одного семейства

Навыки обучались на GPT-5.4 и разворачивались на младших вариантах модели. В таблицах три колонки: Baseline — результат без навыка, Direct — навык, обученный SkillOpt прямо на этой модели, Transferred — навык, обученный в другом месте и применённый без дополнительной оптимизации.

На SpreadsheetBench модель GPT-5.4-mini сохраняет 82% прироста от внутридоменного обучения: 47.5 против 45.5. Это почти бесплатное переиспользование. На LiveMath для GPT-5.4-nano картина необычная: перенесённый навык даёт 28.8, тогда как обученный внутридоменно — 27.2; авторы читают это как свидетельство того, что часть выученных процедур не зависит от целевой модели. Слабое место — SpreadsheetBench на GPT-5.4-nano с сохранением лишь 16%. Удержание неравномерно, и работа этого не скрывает: заявленная граница уже, ни одна строка не опускается ниже базового уровня без навыка. Все четыре строки остаются внутри одного семейства GPT — перенос между семействами, например с GPT на Qwen, не тестировался.

Перенос между средами: сильнейший результат

Самая важная для практики часть — перенос между средами выполнения агентов. Здесь все строки используют GPT-5.5. Навык, оптимизированный внутри Codex, поднял Claude Code на SpreadsheetBench с 22.1 до 81.8 — чуть выше 80.4, которых Claude Code достиг, обучая собственный навык с нуля (102% сохранения прироста). Обратный перенос, Claude Code → Codex, сохраняет 76%. А вот LiveMath переносится плохо: Codex → Claude Code удерживает всего 10% прироста.

Две среды предоставляют разные API инструментов и файлов и разные поверхности команд. Навык, переживающий такой сдвиг, не кодирует команды. Авторы объясняют портируемость SpreadsheetBench процедурами уровня рабочей книги: осмотр структуры в первую очередь, проверка с учётом формул и материализация статических значений — они работают независимо от того, какой CLI запускает Python. Процедурные навыки — как проверять, верифицировать и форматировать — переносятся хорошо; навыки, тяжёлые по рассуждениям, оказываются сильнее привязаны к среде обучения.

Почему артефакт вообще перемещается

Все три режима выполнения — прямой чат, Codex, Claude Code — потребляют один и тот же формат файла best_skill.md. Среда Codex рендерит текущий навык в per-task SKILL.md рядом с файлами задачи, а затем читает компактный трейс выполнения; Claude Code зеркалит тот же контракт рабочей области через CLI claude. Ни одна среда не получает собственный формат навыка.

Форма артефакта тоже помогает: итоговые навыки занимают от 379 до 1995 токенов по шести бенчмаркам, медиана около 920, и собираются из 1–4 принятых правок. В примере Figure 4 — по одному выученному правилу на бенчмарк — все правила процедурные, а не привязанные к конкретным примерам. Правило SpreadsheetBench дословно: осмотреть структуру рабочей книги и формулы, затем записать вычисленные статические значения во весь требуемый целевой диапазон, а не полагаться на пересчёт Excel.

Что это значит на практике

Стоимость обучения платится один раз, офлайн, и измерима: от 0.6 до 46.4 миллиона токенов обучения на абсолютную тестовую точку в зависимости от бенчмарка (SpreadsheetBench — 0.6M, DocVQA — 46.4M). Модель-оптимизатор работает только во время обучения и не добавляет ни одного вызова при инференсе.

Если навык, обученный в одной среде, держится в другой, разовые затраты распределяются между средами: можно оптимизировать там, где инструменты дешевле, а разворачивать там, где живёт продукт. Результат Codex → Claude Code на SpreadsheetBench — доказательство существования такого пути.

Отдельный недооценённый аспект — аудируемость. Развёрнутый артефакт — текстовый файл, который практикующий специалист прочитает за минуты. Каждое изменение прослеживается: каждый шаг записывает edit_apply_report.json со статусом accept/skip по каждой правке. Портируемость плюс проверяемость — это иная операционная позиция, чем поставка тонко настроенных весов.

Ограничение очевидно: доказательства покрывают одно семейство GPT и по два бенчмарка на ось, так что портируемость продемонстрирована, но не обобщена. Все строки переноса — 4 между моделями, 4 между средами и 3 между бенчмарками — оказываются выше базового уровня без навыка, но сила переноса сильно зависит от типа задачи.

Источник: marktechpost.com