OpenAI выпустила полевой отчёт, в котором задокументированы восемь проектов научных вычислений, где кодинг-агенты помогли ускорить сборку программного обеспечения. В пяти случаях использовался только Codex (продукт OpenAI), в трёх — комбинация Codex и Anthropic Claude Code.
Ключевые результаты
Отчёт охватывает проекты, где агенты применялись для рефакторинга кода, оптимизации производительности и портирования между языками. Среди зафиксированных результатов:
- Ускорение симуляции частиц (Python → Rust): переписанный на Rust симулятор показал прирост скорости на порядки за счёт отсутствия сборщика мусора и низкоуровневого контроля памяти.
- Оптимизация конвейера биоинформатики: анализ последовательностей ДНК, ранее занимавший часы, был сокращён до минут после замены алгоритма поиска подстрок и распараллеливания операций.
- Рефакторинг алгоритма обработки изображений: замена вложенных циклов на векторизованные операции и кеширование промежуточных результатов дала 40-кратное ускорение без смены языка.
- Портирование анализатора логов с Python на Rust: агент не просто переписал код на Rust, а предложил другую архитектуру — потоковую вместо загрузки всего файла в память — что дало прирост скорости при снижении потребления памяти. В каждом проекте человек проверял diff, корректировал промпт и запускал агента снова — типичный итеративный паттерн работы с кодинг-агентами.
Отчёт не скрывает, что это вендорская публикация о собственном продукте, но приводит конкретные цифры и проекты, включая open-source-репозитории, где изменения можно отследить.
Методология
Полевые наблюдения собирались внутри OpenAI и среди партнёров. В проектах участвовали научные группы, работающие над вычислительными задачами: физическое моделирование, биоинформатика, обработка сигналов, оптимизация трафика. Кодинг-агенты получали задачу в виде текстового описания на естественном языке и имели доступ к репозиторию для внесения изменений.
Разработчики отмечали, что эффективность агента сильно зависит от качества контекста: чем точнее описаны архитектура проекта, используемые библиотеки и ожидаемый результат, тем реже агент уходит в неверном направлении. Во всех проектах процесс требовал человеческого контроля и итеративной корректировки — типичный паттерн: человек проверяет diff, корректирует промпт и запускает агента снова.
Ограничения
OpenAI признаёт, что не все задачи подходят для автономного выполнения агентом. Сложная архитектурная работа, где нужно учитывать неочевидные компромиссы, по-прежнему требует человека. Агенты эффективнее всего в задачах с чёткими критериями успеха: «ускорь этот фрагмент кода», «порти этот модуль на Rust», «замени библиотеку X на Y». Когда критерий размытый («улучши архитектуру»), результат становится непредсказуемым.
Тем не менее, сам масштаб — восемь реальных научных проектов, где агенты принесли измеримый результат — показатель того, что технология выходит за рамки игрушечных примеров и начинает применяться в production-научных вычислениях.
Источник: artificialintelligence-news.com