Black Forest Labs представила FLUX 3 — мультимодальную модель для видео, изображений и звука
FLUX 3 от Black Forest Labs — первая единая архитектура для генерации видео до 20 секунд с аудио, изображений и предсказания действий.
Искусственный интеллект: инструменты и их применение в работе. Всего — 257 статей.
FLUX 3 от Black Forest Labs — первая единая архитектура для генерации видео до 20 секунд с аудио, изображений и предсказания действий.
Sakana AI представила Fugu-Cyber — специализированный эндпоинт оркестратора Fugu для задач кибербезопасности: поиск уязвимостей и генерация правил детектирования. Результаты на бенчмарках сопоставимы с GPT-5.5-Cyber и Claude Mythos Preview.
Marker 2 обходит MinerU, Docling и LiteParse на olmOCR-bench: 76,0% точности при 2,9 страницах/с на B200 — до 5× быстрее конкурентов.
OpenWorker (MIT) — локальный AI-агент с 35 коннекторами, который не ведёт диалог, а сразу выдаёт результат: документы, цифры в Slack, обновлённый календарь.
Cursor Router анализирует каждый запрос перед отправкой модели ИИ и направляет его на оптимальный по цене и качеству вариант, экономя 30–60 % бюджета команд.
Сравнение четырёх популярных фреймворков дообучения LLM по скорости, расходу видеопамяти и работе на нескольких GPU: Unsloth, Axolotl, TRL и LLaMA-Factory.
Poolside открыла веса Laguna S 2.1: MoE-модель на 118 млрд параметров с активными 8 млрд, контекст до 1 млн токенов. Обучена меньше чем за девять недель на 4096 H200.
Cisco Foundation AI открыла веса Antares-350M и 1B — небольшие модели, указывающие на уязвимые файлы в реальных репозиториях. Обходят гигантские LLM и стоят копейки.
Google выпустила три модели Flash-класса под агентные задачи: более экономичную 3.6 Flash, быструю Flash-Lite и специализированную Flash Cyber для поиска уязвимостей.
Шесть локальных LLM, которые уверенно влезают в одну видеокарту на 24 ГБ: Qwen, Gemma, Mistral, gpt-oss и DeepSeek — с размерами, квантованием и требованиями к VRAM.
На базе MiniCPM5-1B от OpenBMB собрали локальную «думающую» модель весом 657 МБ, дообучив её на трейсах Claude Fable 5. Что умеет и почему заявления пока не проверить.
Tongyi Lab представила Qwen-Audio-3.0-TTS — облачный синтез речи на 16 языков в вариантах Flash и Plus. Разбираем задержки, качество, цену и ограничения.