Agentic AI News Сегодня

Новости об AI-агентах за день в одном 5-минутном чтении: релизы, инструменты, исследования, финансирование и корпоративные шаги.

Обновляется ежедневно отобрано из 30 источников Воскресенье, Август 30, 2026

Релизы агентов и моделей

Превью Tencent Hy4. Tencent выпустила превью Hy4 — модель значительно крупнее Hy3, с глубокими рассуждениями по умолчанию и режимом no_think. В сообществе уже есть официальный квант ~2,38 бита и GGUF на ~200 ГБ, который, по сообщениям, сохраняет около 98% производительности BF16.

Локальный инференс и оборудование

FlashMLA на sm_120. Сборка сообщества расширяет FlashMLA на потребительские GPU Blackwell sm_120: на ряде разреженных нагрузок MLA она даёт ускорение в 2–3 раза по сравнению с PyTorch SDPA и снижает задержку декодирования с FP8 KV-кэшем на 8%.

Фикс Nemotron на 16 ГБ. Низкобитные GGUF-файлы Nemotron-3.5-Lightning из-за построчной квантизации на деле имели плотность ~4,70 бита на вес. Исправленная сборка llama.cpp создаёт файл с реальными 3,07 бита на вес и размером 11,77 ГиБ, который работает с контекстом 262K на 16 ГБ.

Qwen3.8-Flash-Next на Mac. Модель Qwen3.8-Flash-Next в 2-битном формате весом 79 ГБ запускалась на M5 Max с 128 ГБ памяти и контекстным окном 350K с помощью llama.cpp. В прогон вошли холодный префилл промпта из 105K токенов за 333 секунды и спекулятивное декодирование ngram-mod.

DeepSeek V4 Flash на двух GPU. На связках из двух DGX Spark/GX10 DeepSeek V4 Flash 0731 стабильно выдаёт 67–84 ток/с, а локальный HumanEval Pass@1 составляет 94,5% против 97,0% у GLM-5.3-Flash NVFP4. GLM завершил бенчмарк примерно вдвое быстрее.

Контекст 1M на двух 5090. Форк NInfer добавляет тензорный параллелизм и масштабирование YaRN ×4, позволяя запускать Qwen3.8-27B NVFP4 с контекстом в 1 048 576 токенов на двух 5090. Декодирование идёт на скорости 48–100 ток/с при длине контекста 1M, а доля принятых MTP-предсказаний сохраняется там, где vLLM падает до нуля.

27B на 16 ГБ. Гибридная квантизация и настройки kvarn-кэша позволяют запускать Qwen3.8-27B с контекстом 100K на скорости 50 ток/с на RTX 4070 Ti SUPER с 16 ГБ памяти, используя спекулятивное декодирование MTP и KV-кэш с повышенной точностью хвостовой части.

Движок FreeToken для MoE. Исследователи из UC Berkeley и MIT представили FreeToken — движок с открытым исходным кодом, который динамически согласовывает передачу экспертов в MoE, позволяя передовым разреженным моделям декодировать на потребительских GPU без простоев из-за промахов PCIe/RAM.

Бенчмарки и оценки

Terminal Bench 4.0. Вышла Terminal Bench 4.0 с обновлённым лидербордом и акцентом на быстрые итерации для борьбы с насыщением. GLM-5.3 показывает результат уровня Fable 5 в пределах погрешности.

Финансовый бенчмарк: раскрытие. Карточка бенчмарка для Ling-3.0-flash-Fin показывает, насколько сильно агентная обвязка, инструменты и пайплайны оценки влияют на заявленные результаты: во многих прогонах использовались ReAct с веб-поиском и Python, а часть оценочных наборов является внутренней или ещё не опубликована.

Исследования и инфраструктура агентов

Память WikiSkill от Google. WikiSkill от Google Research даёт агентам постоянную вики-подобную базу знаний о прошлых ошибках и успехах, упаковывая переиспользуемые Agent Skills, которые направляют поведение без изменения весов модели.

Стандарт Model Hardware от Anthropic. Anthropic разрабатывает MHS — единый интерфейс, который позволяет агентам управлять физическими устройствами вроде микроскопов и роботизированных манипуляторов. Ранние тесты сократили срок интеграции нескольких машин с недель до часов, но контроль человека остаётся необходимым.

Слой данных для агентов. В презентации TOTVS утверждается, что транзакционные системы и озёра данных не оптимизированы для агентных рассуждений, требующих много токенов и чувствительных к задержке. Также описывается эволюция доступа к данным в сторону MCP и семантических моделей.

Датасет Big Video от LAION. LAION выпустил BVD — исследовательский датасет из 10 млн часов видео, содержащий 55 млн клипов и 300 млн стоп-кадров и связывающий видео, аудио и текст. Модели, обученные на нём, превзошли бейзлайны InternVid на величину до 2,1 пункта на некоторых бенчмарках.

Индустрия и бизнес

Иск Sony и Warner к Anthropic. Sony Music Publishing, Warner Chappell и другие издатели подали на Anthropic в суд, обвинив её в раздаче через торренты и скрейпинге охраняемых авторским правом произведений для обучения Claude. Истцы требуют возмещения ущерба в размере до $150 000 за произведение. Anthropic заявляет, что будет защищаться.

OpenAI отказалась от Cursor. OpenAI прекращает контракт с Cursor после приобретения его компанией SpaceX, ссылаясь на историю нарушения контрактов со стороны компаний Илона Маска. Anthropic в ответ позиционирует себя в качестве более надёжного партнёра и пообещала продолжить предоставлять вычислительные мощности для использования Claude в Cursor.

Nvidia за пределами GPU. Акцент в отчётности Nvidia смещается с доли рынка GPU на оркестрацию дата-центров и системы вокруг GPU. В этой области компания создала передовое сетевое и оркестрационное оборудование, в то время как масштабы AI-вычислений растут до гигаватт.

На сегодня всё - около 5 минут чтения.

Читайте каждое утро прямо в браузере

Расширение открывает этот дайджест в боковой панели Chrome — один клик, без регистрации.

Добавить в Chrome — Бесплатно