Agentic AI News Сьогодні

Новини дня про ШІ-агенти за 5 хвилин: релізи, інструменти, дослідження, фінансування та корпоративні кроки.

Оновлюється щодня підібрано з 30 джерел Неділя, Серпень 30, 2026

Релізи агентів і моделей

Прев'ю Tencent Hy4. Tencent випустила прев'ю Hy4 — значне збільшення розміру проти Hy3, із високим рівнем міркувань за замовчуванням і режимом no_think. У спільноти вже є офіційний 2,38-бітний квант і GGUF-файл на ~200 ГБ, який за повідомленнями зберігає близько 98% продуктивності BF16.

Локальний інференс та залізо

FlashMLA: порт для sm_120. Збірка від спільноти розширює FlashMLA на споживчі GPU Blackwell sm_120, демонструючи прискорення у 2–3 рази порівняно з PyTorch SDPA у кількох sparse MLA-задачах і на 8% нижчу затримку для декодування FP8 KV cache.

Nemotron: фікс для 16 ГБ. Низькобітові GGUF-файли Nemotron-3.5-Lightning насправді мали ~4,70 bpw через квантування по ширині рядків; збірка llama.cpp із патчем дає справжній файл 3,07 bpw / 11,77 GiB, що працює з контекстом 262K на 16 ГБ.

Qwen3.8-Flash-Next на Mac. 2-бітна Qwen3.8-Flash-Next обсягом 79 ГБ запустилася на M5 Max зі 128 ГБ і контекстом 350K за допомогою llama.cpp, включно з холодним префілом промпта на 105K токенів за 333 с та спекулятивним декодуванням ngram-mod.

DeepSeek V4 Flash: дві GPU. На конфігураціях із двома DGX Spark/GX10 DeepSeek V4 Flash 0731 тримає стабільні 67–84 ток/с, локальний HumanEval Pass@1 — 94,5% проти 97,0% у GLM-5.3-Flash NVFP4. GLM завершила бенчмарк приблизно вдвічі швидше.

1M контексту на двох 5090. Форк NInfer додає тензорний паралелізм і масштабування YaRN ×4, запускаючи Qwen3.8-27B NVFP4 з контекстом 1 048 576 токенів на двох 5090. Швидкість декодування тримається на рівні 48–100 ток/с на 1M, зберігаючи accept-рейт MTP там, де vLLM падає до нуля.

27B на 16 ГБ. Гібридне квантування та налаштування kvarn cache дозволяють Qwen3.8-27B працювати з контекстом 100K на швидкості 50 ток/с на RTX 4070 Ti SUPER з 16 ГБ, використовуючи спекулятивне декодування MTP та KV cache із підвищеною точністю для останніх токенів.

FreeToken: рушій для MoE. Дослідники з UC Berkeley та MIT представили FreeToken — рушій із відкритим кодом, що динамічно узгоджує пересилання експертів MoE, дозволяючи передовим розрідженим моделям декодувати на споживчих GPU без простоїв через промахи PCIe/RAM.

Бенчмарки та оцінки

Terminal Bench 4.0. Випущено Terminal Bench 4.0 з оновленим лідербордом та акцентом на швидкій ітерації, щоб подолати насичення; GLM-5.3 демонструє результат на рівні Fable 5 у межах похибки.

Фінансовий бенчмарк: розкриття. Бенчмарк-картка для Ling-3.0-flash-Fin показує, наскільки агентні каркаси, інструменти та пайплайни оцінювання впливають на заявлені результати; багато запусків використовували ReAct із вебпошуком та Python, а деякі набори для евалюації є внутрішніми або ще не опублікованими.

Дослідження та інфраструктура агентів

Google WikiSkill: пам'ять. WikiSkill від Google Research надає агентам постійну вікіподібну базу знань про минулі невдачі та успіхи, пропонуючи повторно використовувані Agent Skills, які скеровують поведінку без зміни ваг моделі.

Anthropic MHS. Anthropic розробляє MHS — уніфікований інтерфейс, що дозволяє агентам керувати фізичними пристроями, зокрема мікроскопами та роботизованими маніпуляторами. Ранні тести скоротили інтеграцію між машинами з тижнів до годин, але контроль людини все ще необхідний.

Шар даних для агентів. Презентація TOTVS стверджує, що транзакційні системи та дата-лейки не оптимізовані для агентних міркувань, які потребують багато токенів і чутливі до затримок, і описує перехід доступу до даних у бік MCP та семантичних моделей.

LAION: датасет BVD. LAION випустив BVD — дослідницький датасет із 10 млн годин відео, 55 млн кліпів і 300 млн статичних зображень, що пов'язує відео, аудіо та текст; моделі, навчені на ньому, випереджали бейзлайни InternVid на величину до 2,1 бала на деяких бенчмарках.

Індустрія та бізнес

Sony та Warner проти Anthropic. Sony Music Publishing, Warner Chappell та інші видавці подали до суду на Anthropic, звинувачуючи компанію у використанні торентів і скрапінгу захищених авторським правом творів для навчання Claude, і вимагають до $150 000 за твір. Anthropic заявляє, що захищатиметься.

OpenAI відмовляється від Cursor. OpenAI припиняє контракт із Cursor після придбання Cursor компанією SpaceX, посилаючись на історію порушення контрактів компаніями Ілона Маска. Anthropic відповіла, позиціонувавши себе як надійнішого партнера, і пообіцяла продовжувати надавати обчислювальні потужності для використання Claude у Cursor.

Nvidia: не лише GPU. Наратив про прибутки Nvidia зміщується з частки GPU на оркестрацію датацентрів і системи навколо GPU, де вона створила найсучасніше мережеве та оркестраційне обладнання, оскільки обчислювальні потужності для ШІ масштабуються до гігават.

Це все на сьогодні - приблизно 5 хвилин читання.

Читайте щоранку прямо у вашому браузері

Розширення відкриває цей дайджест у бічній панелі Chrome — один клік, без реєстрації.

Додати до Chrome — Безкоштовно