Agentic AI News Сьогодні

Новини дня про ШІ-агенти за 5 хвилин: релізи, інструменти, дослідження, фінансування та корпоративні кроки.

Оновлюється щодня підібрано з 30 джерел Понеділок, Серпень 31, 2026

Релізи моделей та локальний ШІ

Sori-1B аудіо-мовна модель. Модель із 1B параметрів, навчена з нуля на тексті, поєднаному з аудіо, без попереднього навчання лише на тексті, має на меті прив'язувати відповіді до аудіо. Вона використовує заморожений енкодер NVIDIA Audio Flamingo Next і власний токенізатор на основі аудіальної онтології; випущена під некомерційною/академічною ліцензією.

Qwen3.8 локальний бум. Звіти спільноти показують, що Qwen3.8-27B і Flash Next працюють на різному залізі — від телефону з 12 ГБ памʼяті (3,5 ток/с) до чотирьох GPU R9700 (генерація 80–120 ток/с, контекст 700K). У локальних агентних навантаженнях Flash Next швидший і механічно надійний, тоді як щільна 27B лишається сильнішою для тривалого багатоходового використання; деякі користувачі вважають моделі тупуватими, хоча якість перекладу німецькою хвалять.

Нецензуровані GGUF-релізи. Користувач Reddit опублікував GGUF LongCat-Flash-Lite-Sparse — моделі з розрідженою увагою 69B-A3B і контекстом 1M, а також Qwen3.8-27B з MTP, Qwen3.5-122B-A10B, Qwen3-Coder-Next та візійну модель. Для підтримки LongCat потрібен форк llama.cpp.

Настільне залізо для ШІ. Настільний DGX Station від NVIDIA забезпечує продуктивність рівня дата-центру із пропускною здатністю памʼяті 7,1 ТБ/с, а Framework, схоже, готує материнську плату з памʼяттю 192 ГБ, очікуваною ціною близько $4,5 тис.

Бенчмарки та оцінювання

Бенчмарк пентесту LLM. Новий бенчмарк тестує LLM на живій інфраструктурі, яку вони мають атакувати, щоб визначити найкращу модель для наступальної безпеки, а не відтворити відомі CVE.

Індекс код-бенчмарків. Користувач Reddit зібрав основні агентні код-бенчмарки в «Індекс агентного кодингу» (Agentic Coding Index) і обчислив метрику інтелектуальної щільності, щоб порівняти можливості моделей у перерахунку на параметр.

Егоцентричний тест VLM. Використовуючи HFlow на егоцентричному відео-бенчмарку, відкрита VLM Gemma зрівнялася з Gemini 2.5 Flash за метриками видимості рук і маніпуляцій, будучи в 19 разів дешевшою, що робить рентабельною приватну обробку на власних потужностях.

Інструменти та агентні фреймворки

Cloudflare AI Search. AI Search від Cloudflare тепер пропонує наскрізний конвеєр пошуку для власних даних, а також агентну інтеграцію, мультимодальний пошук і режим виявлення, який може індексувати сайти без sitemap.

AWS Kiro Crew. AWS відкрила вихідний код Kiro Crew — робочого простору для запуску кількох асинхронних код-агентів зі спільною памʼяттю, перевикористовуваними навичками та запланованими завданнями. Усередині компанії ним користувалися понад 39 000 розробників.

ChatGPT Work: пояснення. ChatGPT Work від OpenAI, доступний у платних тарифах, існує у хмарній версії через chatgpt.com і локальній десктопній версії, яка може отримувати доступ до файлів і запускати програми, але межі між ним і Chat лишаються заплутаними.

Зменшення ліміту Claude Code. Майбутнє підвищення базового ліміту Claude Code на 25% від Anthropic насправді є ефективним скороченням на 17% порівняно з поточним тимчасовим бонусом у 50%. Також додано інструмент автоматичних звітів про помилки.

Дослідження та аналіз

Агентам бракує відчуття часу. Дослідження показало, що Claude Code та Codex систематично неправильно оцінюють тривалість завдань: короткі завдання переоцінюють у 3–10 разів, що проблематично для довготривалих агентних процесів.

PILOT: жива самоеволюція. PILOT — це харнес типу supervisor-worker, який додає живе керування та живу самоеволюцію для агентів із довгим горизонтом планування, перевершуючи аналогічні харнеси на до 9,8 пункту в Terminal-Bench 2.0.

GameWAM: модель світ-дія. GameWAM — перша модель світ-дія для нативного відеогеймплею, яка спільно генерує майбутні кадри та дії клавіатури й миші через flow matching, з довгогоризонтним управлінням блок-циклами.

Next-chunk RL vs SFT. Контрольоване дослідження показує, що Mixed SFT на даних без CoT і з довгим CoT перевершує next-chunk reasoning RL як стратегію попереднього навчання до RLVR, потребуючи понад у 60 разів менше обчислювальних ресурсів.

Дебати про агентність ШІ. Посилаючись на інцидент з Hugging Face у липні, есе стверджує, що агентність ШІ — не лише його спроможності — визначатиме результати, і те, як користувачі надають або обмежують цю агентність, має значення.

Індустрія, політика та бізнес

NVIDIA купує Hugging Face. Повідомляється, що угода на $12,9 мільярда про придбання Hugging Face компанією NVIDIA обʼєднає обчислювальну інфраструктуру з головним хабом поширення екосистеми відкритих моделей, прискорюючи індустріалізацію ШІ.

Торгові барʼєри США щодо роботів. Вашингтон посилив обмеження та мита на китайські дрони й роботів, посилаючись на національну безпеку, хоча масштаби виробництва та цінові переваги Китаю можуть послабити цей вплив у глобальному масштабі.

Впровадження ШІ в промисловості. Meta тестує роботів від Watney, Kinova та ABB для перезавантаження серверів, заміни кабелів і циклів увімкнення/вимкнення живлення в дата-центрах. Caterpillar застосовує досвід автономного видобутку в будівництві та використовує ШІ-асистентів для техніків.

Власні турбінні деталі Маска. SpaceX будує ливарне виробництво лопатей і лопаток газових турбін. Маск каже, що власне лиття може прискорити запуск газових електростанцій для ШІ-дата-центрів на до 18 місяців.

Настрої працівників щодо ШІ падають. Дані Glassdoor показують, що позитивне ставлення американських працівників до ШІ впало з 81% у 2019 році до 43% до середини 2026 року. Найоптимістичніші — менеджери, найнегативніші — жінки покоління Z, письменники та працівники страхових компаній.

Музичні видавці судяться з Anthropic. Sony Music, Warner Music та інші стверджують, що Anthropic незаконно завантажила через торренти десятки тисяч захищених авторським правом текстів пісень для навчання Claude, зазначивши в позові особисто CEO Даріо Амодеї та співзасновника Бенджаміна Манна.

Техас блокує камери Flock. Губернатор Еббот заморозив державні витрати на камери спостереження Flock AI після того, як було витрачено понад $30 мільйонів, на тлі двопартійних занепокоєнь щодо приватності та інцидентів зловживань з боку поліцейських.

Це все на сьогодні - приблизно 5 хвилин читання.

Читайте щоранку прямо у вашому браузері

Розширення відкриває цей дайджест у бічній панелі Chrome — один клік, без реєстрації.

Додати до Chrome — Безкоштовно