Agentic AI News Сьогодні

Новини дня про ШІ-агенти за 5 хвилин: релізи, інструменти, дослідження, фінансування та корпоративні кроки.

Оновлюється щодня підібрано з 30 джерел Понеділок, Вересень 7, 2026

Передові розробки й великі лабораторії

OpenAI: курс на RSI. OpenAI заявляє, що досягла мети «автоматизованого дослідницького інтерна». Внутрішні кодинг-агенти прискорюють дослідження, а деякі плани вдалося виконати на пів року раніше. У своєму есе головний науковець Якуб Пахоцький називає рекурсивне самовдосконалення ключовим для AGI. Компанія пов’язує липневий стрибок витрат на ШІ на одного дослідника з моделлю, яку пізніше випустили як GPT-6 Astra.

Агенти безпеки Figma. Figma створила ШІ-агентів на основі Panther SIEM, щоб розслідувати сповіщення в AWS, Okta, GitHub, GCP та osquery. Це скоротило час опрацювання складних сповіщень на 70%, а кількість викликів чергових — на 20%. Людська перевірка збереглася.

Фреймворк Mantis від Google. Google виклала у відкритий доступ Mantis — фреймворк для агентного сканування вразливостей. Він поєднує агентів-критиків і рев’юерів із відтворенням у пісочниці, щоб зменшити кількість хибних спрацювань і вигаданих вразливостей під час аналізу коду.

Локальний інференс і залізо

LayerStoRm: стрімінг експертів. Експериментальний рушій LayerStoRm (ліцензія MIT) безперервно передає експертів MoE з RAM хоста на GPU. На системі з 96 ГБ відеопам’яті він запускає квантовану версію GLM-5.3-Flash обсягом 186 ГіБ: швидкість — 24,5 токенів/с, є кешування префіксів для агентного кодингу.

Збірки на Radeon Pro R9700. Збірки від спільноти навколо AMD Radeon AI Pro R9700 стають зрілішими. Система з двома R9700 і 64 ГБ DDR5 запускає Qwen 3.8 27B FP8/MXFP4 і Flash Next під vLLM, а користувачі обговорюють 4xR9700 для офлоадингу DeepSeek V4 Flash і Qwen 3.8 Flash.

Оптимізація локального кешу. Новий інструмент із відкритим кодом перевіряє заявлену здатність KV-кешу триматися під навантаженням. Він показує, що патчі dedupe та boundfix можуть зберегти до 146% ємності. Користувачі також повідомляють, що на старіших GPU кеш f16 покращує показник прийняття MTP порівняно з Q8.

Бенчмарки та оцінювання

Struggle Bench: виживання ШІ. Новий «Struggle Bench» дає моделі сервер, квартиру й банківський рахунок, а тоді оцінює, скільки місяців вона зможе платити оренду і продовжувати працювати, не вдаючись до кіберзлочинів. Це перевірка справжньої автономності й здатності виживати.

Харнес lm-eval-ledger. lm-eval-ledger запускає бенчмарки та зберігає все в SQLite. Вебзастосунок дає змогу переглядати й порівнювати, як моделі відповіли на кожне запитання, а не лише підсумкові числа.

Глибші бенчмарки коду. Program-Bench, SRE-Bench і Code Migration змушують агентів відновлювати бінарники за документацією, розуміти реальні бінарники без вихідного коду й переписувати програми іншою мовою. Це перевірка глибоких інженерних навичок у розробці ПЗ.

Юридичні справи й авторське право

Seattle Times і Newsday подають позов. The Seattle Times і Newsday подали до суду на OpenAI і Microsoft через порушення авторських прав. Вони вимагають знищити ШІ-моделі, навчені на їхніх матеріалах, і приєднуються до майже 400 місцевих газет з аналогічними вимогами.

Суперечки щодо угоди Anthropic. Автори повідомляють, що видавці й агенти претендують на більшу частку в урегулюванні Anthropic із авторських прав на 1,5 мільярда доларів, ніж їм належить. Спори точаться навколо повернутих авторам прав, коли автор має отримати виплату в повному обсязі.

Безпека та захисні обмеження

Abliteration як сервіс. Американський стартап Abliteration.ai продає доступ через API до open-weight моделей зі знятими безпековими обмеженнями, як-от GLM-5.3, для ред-тьмінгу та аналізу шкідливого ПЗ. Це знижує поріг зловживання, бо моделі більше не відмовляють.

Qwen без цензури. Порівняння восьми аблітерованих варіантів Qwen 3.8 27B показало, що orcarouter має найвищий показник ASR у HarmBench, а apostate — найближчий до базової моделі за можливостями. Щоправда, є й вади пакування: у деяких релізах бракує vision та MTP.

Дискусія про ШІ-психоз. Дослідники стверджують, що підлабузницькі чат-боти можуть посилювати марення в «ехо-камері однієї людини», і закликають визнати «психоз, асоційований зі ШІ». Утім, чи заслуговує він на окремий діагноз, залишається дискусійним.

Релізи моделей і дослідження

Компактні моделі Spark-X2.5. XHToken випустив Spark-X2.5-4B і 1.7B — ефективні моделі з рідним контекстом на 1 млн токенів і підтримкою понад 200 мов. У llama.cpp з’явився PR, який додає підтримку цих моделей.

WeatherNext 3: супутникове навчання. WeatherNext 3 від Google і DeepMind обходиться без фізичних симуляцій і навчається безпосередньо на супутникових даних у реальному часі. Модель видає щогодинні прогнози з роздільною здатністю 5 км, а точність прогнозу опадів зростає до 50%.

Meta: аудіомодель реального часу. Meta випустила Muse Voice Transcribe — модель реального часу, яка розбиває аудіо на сегменти по 80 мс, транскрибує мовлення і розрізняє до 20 мовців. Вона коштує $0,18 за годину та підтримує понад 70 мов.

Google Lyria 3.5: музика. Google додала Lyria 3.5 у Gemini і свої API. Модель створює музику з виразним вокалом і навчена лише на ліцензованих даних.

Це все на сьогодні - приблизно 5 хвилин читання.

Читайте щоранку прямо у вашому браузері

Розширення відкриває цей дайджест у бічній панелі Chrome — один клік, без реєстрації.

Додати до Chrome — Безкоштовно