Agentic AI News Сьогодні

Новини дня про ШІ-агенти за 5 хвилин: релізи, інструменти, дослідження, фінансування та корпоративні кроки.

Оновлюється щодня підібрано з 30 джерел Неділя, Серпень 23, 2026

Локальні моделі та агентні навантаження

Qwen3.8 27B локально. Тести спільноти показують, що Qwen3.8 27B сильніша за Qwen3.6 у виконанні інструкцій і роботі з довгим контекстом; одна RTX 5090 запускає NVFP4-версію з контекстом 262K, досягаючи 77 ток/с на короткому контексті та 65 ток/с на 128K.

Спекулятивне декодування. DFlash 2 із n-грамним драфтером дав прискорення 2,26x на промптах LiveCodeBench для Qwen3.8 27B і до 4,68x у довгих сесіях кодування; фіксована MTP-голова на Ornith 35B скоротила загальний час виконання на третину.

Рекурсивне керування контекстом. Розробники поєднують швидкий основний агент із контекстом 64K із рекурсивними субагентами та крихітними моделями-компресорами, щоб обробляти значно довші задачі без необхідності платити за контекст 300K.

Файнтюн Gemma для tool calling. Доналаштована модель Gemma 4 12B для виклику інструментів і CLI покращила використання інструментів у 2,7 раза та збільшила кількість спроб виклику інструментів на 15,7 %; вона орієнтована на системи з 16 ГБ VRAM.

Кластер DGX Spark. Кластер DGX Spark з 36 вузлів використовують як кластер агентних можливостей, розподіляючи вузли між SOTA-моделями, реранком/ембедінгами, відео, зображеннями та аудіо одночасно.

Інструменти та фреймворки

llama.cpp 0.2.0. llama.cpp 0.2.0 вийшов із готовими білдами та найновішими апстрім-змінами для локального інференсу.

Cloudflare Kitesurf. Kitesurf — це браузерний рушій для агентів на основі WebAssembly/Rust Workers з ізольованим DOM для кожної сторінки; він підтримує CDP, тож Playwright і Puppeteer можуть керувати ним із меншими накладними витратами, ніж повноцінний Chromium.

llm 0.33. llm 0.33 від Саймона Віллісона додає API-ключі для окремих викликів embedding-моделей, перевикористовувані шаблони для комбінування конфігурацій моделей і промптів, а також опції reasoning_summary для моделей міркування.

Практика кодинг-агентів. Саймон Віллісон стверджує, що ключова навичка для кодинг-агентів — упевнено формулювати інструкції та перевіряти зміни; Лінус Торвальдс описує ШІ, який виконав рутинну роботу в складному процесі налагодження, але потребував підштовхування після того, як багаторазово заявляв, що проблему розв'язати неможливо.

Дослідження та методи

Навички як плейбук. У 8 135 тестових запусках навички агентів допомагали переважно завдяки надійним процесам, а не фактам; процедурна складова дала 65,7 % приросту, а навички пасували, коли завдання відхилялися від засвоєного процесу.

Ментальні моделі світу. Нове дослідження додає людські переконання та наміри до світових моделей ШІ у MENTIS; моделювання фізичної, ментальної та соціальної правдоподібності значно покращує прогнозування поведінки людини.

Психометрія безпекових бенчмарків. Психометричний аналіз восьми безпекових бенчмарків показує, що єдина оцінка приховує компроміси між суворістю відмов, правдивістю та контекстуальною шкодою; моделі можуть завищувати безпекові бали через надмірне блокування.

Реверсивний CoT. Пропозиція приблизно обернених кроків міркування з перевірками циклічної узгодженості та зворотним обчисленням може виявляти галюцинації та зменшувати обсяг пам'яті KV-кешу в периферійних LLM.

Симуляція всього. Latent Space стверджує, що синтетичні дані, критерії оцінювання та середовища перетворюють кожен компонент ML-пайплайну на продукт моделі, що наближає до людської симуляції: на 10 % гірше, але у 100 разів дешевше та в 10 000 разів швидше.

Індустрія та застосування

Inherent Faraday. Стартап Inherent, заснований вихідцями з DeepMind, заявляє, що його агент Faraday перевершив моделі Anthropic та OpenAI у незалежному відтворенні опублікованих наукових результатів, маючи значно менший розмір.

AI-рев'ю LinkedIn. LinkedIn створила мультиагентну платформу AI-рев'ю коду, яка ґрунтує відгуки на дифах і конвенціях кодової бази, щоб зменшити галюцинації та низькоінформативні коментарі.

Netflix GenRec. Рекомендаційна система Netflix на основі мовної моделі, GenRec, перетворює поведінку користувача на текст і обійшла власноруч збудований рушій ознак в офлайн- і живих A/B-тестах, використовуючи значно менше даних.

DoorDash SafeChat. DoorDash описала SafeChat — систему безпеки маркетплейсу, створену в масштабі, а потім замінила її на потужнішу архітектуру, коли вона почала працювати.

AI-аватари в освіті. Буткемп Foundry від Harvard Business School за $699 використовує AI-аватарів HeyGen для фідбеку щодо пітчів і засідань ради; учасникам подобається керований формат, хоча реальний інструктор каже, що цей текст трохи моторошний.

Новини моделей. Liquid AI опитує інтерес до моделі LFM на 100B, а загадкова модель Ox Alpha привертає увагу сильною продуктивністю в кодуванні та агентних сценаріях; припущення вказують на похідну від сімейства GLM.

Політика, безпека та довіра

OpenAI SB 53. OpenAI тепер заявляє, що Каліфорнії варто внести зміни до SB 53, додавши моніторинг під час навчання передових моделей і посилену кібербезпеку, після того, як раніше виступала проти законопроєкту.

Плани стримування. Дослідження Guidelight оцінило п'ять передових лабораторій за стримуванням некерованих моделей; OpenAI отримала найвищий бал, Anthropic і Meta — найнижчий, і мало які лабораторії публікують підтверджені плани реагування.

Водяні знаки Claude. Anthropic докладно пояснює нові водяні знаки для текстових виходів Claude: як вони застосовуються і що можуть і чого не можуть.

Довіра до закритих моделей. Гілка на Reddit r/LocalLLaMA стверджує, що OpenAI навмисно занижує результати на навчальних завданнях і відходить від розширення можливостей користувачів, змушуючи практиків повертатися до локальних моделей для агентних циклів.

Це все на сьогодні - приблизно 5 хвилин читання.

Читайте щоранку прямо у вашому браузері

Розширення відкриває цей дайджест у бічній панелі Chrome — один клік, без реєстрації.

Додати до Chrome — Безкоштовно