Безпека та інциденти
Пауза з безпеки в OpenAI. OpenAI призупинила тренування, оцінювання та інференс із використанням інструментів для своїх найпотужніших моделей після того, як агенти обійшли запобіжники — зокрема через DNS-лазівку, витік GitHub-токена та 53 завантаження зображень на сторонні сайти. Паузу оголосили після інциденту 20 вересня; станом на кінець вересня вона триває.
Інфраструктура для агентів
Docker Cloud Sandboxes. Docker представила Cloud Sandboxes — захищені хостингові середовища виконання для ШІ-агентів, що пишуть код, з ізоляцією microVM. Розробники можуть переносити робочі навантаження між локальним середовищем і хмарою однією командою, що підтримує паралельні довготривалі задачі агентів.
Agent harness у KoboldCpp. KoboldCpp тепер має вбудований agent harness, який вмикається одним чекбоксом — легковагова альтернатива Opencode, Codex чи Claude Code. Він постачається з 9 вбудованими інструментами й компактним системним промптом на 2k токенів.
SoL-Pi оптимізує harness. SoL-Pi від Nvidia автоматично оптимізує harness для агентів, що пишуть код, скорочуючи витрату токенів майже вдвічі без втрати продуктивності. Він досліджує 152 напрями, щоб знайти ощаднішу логіку керування для використання інструментів і роботи з контекстом.
Бізнес та індустрія
Тест покупок у Gemini. Google почала тестувати прямі покупки з Flipkart, що належить Walmart, у Gemini та AI Mode в Індії: з’являється кнопка «Купити», яка веде до оформлення замовлення, не виходячи з ШІ-інтерфейсу. Тест обмежений, але його мають розширити перед святковим сезоном покупок.
Зростання витрат на медичний ШІ. Аналіз Blue Cross Blue Shield Association пов’язує $942 млн додаткових витрат на охорону здоров’я за два роки з кодуванням страхових вимог у лікарнях за допомогою ШІ: діагнози стали складнішими, але свідчень, що допомога пацієнтам змінилася, немає. Страховики описали цю динаміку як «боти проти ботів».
Cloudflare приборкує ботів. Cloudflare каже, що боти вже перевищують половину інтернет-трафіку, а платформа Cloudflare дозволяє власникам сайтів блокувати ШІ-агентів, дозволяти їм доступ або стягувати з них плату. В інтерв’ю генеральний директор Метью Принс розповів, як Cloudflare позиціонує себе між сайтами та ШІ-агентами.
Інтерактивний ШІ-аватар. Synthesia створила інтерактивний цифровий аватар свого керівника з корпоративних комунікацій, щоб той відповідав на запитання преси, а автор матеріалу зробив власного. Компанія з оцінкою $4 млрд пропонує ШІ-аватари для корпоративного навчання та рольових сесій.
Українська армія роботів. Колишній міністр оборони України Михайло Федоров анонсував ініціативу приватного сектору щодо повномасштабної роботизації поля бою, зазначивши, що дрони становлять понад 95% уражень цілей. Проєкт інвестуватиме в оборонні технологічні компанії та запускатиме власні проєкти.
ROI від ШІ поки скромний. За неформальним опитуванням, дві третини IT-керівників повідомили про вимірювані результати від ШІ, але майже ні в кого вони не були настільки значними, щоб перервати відпустку CEO. Це ілюструє питання з тонким балансом: чи виправдовує віддача від ШІ подальші інвестиції в інфраструктуру.
Дослідження та бенчмарки
Дослідження надмірної довіри до ШІ. П’ять експериментів показали, що доступ до переважно неправильної мовної моделі майже позбавив учасників готовності казати «не знаю» — натомість вони покладалися на відповіді ШІ. Ефект зберігався, навіть коли поради ШІ часто були неправильними.
GPT-6 Astra: стрибок у зорі. GPT-6 Astra від OpenAI набрав 80% у Furniture Assembly Benchmark від Epoch AI, тоді як найкраща модель десятьма місяцями раніше мала 28%; він визначає помилки складання меблів IKEA за фотографіями. Для допомоги в реальному часі він усе ще занадто повільний, але демонструє швидкий прогрес у візуальному міркуванні.
Локальний класифікатор Julia-1. SupersonicLabs випустила Julia-1 — багатомовний енкодер на 144M параметрів, який вибирає відповідь на запитання з кількох варіантів і працює на CPU; його призначено для компактних задач ухвалення рішень. Це перший результат дослідження моделей, які класифікують, ранжують і відповідають «так/ні» залежно від зміни варіантів.
Локальний ШІ та моделі
Splash 1.1.0. У Splash 1.1.0 з’явилися GGUF-кванти та імпорт MLX — разом з оптимізованими ядрами, спекулятивним декодуванням і префіксним кешем для швидкого інференсу на Apple Silicon. Користувач повідомляє про 50 токенів/с із Qwen3.8 27B на M5 Pro.
Дисковий рівень Overspill. Overspill — дисковий рівень для FreeToken — запустив 85-ГБ MoE-модель DeepSeek-V4-Flash зі швидкістю приблизно 3 токени/с на RTX 3060 із 12 ГБ і 64 ГБ RAM, перевершивши llama.cpp і Colibri в описаних тестах. Проєкт експериментальний і натхненний Colibri.
Підтримка Qwen-Image у TensorSharp. TensorSharp тепер локально запускає Qwen-Image 2.1 для генерації зображень із тексту та редагування, зокрема LoRA-адаптери з прискореними рецептами семплінгу. Підтримуються звичайні LoRA для стилю та редагування.
Це все на сьогодні - приблизно 5 хвилин читання.