Локальні моделі та апаратне забезпечення
Прискорення Qwen3.8-27B. Спекулятивне декодування DFlash2 розганяє Qwen3.8-27B до 218 ток/с на двох 3090, близько 200 на 5090, і 124 на одній 3090 з оптимізованим рушієм. Доступні квантізації DFlash2 GGUF.
Наступна Qwen середнього розміру. Менеджер спільноти Qwen каже, що наступного тижня очікується нова модель середнього розміру з відкритими вагами, ймовірно, понад 100B параметрів, без раннього доступу.
Підтримка Ling-3.0 на edge. llama.cpp тепер офіційно підтримує Ling-3.0 (BailingMoE3). Найменший варіант запускає повний контекст 128K на Orin Nano 8GB за $249 зі швидкістю 33 ток/с, тоді як Arc B580 досягає ~114 ток/с.
Швидкість DeepSeek V4 Flash. Оптимізовані ядра та прогрів KV-кешу скоротили час відповіді Mac Studio M3 Ultra з 6–20 секунд до 1,6 с. Конфігурація з 4x RTX 3060 обробляє запити зі швидкістю ~100 ток/с із квантом 144GiB.
Огляд низькобітових моделей. Тернарна модель Bonsai 27B тепер працює на основній гілці CUDA/Vulkan; Mach-1 Additive 35B досягає до 120 т/с на споживчих ноутбуках. Нові варіанти на основі Qwen3.8-27B у розробці.
Агентні інструменти та фреймворки
Налаштовані оцінювачі агентів. LangChain представляє Tuned Evaluators, які автоматично додають зворотний зв'язок про виявлені помилки до продакшн-трейсів. Вони використовують спеціалізовану модель, знижуючи витрати на оцінювання до 82%.
Бенчмарк пошуку для агентів. Search Index від Artificial Analysis ранжує Parallel, Exa, Firecrawl та інші за якістю, вартістю та швидкістю для агентів. Краща якість пошуку зменшила використання токенів більш ніж на 40%.
WriteGuard для MCP. WriteGuard від Cloudflare, тепер у приватній бета-версії, додає централізовані політики, атрибуцію та журнали аудиту для операцій запису через MCP-сервери.
Програмні фабрики Warp. Warp Factories — це інфраструктурний шар, який допомагає меншим компаніям розгортати AI-агентів для кодування за моделлю програмної фабрики.
Макети Claude Code. Команда /design від Anthropic у Claude Code створює UI-макети в терміналі, відповідно до стилю наявної кодової бази перед розробкою.
Безпека, захист та політика
Перегляд безпеки OpenAI. Після інциденту з Hugging Face та доказів того, що Astra може досягти критичного рівня кібербезпеки, OpenAI призупинив RL на два тижні та посилив пісочниці. Найбільший запланований запуск frontier RL залишається на паузі.
Copilot розкриває запобіжники. Дослідники попросили Microsoft 365 Copilot пояснити власні запобіжники підтвердження користувача, а потім створили експлойт на клік по посиланню, щоб викрадати дані без підтвердження.
ChatGPT для підлітків. ChatGPT для підлітків автоматично застосовується для користувачів до 18 років, з суворішими обмеженнями контенту, режимом навчання та батьківським контролем. Він має на меті зменшити списування та шкідливий контент.
Дебати Амодеї щодо відкритих моделей. Генеральний директор Anthropic Даріо Амодеї стверджує, що відкриті моделі передають владу власникам чипів, і захищає пропозиції щодо регулювання ШІ. Критики, зокрема ЛеКун і Сакс, звинувачують його в залякуванні.
Індустрія та бізнес
Cursor запускає Origin. Cursor запускає Origin, конкурента GitHub для хостингу коду, з функціями, орієнтованими на агентів, і запланованою екосистемою застосунків.
Оцінка Etched подвоюється. Etched залучив $700M при оцінці $21B, подвоївши її за місяць, після того як Jane Street протестувала його чипи для префіл/декодинг інференсу.
Попит на маршрутизацію моделей. Придбання Stripe за $7B компанії OpenRouter та $300M ARR компанії Glean підкреслюють зростаючий попит на маршрутизацію моделей, оскільки моделі з відкритими вагами набирають обертів.
Дослідження та наукові роботи
Калібрування пам'яті агентів. Дослідження Hugging Face показує, що ефекти пам'яті агентів залежать від рівня моделі: gpt-oss-120b отримав +16,1 в.п. до виконання завдань з повними інструкціями, тоді як слабшим моделям потрібен компактний пошук.
Незалежні дані про використання ШІ. AI Observatory від Стенфорда агрегував реальні розмови та виявив, що використання ШІ значно відрізняється між моделями, причому робочі сценарії використання менш поширені, ніж заявляють компанії.
Ущільнення втрачає інструкції. Дослідники з Penn State виявили, що лише 17% обмежень сесії зберігаються після ущільнення контексту; невелика додаткова LLM відновлює більшість втрачених інструкцій.
Самовдосконалення не найближчим часом. Дослідження під керівництвом Принстона виявляє, що AI-агенти можуть вирішувати інженерні проблеми, але їм бракує судження для відкритих досліджень ШІ, що свідчить про те, що рекурсивне самовдосконалення може зайняти більше часу.
Це все на сьогодні - приблизно 5 хвилин читання.