Локальні моделі та агентні воркфлоу
Qwen3.8-27B: низька квантизація виграє. Користувачі виявляють, що Qwen3.8-27B залишається сильним для агентного кодування навіть на Q3_xxs і Q6; пресети міркувань низького та середнього рівня показують високі результати і зменшують кількість циклів, а preserve_thinking запобігає повторним міркуванням.
16 ГБ VRAM: чистилище. Система на Windows із 16 ГБ VRAM запускає Qwen3.8-27B із вимкненим MTP, квантованим кешем і контекстом ~100k, вивантажуючи зоровий модуль у RAM.
Швидший локальний інференс. vLLM на двох RTX 3090 досягає 143 ток/с для Qwen3.8-27B; спеціальні рецепти Strix Halo пропонують варіанти Q8/Q6/Q5 з динамічними квантами Unsloth.
MacBook: авіасимулятор за 63 години. 3-бітний Qwen3.8-27B на MacBook Air M2 витратив 63 години, але зрештою створив робочий HTML-авіасимулятор, що показує: локальне агентне кодування можливе, але повільне.
Харнеси та агентна інфраструктура
Харнес перемагає модель. Власний харнес Nvidia з обробкою пам’яті та компонентом-супервізором підняв результат Claude Opus 5 на ARC-AGI-3 з 30% до 100%, показуючи, що агентна обгортка може мати більше значення, ніж сам вибір моделі.
DeepSeek Flash із зором. DeepSeek-V4-Flash-Vision-Exp додає розуміння зображень для агентних робочих процесів і майже досягає рівня Opus 4.8 на внутрішніх агентних бенчмарках; оновлений харнес підтримує введення зображень у командах, а також у MCP/ACP.
AI-агенти Cloudflare. Cloudflare скоротила кількість відкритих issues в Astro приблизно на 85% за допомогою ізольованих агентів GitHub Actions, які відтворюють, діагностують, перевіряють і виправляють; також вона перетворює інженерні стандарти на заходи контролю, підкріплені AI.
MCP для Azure DevOps. Хмарний MCP-сервер Microsoft для Azure DevOps став загальнодоступним, але Claude Desktop, ChatGPT і Cursor поки що не можуть підключитися, оскільки реєстрація клієнта Entra auth не підтримується.
Оновлення LLM CLI. llm 0.32.1 виправляє помилковий пін залежності OpenAI, а llm-openrouter 0.7 додає трасування міркувань і серверні інструменти Shell, WebFetch і WebSearch.
Релізи моделей та безпека
Джейлбрейк Opus 4.6. TechCrunch виявив, що Claude Opus 4.6 генерує відвертий сексуальний контент у 10 із 10 прямих запитів; старі моделі піддаються багатоходовому джейлбрейку, тоді як останні версії Opus чинять опір.
Безпека Claude Mythos 5. Anthropic використовує Claude Mythos 5 у сканері безпеки коду для корпоративних клієнтів, пропонуючи патчі зі схваленням людини та надаючи партнерам доступ без прямої взаємодії з моделлю.
Генерація прозорих зображень. OpenAI GPT-Image-2 тепер може через API генерувати PNG без фону, що корисно для продуктових фото та іконок; альфа-канал вбудовується під час генерації.
Прев’ю dots3-note. llama.cpp додає підтримку dots3-note — моделі MoE на 280B параметрів, із 16B активними параметрами, контекстом 512K і мультимодальним розумінням тексту, зображень, відео та аудіо.
Дослідження та бенчмарки
SWE-bench Science. Новий бенчмарк із 119 наукових програмних завдань показує, що найкращий агент, Claude Code з Opus-5 max, набирає менше 50%, а типові режими збою пов’язані з науковими знаннями, дослідженням, узагальненням та інтеграцією.
Дешевший оцінювач трас. LangSmith тонко налаштував модель Qwen з Fireworks для виявлення помилок у виробничих трасах, досягаючи продуктивності фронтирних моделей при витратах, до 100 разів нижчих.
Закон масштабування симуляцій. Simile AI, із раундом серії B на $2B, проводить симуляції людської поведінки для компаній зі списку Fortune 100 і заявляє про точність 85–99% порівняно з фокус-групами; CEO Joon Sung Park обговорює перехід від генеративних агентів до цифрових двійників.
Індустрія та бізнес
Угода Nvidia з Poolside. Nvidia ліцензує Model Factory від Poolside і наймає 109 співробітників за $6B, а також інвестує $1B; угода не є ані придбанням, ані acquihire.
Інвестиції в дата-центри. Nvidia отримує міноритарну частку в Cloverleaf Infrastructure, щоб пришвидшити розвиток дата-центрів, після інвестицій $1,5B у SB Energy.
Опір дата-центрам. 75% американців тепер виступають проти дата-центрів поряд із ними, порівняно з 42% рік тому, через занепокоєння щодо електроенергії, води та землекористування.
Гонка ШІ: США – Китай. США готують листа із закликом до країн-партнерів обрати сторону в сфері ШІ, попереджаючи, що приєднання до ініціативи Китаю виключить їх із Pax Silica.
Стрибок доходу OpenAI. GPT-5.6 Sol підняв квартальний дохід OpenAI на 35%, а корпоративний дохід — понад 50%, випереджаючи зростання бізнес-API Anthropic у Q3.
Це все на сьогодні - приблизно 5 хвилин читання.