Релізи моделей
Qwen 3.8 27B. Команда Qwen з Alibaba випустила Qwen3.8-27B та більшу модель Qwen3.8-2.4T-A95B під ліцензією Apache 2.0. Щільна модель 27B має ту ж архітектуру, що й Qwen3.6-27B, але покращує кодування, офісні завдання та планування агентів завдяки змінам у навчанні. Вона підтримує 262k нативного контексту, розширюваного до 1M токенів.
GLM-5.3 від Zhipu. Zhipu AI випустила GLM-5.3, яка використовує ту ж базову модель, що й GLM-5.2, але з розширеним пост-тренуванням. Компанія стверджує, що це найпотужніша модель з відкритими вагами для кодування, з помітними покращеннями в агентному кодуванні та виявленні вразливостей кібербезпеки. Ваги очікуються на Hugging Face протягом двох тижнів.
Muse Glimmer від Meta. Meta відкрила вихідний код Muse Glimmer, агентної моделі на 30B під Apache 2.0, орієнтованої на локальні робочі процеси на споживчих GPU. Вона дистилює навички міркування та виклику інструментів з більшої моделі Muse Spark і ненадовго була фронтиром у класі 30B.
Хвиля китайських відкритих моделей. За менш ніж місяць китайські лабораторії випустили Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813 та GLM-5.3, підкреслюючи швидкий прогрес відкритих ваг на фронтирі.
Локальне розгортання та спільнота
Прискорення на Apple Silicon. Новий реліз mlx-dspark приносить спекультивне декодування для Qwen3.8-27B на Apple Silicon, досягаючи приблизно 3× швидшої генерації на M4 Pro, генеруючи при цьому ідентичні вихідні токени.
Квантизація та ваги. Unsloth випустив квантизовані ваги Qwen3.8-27B, а Тім Деттмерс дражнив новий метод квантизації, який міг би запустити GLM-5.3 на одному DGX Spark зі швидкістю 7 токенів/с.
Ранні тести Qwen 3.8. Тести спільноти показують сильні однокрокові демо кодування та агентну поведінку в Qwen3.8-27B, але деякі користувачі повідомляють про помітно обрізані загальні знання та надзвичайно довгі сліди мислення при надвисоких зусиллях міркування. Рекомендовані параметри семплювання доступні на картці моделі.
- → Qwen 3.8 - 27B is a game changer
- → A hunch: Qwen3.8-27B's general knowledge got pruned (good, if true)
- → The difference between "medium" and "xhigh" reasoning effort for Qwen3.8-27B is actually insane.
- → Qwen 3.8 27B - Aquarium Burst Sample Test
- → RetroCraft - Qwen 3.8 27B Q8, one shot with exact performance data on dual 3090s.
Локальний варіант без цензури. Спільнотна 'єретична' версія Qwen3.8-27B видаляє відмови та захисні механізми, маючи на меті надати локальну альтернативу без цензури на рівні фронтирної моделі, як Opus 4.6.
Прозорість та безпека ШІ
Виявлення водяних знаків Anthropic. Anthropic запропонує API для виявлення водяних знаків, щоб сторонні розробники могли виявляти текст, ймовірно згенерований Claude. Метод використовує SynthID Text і менш надійний на коротких, фактологічних або сильно переписаних текстах.
Google робить водяний знак необов'язковим. Google дозволяє користувачам вимикати видимі водяні знаки на згенерованих ШІ зображеннях, відео та музиці від Nano Banana, Omni та Lyria. Невидимі SynthID та метадані C2PA все одно будуть вбудовані для перевірки.
Інжекція промптів у суді. Суддя з Коннектикуту задокументував, схоже, перший судовий документ у США з прихованим текстом, призначеним для маніпулювання системами ШІ, які розглядають справу. Приховані інструкції не мали ефекту, але суддя назвав цю тактику небезпечною.
Агенти у продакшні
Обов'язок з обслуговування Claude Code. Anthropic повідомляє, що Claude Code виконує щоденне обслуговування власних застосунків, створивши 388 pull request'ів з 46 відсотками прийнятих після перевірки людиною. Рутини включають фаззинг збоїв, очищення дубльованих абстракцій та перевірку залежностей.
OpenAI Computer History. Computer History від OpenAI замінює прототип знімків екрана Chronicle, записуючи кліки, натискання клавіш і перемикання застосунків на macOS для створення пошукового таймлайну. Він може виявляти повторювані робочі процеси та пропонувати багаторазові навички для ChatGPT і Codex.
Індустрія та бізнес
Цінова війна між США та Китаєм. OpenAI та Anthropic знижують ціни, оскільки китайські відкриті моделі набирають обертів; Google Gemini 3.7 Flash дебютує зі знижкою 50 відсотків на початковий період, орієнтованою на кодування та агентів. Ціни на токени від провідних американських лабораторій впали майже на чверть з середини липня.
GPT-5.6 Sol Ultrafast. OpenAI запустила попередній перегляд режиму Ultrafast для GPT-5.6 Sol на базі Cerebras, що забезпечує до 750 вихідних токенів на секунду. API-сервіс спочатку обмежений окремими клієнтами та орієнтований на аналіз у реальному часі під час інцидентів або ринкових подій.
Meta: ШІ для всіх. Meta поєднала реліз Glimmer з довгим листом Цукерберга, стверджуючи, що ШІ має бути відкритим для всіх, але подкаст-покриття зазначає, що компанія тримає свою найпотужнішу Muse Spark за API. У тих самих обговореннях згадується придбання за 250 мільйонів доларів, яке пішло не так.
Модель Apple-Alibaba для Китаю. За повідомленнями, Apple навчила спеціальну модель ШІ для китайського ринку з допомогою Alibaba, напередодні впровадження Apple Intelligence на китайських пристроях. Це партнерство є рідкісною американо-китайською співпрацею в галузі ШІ.
Поштовх Kog до інференсу. Французький стартап Kog використовує оптимізацію програмного забезпечення, щоб вичавити більше швидкості зі звичайних GPU, таких як AMD MI300X та Nvidia H200, зосереджуючись на швидшому декодуванні окремих запитів для робочих навантажень програмної інженерії.
Ризик цін на природний газ. Новий прогноз Noreva попереджає, що ціни на природний газ можуть потроїтися в деяких частинах США, оскільки гіперскейлери, як Amazon, Google, Meta та Microsoft, закріплюють газову енергію для центрів обробки даних ШІ.
Наукові досягнення
Модель ARC з 150M параметрами. Рекурентна латентна модель міркування з 150M параметрами досягає 29.5% на ARC-AGI-1 за $0.0007 за завдання, поза опублікованою межею вартості-точності. Вона працює на мінімальному обладнанні, хоча масштабування до мільярдів параметрів все ще необхідне.
Сумніви щодо автономних досліджень. Дослідження Принстона та UK AISI з використанням неопублікованих статей NeurIPS показало, що поточні фронтирні моделі справляються з дослідницькою інженерією, але не справляються з частинами досліджень, які мають значення, суперечачи заявам лабораторій про автономні дослідження ШІ.
Еволюція гарнесів DarwinX. DarwinX еволюціонує агентні гарнеси через природний відбір за промптами, інструментами, навичками та потоком керування, залишаючи ваги моделі замороженими. Він додає в середньому близько 17 пунктів на чотирьох бенчмарках і переноситься без змін на SWE-bench Verified.
Бенчмарк PlayWorld. PlayWorld бенчмаркує відеомоделі світу за допомогою мультимодальних агентів-гравців, які виконують 171 довгострокову ціль, вимірюючи геометричну узгодженість, точність взаємодії, еволюцію поза полем зору та еволюцію інсайтів.
Це все на сьогодні - приблизно 5 хвилин читання.