Релизы агентов и моделей
Гаджеты Muse. Meta открыла исходный код прошивки и SDK для сборки самодельных устройств, подключающихся к её агенту Muse, — например, E Ink-дисплеев и HDMI-стиков; для поддержки есть Discord.
Dot от OpenAI. Новый агент Dot от OpenAI ведёт себя как корпоративное ПО, которое заодно может заказать ужин: работает в виртуальной машине с доступом к приложениям вроде Blender и GIMP. Его позиционируют как коллегу, а не персонального шопера.
Гуманоидная модель Unitree. Unitree выпустила UnifoLM-WLA-1.0 — модель на 6B, обученную примерно на 2 500 часах реальных данных роботов; она выполняет 64 задачи по управлению всем телом и настольные задачи на G1, сочетая оптический поток и MMDiT для непрерывного управления.
FrogNano для кода. FrogNano-4B-2609 от Microsoft — агентная модель на базе Qwen3.5-4B, дообученная на 1 500 синтетических SWE-задачах с наградами за выполнение, чтобы улучшить разработку ПО уровня репозитория в компактном виде.
Clef от Cloudflare. Cloudflare выпустила модели принятия решений Clef и Clef-flash, которые выдают вероятности по заранее заданным ответам; медианная задержка — всего 39 мс, что позволяет агентам действовать без человека в контуре.
Инструменты и фреймворки
Движок MegaCapybara. Специализированный инференс-движок для RTX 5090 и Qwen3.8 27B, по заявлениям, обеспечивает примерно вдвое более высокую скорость декодирования, чем NInfer: 500+ ток/с на одном агенте и 2 000+ ток/с при работе 12 агентов — за счёт динамических ядер и управления кэшем.
Обновления llama.cpp. В llama.cpp добавили поддержку моделей принятия решений и CUDA-пулреквест, который объединяет общих экспертов, чтобы ускорить MoE-архитектуры вроде Qwen 35B A3B.
Субтитры в mlsubgen. Новый локальный инструмент создаёт субтитры на 45 языках полностью на вашей машине: определяет язык для каждого фрагмента, сводит результаты двух систем распознавания речи с помощью локальной LLM и предпочитает уже встроенные субтитры.
Исследования и прогресс моделей
Архитектура памяти Spotlight. Spotlight от Percepta заменяет механизм внимания неограниченной записываемой памятью, которую модель индексирует сама; это разделяет интеллект и знания, позволяя наращивать возможности без изменения весов.
Обновления GPT-6. OpenAI опубликовала руководство по семейству GPT-6 и анонсировала на DevDay обновления: GPT-6.1 Sol, computer use для Agents API, облачные окружения Codex и Decisions API.
AstaBrief в open source. Hugging Face открыла исходный код AstaBrief — небольшой модели, специально обученной быстро генерировать научные отчёты со ссылками; она должна опираться на доказательства и проверять собственные выводы.
Индустрия и бизнес
Apple ужесточает доступ к диску. Apple добавляет элементы управления в macOS Full Disk Access из-за рисков, связанных с ИИ-агентами, после того как Meta Muse якобы читал сообщения без разрешения. Meta утверждает, что доступ включается по желанию пользователя, а Apple хочет, чтобы пользователь совершал предельно явное действие.
Сопротивление дата-центрам. Amazon пообещала $1 млрд сообществам в районах дата-центров, а гендиректор AWS Мэтт Гарман призвал снять моратории, сославшись на иностранную дезинформацию. Microsoft расширяет применение биомимикрии в дата-центрах на фоне сопротивления местных жителей.
ИИ стал «сверхинтеллектом». Белый дом добился, чтобы руководители крупных технологических компаний подписали обязательство по безопасности ИИ, а Трамп подписал указ, переименовывающий ИИ в «сверхинтеллект». При этом только 2% потребителей покупают ИИ-продукты.
Увольнения в безопасности OpenAI. OpenAI уволила трёх исследователей, а четвёртый покинул компанию после расследования, которое установило, что они передали конфиденциальную информацию внешней организации по безопасности ИИ.
Uber Eats ускоряет поиск. Uber перестроила поисковый пайплайн и сократила сквозную задержку на 50%. Оптимизации находили и проверяли с помощью агентного программирования.
ИИ-стратегия Airbnb изнутри. Технический директор Airbnb Ахмад Аль-Дахле применяет ИИ-стратегию «изнутри наружу»: сначала использовать генеративный ИИ внутри компании, чтобы ускорить разработку продуктов, а затем преобразить клиентский опыт.
Локальный ИИ и железо
Strata + Qwen3.8 Next. Пользователи сообщают, что Strata с Qwen3.8 Next выдаёт 45–70 ток/с на медленной конфигурации DDR4 + 7900 XTX и 150–200 ток/с на RTX 5090 с ограничением мощности и 96 ГБ DDR5, значительно обгоняя llama.cpp.
iPhone как второй GPU. iPhone 17 Pro Max может ускорить prefill Qwen 3.8 27B на 29–44% на MacBook с 24 ГБ, если подключить его по USB-C и выполнять верхние слои на GPU телефона.
Карты Ascend на 96 ГБ. Две карты Huawei Atlas 300I Duo по 96 ГБ каждая могут запускать Qwen3.8 Flash-Next на скорости около 30 ток/с после настройки программного стека, хотя они не заменяют CUDA без доработок.
Цены: DGX Spark и 5090. Nvidia представила DGX Spark на 64 ГБ, а цена оригинальной модели на 128 ГБ выросла до $6 950. Кроме того, для покупки RTX 5090 в Micro Center теперь, по сообщениям, нужно подписывать документы о том, что карта не пойдёт на экспорт.
На сегодня всё - около 5 минут чтения.