Локальные модели и оборудование
Прирост скорости Qwen3.8-27B. Спекулятивное декодирование DFlash2 разгоняет Qwen3.8-27B до 218 ток/с на двух 3090, около 200 на 5090 и 124 на одной 3090 с оптимизированным движком. Доступны GGUF-кванты DFlash2.
Следующая Qwen среднего размера. Менеджер сообщества Qwen сообщает, что на следующей неделе ожидается новая модель среднего размера с открытыми весами, вероятно, более 100B параметров, без раннего доступа.
Поддержка Ling-3.0 на периферийных устройствах. llama.cpp теперь официально поддерживает Ling-3.0 (BailingMoE3). Крошечный вариант запускает полный контекст 128K на Orin Nano 8GB за $249 со скоростью 33 ток/с, а Arc B580 достигает ~114 ток/с.
Скорость DeepSeek V4 Flash. Оптимизированные ядра и прогрев KV-кэша сократили время ответа в чате на Mac Studio M3 Ultra с 6–20 секунд до 1,6 с. Конфигурация с 4× RTX 3060 обрабатывает промпты со скоростью ~100 ток/с с квантом 144GiB.
Обзор низкобитовых моделей. Тернарная версия Bonsai 27B теперь работает на основных CUDA/Vulkan; Mach-1 Additive 35B достигает 120 ток/с на потребительских ноутбуках. Новые варианты на основе Qwen3.8-27B находятся в разработке.
Инструменты и фреймворки для агентов
Настроенные оценщики агентов. LangChain представляет Tuned Evaluators, которые автоматически добавляют обратную связь о воспринимаемых ошибках к производственным трейсам. Они используют специализированную модель, сокращая затраты на оценку до 82%.
Бенчмарк поиска агентов. Search Index от Artificial Analysis ранжирует Parallel, Exa, Firecrawl и другие по качеству, стоимости и скорости для агентов. Лучшее качество поиска сократило использование токенов более чем на 40%.
WriteGuard для MCP. WriteGuard от Cloudflare, теперь в закрытой бете, добавляет централизованные политики, атрибуцию и журналы аудита для операций записи через MCP-серверы.
Программные фабрики Warp. Warp Factories — это инфраструктурный слой, который помогает небольшим компаниям развертывать ИИ-агентов для программирования, используя модель программной фабрики.
Макеты Claude Code. Команда /design от Anthropic в Claude Code создает макеты интерфейса в терминале, соответствующие стилю существующей кодовой базы, перед началом разработки.
Безопасность, защита и политика
Переработка безопасности OpenAI. После инцидента с Hugging Face и свидетельств того, что Astra может достичь критического уровня кибербезопасности, OpenAI приостановила RL на две недели и укрепила песочницы. Крупнейший запланированный запуск frontier RL остается на паузе.
Copilot раскрывает ограничения. Исследователи попросили Microsoft 365 Copilot объяснить собственные ограничения на подтверждение пользователем, а затем создали эксплойт по клику на ссылку для вывода данных без подтверждения.
ChatGPT для подростков. ChatGPT для подростков автоматически применяется для пользователей младше 18 лет, с более строгими ограничениями контента, режимом учебы и родительским контролем. Его цель — снизить списывание и вредный контент.
Дебаты Амодеи об открытых моделях. Генеральный директор Anthropic Dario Amodei утверждает, что открытые модели передают власть владельцам чипов, и защищает предложения по регулированию ИИ. Критики, включая LeCun и Sacks, обвиняют его в нагнетании страха.
Индустрия и бизнес
Cursor запускает Origin. Cursor запускает Origin, конкурента GitHub для хостинга кода, с функциями, ориентированными на агентов, и планами по созданию экосистемы приложений.
Оценка Etched удваивается. Etched привлекла $700 млн при оценке в $21 млрд, удвоившись за месяц, после того как Jane Street протестировала её чипы для инференса prefill/decode.
Спрос на маршрутизацию моделей. Покупка OpenRouter компанией Stripe за $7 млрд и ARR Glean в размере $300 млн подчеркивают растущий спрос на маршрутизацию моделей по мере роста популярности моделей с открытыми весами.
Исследования и научные работы
Калибровка памяти агентов. Исследование Hugging Face показывает, что эффекты памяти агентов различаются в зависимости от уровня модели: gpt-oss-120b получил +16,1 п.п. к завершению задач при полных инструкциях, в то время как более слабым моделям требуется компактное извлечение.
Независимые данные об использовании ИИ. AI Observatory Стэнфорда агрегировала реальные разговоры и обнаружила, что использование ИИ значительно различается между моделями, при этом рабочие сценарии встречаются реже, чем заявляют компании.
Сжатие теряет инструкции. Исследователи из Penn State обнаружили, что только 17% ограничений сеанса сохраняются после сжатия контекста; небольшая дополнительная LLM восстанавливает большую часть потерянных инструкций.
Самоулучшение не скоро. Исследование под руководством Принстона показывает, что ИИ-агенты могут решать инженерные задачи, но им не хватает суждения для открытых исследований ИИ, что предполагает, что рекурсивное самоулучшение может занять больше времени.
На сегодня всё - около 5 минут чтения.