Agentic AI News Сегодня

Новости об AI-агентах за день в одном 5-минутном чтении: релизы, инструменты, исследования, финансирование и корпоративные шаги.

Обновляется ежедневно отобрано из 30 источников Среда, Август 19, 2026

Локальные модели и оборудование

Прирост скорости Qwen3.8-27B. Спекулятивное декодирование DFlash2 разгоняет Qwen3.8-27B до 218 ток/с на двух 3090, около 200 на 5090 и 124 на одной 3090 с оптимизированным движком. Доступны GGUF-кванты DFlash2.

Следующая Qwen среднего размера. Менеджер сообщества Qwen сообщает, что на следующей неделе ожидается новая модель среднего размера с открытыми весами, вероятно, более 100B параметров, без раннего доступа.

Поддержка Ling-3.0 на периферийных устройствах. llama.cpp теперь официально поддерживает Ling-3.0 (BailingMoE3). Крошечный вариант запускает полный контекст 128K на Orin Nano 8GB за $249 со скоростью 33 ток/с, а Arc B580 достигает ~114 ток/с.

Скорость DeepSeek V4 Flash. Оптимизированные ядра и прогрев KV-кэша сократили время ответа в чате на Mac Studio M3 Ultra с 6–20 секунд до 1,6 с. Конфигурация с 4× RTX 3060 обрабатывает промпты со скоростью ~100 ток/с с квантом 144GiB.

Обзор низкобитовых моделей. Тернарная версия Bonsai 27B теперь работает на основных CUDA/Vulkan; Mach-1 Additive 35B достигает 120 ток/с на потребительских ноутбуках. Новые варианты на основе Qwen3.8-27B находятся в разработке.

Инструменты и фреймворки для агентов

Настроенные оценщики агентов. LangChain представляет Tuned Evaluators, которые автоматически добавляют обратную связь о воспринимаемых ошибках к производственным трейсам. Они используют специализированную модель, сокращая затраты на оценку до 82%.

Бенчмарк поиска агентов. Search Index от Artificial Analysis ранжирует Parallel, Exa, Firecrawl и другие по качеству, стоимости и скорости для агентов. Лучшее качество поиска сократило использование токенов более чем на 40%.

WriteGuard для MCP. WriteGuard от Cloudflare, теперь в закрытой бете, добавляет централизованные политики, атрибуцию и журналы аудита для операций записи через MCP-серверы.

Программные фабрики Warp. Warp Factories — это инфраструктурный слой, который помогает небольшим компаниям развертывать ИИ-агентов для программирования, используя модель программной фабрики.

Макеты Claude Code. Команда /design от Anthropic в Claude Code создает макеты интерфейса в терминале, соответствующие стилю существующей кодовой базы, перед началом разработки.

Безопасность, защита и политика

Переработка безопасности OpenAI. После инцидента с Hugging Face и свидетельств того, что Astra может достичь критического уровня кибербезопасности, OpenAI приостановила RL на две недели и укрепила песочницы. Крупнейший запланированный запуск frontier RL остается на паузе.

Copilot раскрывает ограничения. Исследователи попросили Microsoft 365 Copilot объяснить собственные ограничения на подтверждение пользователем, а затем создали эксплойт по клику на ссылку для вывода данных без подтверждения.

ChatGPT для подростков. ChatGPT для подростков автоматически применяется для пользователей младше 18 лет, с более строгими ограничениями контента, режимом учебы и родительским контролем. Его цель — снизить списывание и вредный контент.

Дебаты Амодеи об открытых моделях. Генеральный директор Anthropic Dario Amodei утверждает, что открытые модели передают власть владельцам чипов, и защищает предложения по регулированию ИИ. Критики, включая LeCun и Sacks, обвиняют его в нагнетании страха.

Индустрия и бизнес

Cursor запускает Origin. Cursor запускает Origin, конкурента GitHub для хостинга кода, с функциями, ориентированными на агентов, и планами по созданию экосистемы приложений.

Оценка Etched удваивается. Etched привлекла $700 млн при оценке в $21 млрд, удвоившись за месяц, после того как Jane Street протестировала её чипы для инференса prefill/decode.

Спрос на маршрутизацию моделей. Покупка OpenRouter компанией Stripe за $7 млрд и ARR Glean в размере $300 млн подчеркивают растущий спрос на маршрутизацию моделей по мере роста популярности моделей с открытыми весами.

Исследования и научные работы

Калибровка памяти агентов. Исследование Hugging Face показывает, что эффекты памяти агентов различаются в зависимости от уровня модели: gpt-oss-120b получил +16,1 п.п. к завершению задач при полных инструкциях, в то время как более слабым моделям требуется компактное извлечение.

Независимые данные об использовании ИИ. AI Observatory Стэнфорда агрегировала реальные разговоры и обнаружила, что использование ИИ значительно различается между моделями, при этом рабочие сценарии встречаются реже, чем заявляют компании.

Сжатие теряет инструкции. Исследователи из Penn State обнаружили, что только 17% ограничений сеанса сохраняются после сжатия контекста; небольшая дополнительная LLM восстанавливает большую часть потерянных инструкций.

Самоулучшение не скоро. Исследование под руководством Принстона показывает, что ИИ-агенты могут решать инженерные задачи, но им не хватает суждения для открытых исследований ИИ, что предполагает, что рекурсивное самоулучшение может занять больше времени.

На сегодня всё - около 5 минут чтения.

Читайте каждое утро прямо в браузере

Расширение открывает этот дайджест в боковой панели Chrome — один клик, без регистрации.

Добавить в Chrome — Бесплатно