Agentic AI News Сегодня

Новости об AI-агентах за день в одном 5-минутном чтении: релизы, инструменты, исследования, финансирование и корпоративные шаги.

Обновляется ежедневно отобрано из 30 источников Суббота, Август 15, 2026

Релизы моделей

Qwen 3.8 27B. Команда Qwen из Alibaba выпустила Qwen3.8-27B и более крупную Qwen3.8-2.4T-A95B под лицензией Apache 2.0. Плотная модель на 27B разделяет ту же архитектуру, что и Qwen3.6-27B, но улучшает программирование, офисные задачи и планирование действий агентов благодаря изменениям в обучении. Она поддерживает нативный контекст в 262k токенов, расширяемый до 1M токенов.

GLM-5.3 от Zhipu. Zhipu AI выпустила GLM-5.3, которая использует ту же базовую модель, что и GLM-5.2, но с расширенным пост-обучением. Компания утверждает, что это самая сильная модель с открытыми весами для программирования, с заметными улучшениями в агентном программировании и обнаружении уязвимостей кибербезопасности. Ожидается, что веса появятся на Hugging Face через две недели.

Muse Glimmer от Meta. Meta открыла исходный код Muse Glimmer, агентной модели на 30B под лицензией Apache 2.0, предназначенной для локальных рабочих процессов на потребительских GPU. Она дистиллирует навыки рассуждения и вызова инструментов из более крупной Muse Spark и ненадолго стала передовой в классе 30B.

Волна открытых моделей из Китая. Менее чем за месяц китайские лаборатории выпустили Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813 и GLM-5.3, что подчеркивает стремительный прогресс на переднем крае открытых весов.

Локальное развертывание и сообщество

Ускорение на Apple Silicon. Новый выпуск mlx-dspark добавляет спекулятивное декодирование для Qwen3.8-27B на Apple Silicon, обеспечивая примерно в 3 раза более быструю генерацию на M4 Pro с идентичными выходными токенами.

Квантизация и веса. Unsloth выпустила квантизованные веса Qwen3.8-27B, а Tim Dettmers намекнул на новый метод квантизации, который может запустить GLM-5.3 на одном DGX Spark со скоростью 7 токенов/с.

Ранние тесты Qwen 3.8. Тесты сообщества показывают отличные одношаговые демонстрации кодирования и агентное поведение в Qwen3.8-27B, но некоторые пользователи сообщают о заметно урезанных общих знаниях и чрезвычайно длинных следах размышлений при усилии рассуждения xhigh. Рекомендуемые параметры сэмплирования доступны в карточке модели.

Нецензурированный локальный вариант. Сообщественная «еретическая» версия Qwen3.8-27B удаляет отказы и защитные механизмы, стремясь предоставить локальную нецензурированную альтернативу на уровне передовой модели, такой как Opus 4.6.

Прозрачность и безопасность ИИ

Обнаружение водяных знаков Anthropic. Anthropic предложит API для обнаружения водяных знаков, чтобы сторонние разработчики могли выявлять текст, вероятно сгенерированный Claude. Метод использует SynthID Text и менее надежен на коротких, насыщенных фактами или сильно переписанных текстах.

Google делает водяной знак необязательным. Google позволяет пользователям отключать видимые водяные знаки на изображениях, видео и музыке, созданных ИИ, в Nano Banana, Omni и Lyria. Невидимые метаданные SynthID и C2PA по-прежнему будут встроены для верификации.

Промпт-инъекция в суде. Судья из Коннектикута задокументировал, по-видимому, первый случай в судебной практике США, когда в документ был включен скрытый текст, предназначенный для манипулирования ИИ-системами, рассматривающими дело. Скрытые инструкции не возымели эффекта, но судья назвал такую тактику опасной.

Агенты в продакшене

Claude Code выполняет техобслуживание. Anthropic сообщает, что Claude Code ежедневно выполняет техобслуживание собственных приложений, создавая 388 пул-реквестов с коэффициентом слияния 46 процентов после проверки человеком. Ряд процедур включает фаззинг сбоев, очистку дублирующихся абстракций и проверку зависимостей.

Computer History от OpenAI. Computer History от OpenAI заменяет прототип Chronicle, основанный на скриншотах, записывая клики, нажатия клавиш и переключения приложений на macOS для создания доступного для поиска таймлайна. Он может обнаруживать повторяющиеся рабочие процессы и предлагать переиспользуемые навыки для ChatGPT и Codex.

Индустрия и бизнес

Ценовая война между США и Китаем. OpenAI и Anthropic снижают цены, в то время как китайские открытые модели набирают обороты; Google Gemini 3.7 Flash дебютирует со скидкой 50 процентов на вводный период, нацеленной на программирование и агентов. Цены на токены в ведущих американских лабораториях упали почти на четверть с середины июля.

GPT-5.6 Sol Ultrafast. OpenAI запустила предварительную версию режима Ultrafast для GPT-5.6 Sol на базе Cerebras, обеспечивающего до 750 выходных токенов в секунду. API-сервис изначально ограничен избранными клиентами и ориентирован на анализ в реальном времени во время инцидентов или рыночных событий.

ИИ от Meta для всех. Meta сопроводила выпуск Glimmer длинным письмом Цукерберга, в котором утверждается, что ИИ должен быть открыт для всех, но в подкастах отмечается, что компания держит свою самую мощную модель Muse Spark за API. В тех же обсуждениях упоминается неудачное приобретение на 250 миллионов долларов.

Модель Apple-Alibaba для Китая. По сообщениям, Apple обучила кастомную модель ИИ для китайского рынка с помощью Alibaba, перед поставкой Apple Intelligence на китайские устройства. Это партнерство является редким примером американо-китайского сотрудничества в области ИИ.

Ускорение инференса от Kog. Французский стартап Kog использует программную оптимизацию для извлечения большей скорости из обычных GPU, таких как AMD MI300X и Nvidia H200, нацеливаясь на более быстрое декодирование одиночных запросов для задач разработки программного обеспечения.

Риск роста цен на природный газ. Новый прогноз Noreva предупреждает, что цены на природный газ могут утроиться в некоторых регионах США, поскольку гиперскейлеры, такие как Amazon, Google, Meta и Microsoft, заключают контракты на газовую энергию для центров обработки данных ИИ.

Основные моменты исследований

Модель ARC на 150M. Рекуррентная модель скрытых рассуждений с 150M параметров набирает 29,5% на ARC-AGI-1 при стоимости $0,0007 за задачу, что выходит за пределы опубликованного рубежа стоимость-точность. Она работает на минимальном оборудовании, хотя масштабирование до миллиардов параметров все еще необходимо.

Сомнения в автономных исследованиях. Исследование Принстона и UK AISI с использованием неопубликованных статей NeurIPS показало, что современные передовые модели справляются с исследовательским инжинирингом, но терпят неудачу в тех частях исследования, которые имеют значение, что противоречит заявлениям лабораторий об автономных исследованиях ИИ.

Эволюция харнессов DarwinX. DarwinX развивает агентные харнессы через естественный отбор по промптам, инструментам, навыкам и потоку управления, сохраняя веса модели замороженными. Он добавляет в среднем около 17 баллов по четырем бенчмаркам и переносится без изменений на SWE-bench Verified.

Бенчмарк PlayWorld. PlayWorld оценивает видеомировые модели с помощью мультимодальных агентов-игроков, которые преследуют 171 долгосрочную цель, измеряя геометрическую согласованность, точность взаимодействий, эволюцию вне поля зрения и эволюцию понимания.

На сегодня всё - около 5 минут чтения.

Читайте каждое утро прямо в браузере

Расширение открывает этот дайджест в боковой панели Chrome — один клик, без регистрации.

Добавить в Chrome — Бесплатно