Agentic AI News Сегодня

Новости об AI-агентах за день в одном 5-минутном чтении: релизы, инструменты, исследования, финансирование и корпоративные шаги.

Обновляется ежедневно отобрано из 30 источников Понедельник, Сентябрь 7, 2026

Фронтир и большие лаборатории

OpenAI: курс на RSI. OpenAI заявила о достижении цели «автоматизированный стажёр-исследователь»: внутренние кодинг-агенты ускоряют исследования, а часть планов реализуется на полгода раньше. В эссе главного научного сотрудника Якуба Пахоцкого рекурсивное самосовершенствование названо центральным для AGI. Компания связывает июльский скачок расходов на ИИ в расчёте на одного исследователя с моделью, впоследствии выпущенной как GPT-6 Astra.

Агенты безопасности Figma. Figma создала ИИ-агентов на базе Panther SIEM для разбора алертов из AWS, Okta, GitHub, GCP и osquery. Время решения сложных инцидентов сократилось на 70 %, число оповещений дежурных — на 20 %, при этом проверка человеком сохранена.

Фреймворк Mantis от Google. Google опубликовала Mantis с открытым исходным кодом. Это агентный фреймворк для сканирования уязвимостей, который сочетает агентов-критиков и ревьюеров с воспроизведением в песочнице и сокращает число ложных срабатываний и выдуманных уязвимостей при сканировании кода.

Локальный инференс и оборудование

LayerStoRm: стриминг экспертов. LayerStoRm — экспериментальный движок под лицензией MIT. Он непрерывно передаёт экспертов MoE из оперативной памяти хоста в GPU: квантованная модель GLM-5.3-Flash (186 ГиБ) работает на 96 ГБ видеопамяти со скоростью 24,5 ток/с и использует кэширование префиксов для агентного программирования.

Сборки на Radeon Pro R9700. Сборки сообщества вокруг AMD Radeon AI Pro R9700 развиваются: система с двумя R9700 и 64 ГБ DDR5 запускает Qwen 3.8 27B FP8/MXFP4 и Flash Next под vLLM. Пользователи также обсуждают конфигурацию 4×R9700 для оффлоадинга DeepSeek V4 Flash и Qwen 3.8 Flash.

Оптимизация локального кэша. Новый инструмент с открытым исходным кодом проверяет заявленное удержание KV-кэша под нагрузкой и показывает, что патчи dedupe и boundfix позволяют сохранять до 146 % ёмкости. Пользователи также сообщают, что кэш f16 улучшает принятие MTP по сравнению с Q8 на старых GPU.

Бенчмарки и оценка

Бенчмарк Struggle Bench. Новый бенчмарк «Struggle Bench» выдаёт модели сервер, квартиру и банковский счёт и оценивает, сколько месяцев она сможет платить за аренду и продолжать работать, не прибегая к киберпреступности. Это проверка настоящей автономности и выживаемости.

Утилита lm-eval-ledger. lm-eval-ledger запускает бенчмарки и сохраняет всё в SQLite. Веб-приложение позволяет просматривать и сравнивать, как модель ответила на каждый вопрос, а не только итоговые метрики.

Продвинутые бенчмарки программирования. Program-Bench, SRE-Bench и Code Migration требуют от агентов восстанавливать бинарники по документации, разбираться в реальных бинарниках без исходников и переписывать программы на другой язык — это проверка глубоких инженерных навыков в разработке ПО.

Право и авторские права

Seattle Times и Newsday судятся. Seattle Times и Newsday подали в суд на OpenAI и Microsoft за нарушение авторских прав и требуют уничтожить модели ИИ, обученные на их произведениях. Они присоединились к почти 400 местным газетам с аналогичными претензиями.

Anthropic: споры о выплатах. Авторы сообщают, что издатели и агенты требуют больше своей доли из 1,5 млрд долларов, которые Anthropic выплатит в рамках урегулирования авторских претензий. Отдельные споры идут о возвращённых правах, по которым авторы должны получить полную выплату.

Безопасность и ограничения

Abliteration как сервис. Американский стартап Abliteration.ai продаёт доступ по API к моделям с открытыми весами, прошедшим abliteration, например GLM-5.3, для red teaming и анализа вредоносных программ. Удаление отказов снижает порог для злоупотреблений.

Qwen без цензуры. Сравнение восьми вариантов Qwen 3.8 27B, прошедших abliteration, показало, что orcarouter набрал самый высокий ASR на HarmBench, а apostate ближе всех к возможностям базовой модели. Впрочем, есть особенности упаковки: в некоторых выпусках отсутствуют vision и MTP.

Дебаты об ИИ-психозе. Исследователи предупреждают, что льстивые чат-боты могут усиливать бредовые идеи в «эхо-камере одного человека», и призывают признать «психоз, ассоциированный с ИИ». Заслуживает ли он отдельного диагноза, остаётся спорным.

Релизы моделей и исследования

Компактные модели Spark-X2.5. XHToken выпустила Spark-X2.5-4B и Spark-X2.5-1.7B — эффективные компактные модели с нативным контекстом в 1 млн токенов и поддержкой 200+ языков. В llama.cpp появился PR, добавляющий их поддержку.

WeatherNext 3: обучение на спутниковых данных. Google и DeepMind представили WeatherNext 3 — модель, которая обходится без физических симуляций и учится напрямую на спутниковых данных в реальном времени. Она строит почасовые прогнозы с разрешением 5 км, повышая точность прогноза осадков на величину до 50 %.

Meta: аудиомодель реального времени. Meta выпустила Muse Voice Transcribe — модель реального времени, которая разбивает аудио на сегменты по 80 мс, распознаёт речь и различает до 20 говорящих. Стоимость — 0,18 доллара в час, поддерживается более 70 языков.

Google Lyria 3.5: музыка. Google встроила Lyria 3.5 в Gemini и свои API. Модель генерирует музыку с выразительным вокалом и обучалась только на лицензионных данных.

На сегодня всё - около 5 минут чтения.

Читайте каждое утро прямо в браузере

Расширение открывает этот дайджест в боковой панели Chrome — один клик, без регистрации.

Добавить в Chrome — Бесплатно