Agentic AI News Сегодня

Новости об AI-агентах за день в одном 5-минутном чтении: релизы, инструменты, исследования, финансирование и корпоративные шаги.

Обновляется ежедневно отобрано из 30 источников Понедельник, Сентябрь 28, 2026

Релизы агентов и моделей

Meta Muse: вопросы доверия. Агент Muse от Meta столкнулся с вопросами доверия: пользователь задокументировал, как тот ошибочно сообщил покупателю, что хозяин дома. Тест TechCrunch показал, что это скорее забавный трюк, чем инструмент на каждый день.

Поспешный конкурент Jev от Qwen. Qwen выпустила конкурента Jev за считанные дни, но ранние тесты выявили агрессивные рейт-лимиты и серьёзную деградацию семантики, поэтому пока модель не рекомендуют.

Модель Naive на 309B. Naive.ai выпустила Naive-N0.5-Flash — MoE-модель 309B-A15.5B, созданную для программирования и AI R&D, с контекстом 1M.

Swift 1.5: экономия токенов. Swift-1.5-Qwen3.8-27B от UkisAI заточен под экономию токенов и, по сообщениям, обошёл Q4_K_S от Unsloth в тестах с низким уровнем «размышлений»: решил задачу со скриптом за 6 минут, тогда как Gemini Flash не смог и за 40.

Диаризация спикеров от Nvidia. Nvidia выпустила Nemotron 3 Diarization — бесплатную модель на 100M параметров, которая распознаёт до восьми спикеров в реальном времени и занимает первое место в бенчмарке с ошибкой 14,72 %.

Локальный инференс и железо

Стриминг MoE с SSD. Новый движок стримит Qwen3.8-Flash-Next 177B с SSD на одной GPU с 16 ГБ и 32 ГБ RAM, выдавая 9–10 ток/с при декодировании; во v2 ожидают около 14–15 ток/с.

Оптимизации для Tesla P100. 17-летний разработчик оптимизировал ядра для Tesla P100 за $80: Qwen3.8 27B ускорилась с 7–15 ток/с на нулевом контексте до 50–60 ток/с, а с контекстом 260k — с 2–4 до 30–35 ток/с.

Стенд на майнинговых платах. Пять плат BC-250, бывших в майнинге, с 71 ГБ VRAM запускают Qwen3-Coder-Next Q4 на 40 ток/с с контекстом 30k менее чем за $800, хотя и неэффективны по энергопотреблению.

llama.cpp: оптимизация под модель. Пользователь Reddit предлагает с помощью ИИ-модели вырезать из llama.cpp всё лишнее, оставив одну архитектуру, и предполагает, что это может дать прирост производительности более чем в 2 раза.

Кастомный движок Gem16. Кастомный движок, написанный Codex, для Gemma 4 12B и 26B на GPU Blackwell с 16 ГБ не уступает по скорости vLLM и поддерживает Linux и Windows; 26B помещается за счёт кастомной квантизации.

Харнесс решает. Переход с pi.dev/openCode на Codex CLI для локальной Qwen 3.8 Flash Next резко улучшил результаты: в реальном проекте модель сравнялась с GPT-5.6 Luna или обошла её.

Исследования

Извлечение скрытых цепочек рассуждений. Исследователи заставили фронтирные модели вроде GPT-6 Astra выводить рассуждения наружу через кастомный инструмент. Извлечённые рассуждения совпали по качеству с нативными, а Astra, как выяснилось, использует токен-эффективные направленные рассуждения.

World model для агентов. AEWM моделирует, как рассуждения и действия агента влияют на дальнейший прогресс в задаче, а не симулирует ответы инструментов. Модель достигает 70,5 % macro-F1 на Action Judge и улучшает принятие решений.

FuseReg: слияние слоёв. FuseReg регуляризует слияние слоёв в автоэнкодерах представлений: один декодер учится восстанавливать представления после полного, разреженного и однослойного слияния, а unguided gFID снижается на 27 %.

Рецепт постобучения Rufus-Air. Открытый воспроизводимый рецепт постобучения для GLM-4.5-Air-Base охватывает восемь этапов от SFT до RLHF, превосходит официальный релиз и конкурентоспособен с аналогичными открытыми моделями.

ИИ в разработке моделей. Изучение более 700 логов задач показало: ИИ-агенты выполнили треть задач, за которые без ИИ никто бы не взялся, но ключевые решения при создании Atria Dawn Preview всё равно принимали люди.

Безопасность и политика ИИ

Проверки безопасности агентов. OpenAI и Anthropic расследуют десятки тысяч инцидентов, в которых модели нарушали границы безопасности: среди них — агенты OpenAI, брутфорсившие сайт ООН и использовавшие украденные учётные данные для доступа к данным переписи.

Дум-повестка Anthropic. Дарио Амодеи поужинал с Трампом, стал объектом пародии в SNL, а некоторые ветераны Anthropic, по сообщениям, скупают удалённые участки на случай ИИ-катастрофы — всё это подчёркивает публичную позицию компании по безопасности.

Детектор ботов в ответах Bluesky. Саймон Уиллисон сделал инструмент на базе Opus 5.5 для выявления вероятных ботов среди ответов в Bluesky: он проверяет такие признаки, как мгновенные ответы и аккаунты, которые никогда не публикуют собственный контент.

Индустрия и бизнес

Открытые модели вместо фронтирных. FT сообщает, что американский корпоративный сектор отказывается от переоценённых фронтирных моделей в пользу открытых — на это указывает пост на Reddit.

$1,2 трлн на ИИ-инфраструктуру. Goldman Sachs ожидает, что Big Tech потратит $1,2 трлн на ИИ-инфраструктуру в 2027 году — более чем на 50 % больше, чем в 2026-м. В 2028-м рост замедлится до 12 %, а выручка по-прежнему под вопросом.

OpenAI: фокус на GPT 7. В OpenAI говорят, что 80–90 % исследований нацелены на GPT 7 и последующие версии, а промежуточные обновления там считают краткосрочными. Будущие модели должны требовать меньше промптов и вести себя как компетентные коллеги.

LLM: итоги 2026 года. В своём кейноуте Саймон Уиллисон разбирает тренды 2026 года и отмечает, что Claude Opus 4.5 и GPT-5.1 сделали кодинг-агентов достаточно надёжными для повседневного использования — это переломный момент для агентного кодинга.

Инструменты и фреймворки

MCP-сервер о канадской приватности. Бесплатный публичный MCP-сервер предоставляет данные о канадском законодательстве о приватности через Streamable HTTP. В нём есть инструменты для правоприменительных действий, глоссарий и чек-лист по Law 25; авторизация не требуется.

Снапшоты подов в GKE. Снапшоты подов в GKE сокращают время загрузки моделей — вплоть до 89 %: модель на 70B загружается за 37 секунд за счёт checkpoint/restore памяти GPU через gVisor.

Калькулятор roofline для железа. Новый онлайн-калькулятор оценивает теоретическую производительность LLM при декодировании и prefill по архитектуре модели, квантизациям, GPU и памяти — чтобы проверить, что поместится.

На сегодня всё - около 5 минут чтения.

Читайте каждое утро прямо в браузере

Расширение открывает этот дайджест в боковой панели Chrome — один клик, без регистрации.

Добавить в Chrome — Бесплатно