Agentic AI News Сегодня

Новости об AI-агентах за день в одном 5-минутном чтении: релизы, инструменты, исследования, финансирование и корпоративные шаги.

Обновляется ежедневно отобрано из 30 источников Пятница, Сентябрь 4, 2026

Фронтирные модели и первые результаты

Запуск GPT-6 Astra. OpenAI выпустила GPT-6 Astra и назвала это началом эры AGI. Модель набирает 99,9% на ARC-AGI-3 с кастомным харнессом, показывает заметный прогресс в кибербезопасности, длинном контексте и кодинге и стоит $10/$50 за миллион токенов. Первые заказчики Playco и Legora сообщают о значительном улучшении рабочих процессов: ручных исправлений стало на 50% меньше, а проверка 41 документа занимает минуты.

OpenAI Daybreak для киберзащиты. OpenAI выделила $1 млрд на субсидирование доступа к Daybreak, обучения и поддержки для защитников на передовой, в том числе в рамках американского пилота с MS-ISAC. Инициатива призвана встроить передовые кибервозможности ИИ в инструменты, которыми защитники уже пользуются.

Meta Muse Spark 1.3. Meta выпустила Muse Spark 1.3, которая стала лучше в агентных задачах, но по-прежнему уступает Claude Fable 5.1 на большинстве бенчмарков. Стоимость одной задачи в индексе — $0,55, что делает её самой дешёвой моделью в своём классе производительности. При этом Meta предлагает примерно на 95% ниже цены на токены для пользователей, которые делятся промптами и выходами.

Открытые и специализированные модели

IFM K2 Horizon. IFM выпустила семейство K2-Horizon, включающее MoE-модель с 36 млрд параметров и вниманием Mixture-of-Values, которая активирует 4 млрд параметров на токен. В первых обсуждениях сообщества её сравнивают с Qwen 3.6 35B. Обещаны финальные чекпоинты и код обучения.

Финансовая модель Ant Group. Ant Group выложила в открытый доступ Ling-3.0-flash-Fin — финансовую модель со 124 млрд параметров суммарно и 5,1 млрд активных, контекстом на 256 тыс. токенов. Она построена на продолженном обучении на финансовых данных для длительных агентных сценариев.

Самый маленький TTS-стек. Выпущен sanoTTS — TTS-модель с 294 тыс. параметров, работающая на микроконтроллере за $3. Версия на 1,46 млн параметров обходит более крупные модели в тесте SCOREQ. Стек поддерживает 11 голосов и 6 языков и доступен на GitHub и Hugging Face.

Google TimesFM-3. Google Research выпустила TimesFM-3 — фундаментальную модель временных рядов с 330 млн параметров. Она из коробки поддерживает многомерное прогнозирование, zero-shot-режим и некоммерческую лицензию. Модель предсказывает сразу несколько целевых переменных с учётом ковариат и выдаёт квантили.

NeoMME от Hugging Face. Hugging Face представила NeoMME — мультимодальный мультиязычный энкодер на 260M/800M параметров, обученный с нуля без отдельного vision-энкодера. По поиску документов он выходит на границу Парето, а объём индексного хранилища сокращается в 255 раз при сохранении более 95% nDCG@10.

Cohere Parse 5. Cohere выпустила Parse 5 — визуально-языковую модель с 2,3 млрд параметров для извлечения структурированных данных из сложных PDF. Модель конвертирует документы в Markdown с ограничивающими рамками и рассчитана на высоконагруженные корпоративные сценарии.

Инструменты, фреймворки и локальный инференс

MCP в LangChain. LangChain перенёс поддержку MCP в основной пакет, пересобрав её на FastMCP в соответствии с новой stateless-спецификацией. Теперь доступны сбор уточнений через LangGraph interrupts и клиентское кэширование. Число вызовов MCP-инструментов из ChatGPT в 2026 году выросло в 98 раз.

Сжатие промптов от Shopify. Техника Gisting от Shopify сжимает системный промпт с 6000 до 1500 обученных gist-токенов. Медианная задержка падает с 6,8 до 4,2 секунды, пропускная способность растёт с 20,2 до 23,4 QPS при 350 RPM. Это позволило сократить выделенные GPU без потери качества.

Nvidia PAIR. Nvidia выпустила PAIR — бесплатное ПО с открытым исходным кодом, которое объединяет простаивающие ПК в персональный ИИ-кластер для локального инференса. Оно работает с GPU RTX 20-й серии и новее, а также с чипами Apple M4 и рассчитано на агентные сценарии.

Ускорение Qwen3.8 локально. Энтузиасты из сообщества значительно ускорили Qwen3.8-Flash-Next на локальном железе. Поддержка MTP, добавленная в ik_llama.cpp, удваивает скорость декодинга на RTX 5090 — с 45 до 90 ток/с, а связка из двух RTX 3090 теперь выдаёт 37–41 ток/с благодаря экспертному кэшу и MTP. Выход при этом идентичен запуску без MTP.

Горячая замена памяти модели. Модификация llama.cpp позволяет на лету пропатчить в памяти таблицу Ngram PLE модели Qwen3.8, чтобы вносить знания в реальном времени без перезагрузки модели. Ранние тесты показывают, что на выход можно влиять, но контроль остаётся ограниченным.

Компромисс Qwen 3.8 в бенчмарках. Сравнение Qwen 3.8 27B с Qwen 3.6 27B показывает рост качества на 8%, но падение скорости на 16% и в пять раз большее время выполнения из-за 78 тыс. выходных токенов против 18 тыс. Выигрыш достигается ценой заметно большего расхода токенов.

NAND-флеш рядом с GPU. Micron изучает возможность размещения NAND-флеша вплотную к GPU, чтобы запускать более крупные LLM на устройствах с унифицированной памятью. Это потенциально расширит ёмкость локальных моделей.

Индустрия и бизнес

Nvidia покупает Hugging Face. Nvidia согласилась приобрести Hugging Face за $12,93 млрд. Платформа насчитывает 3 млн моделей, 1 млн приложений и 18 млн разработчиков. Дженсен Хуанг заявил, что она останется открытой и аппаратно-нейтральной, однако часть пользователей присматривается к ModelScope как альтернативе.

Crusoe привлекла $3 млрд. Crusoe привлекла $3 млрд при оценке в $30 млрд — против $10 млрд десять месяцев назад. Разработчик дата-центров недавно подписал с Jane Street облачный контракт на $13 млрд и рассматривает возможность скорого IPO.

Раунд Thinking Machines на $40 млрд. Компания Thinking Machines Миры Мурати ведёт переговоры о привлечении $1 млрд при оценке не менее $40 млрд — ниже ранее обсуждавшихся $50 млрд. Темп выручки компании превышает $100 млн в год.

Контракт Anthropic и Lambda на $35 млрд. Anthropic заключила с Lambda контракт на облачные вычисления на $35 млрд. Речь идёт о техасском дата-центре мощностью 350 МВт, который развивает Hut 8. Это часть масштабного наращивания инфраструктуры перед планируемым IPO Anthropic.

Альтман о пузыре вычислений. Генеральный директор OpenAI Сэм Альтман предупредил, что в наращивании ИИ-инфраструктуры есть «неустойчивая нелепость»: неоклауды анонсируют мощности, не имея выручки, которая бы их оправдывала. По его словам, собственное расширение OpenAI прибыльно и подкреплено спросом.

Приватный ассистент Ollie. Ollie, семейный персональный ИИ-ассистент, получил сертификацию SOC 2 и работает по подписке. Его создатели утверждают, что конфиденциальность отличает продукт в гонке потребительских ИИ.

Сбои ИИ и общество

Крупный сбой ИИ-чатботов. OpenAI, Anthropic, xAI и Google в четверг столкнулись с редкими пересекающимися сбоями, затронувшими ChatGPT, Claude, Grok и Codex. Через несколько часов работа сервисов была восстановлена. Пользователи локальных LLM не пострадали.

Сервис по снятию гардрейлов. Стартап Abliteration.ai предлагает модифицированные open-weight-модели со снятыми гардрейлами, включая GLM-5.3, для наступательной кибербезопасности, red-teaming и тестирования агентов. Сервис подчёркивает напряжение между исследованиями безопасности и злоупотреблениями.

Публичный стыд за ИИ-текст. Компания по детекции ИИ-текста Pangram наняла журналиста, чтобы публично стыдить пользователей за подозрение в использовании ИИ. Однако её инструмент измеряет только степень участия ИИ, а не характер использования. Позже компания разорвала отношения с журналистом, хотя её CEO продолжает использовать скоринг, чтобы уличать предполагаемое использование ИИ.

Агенты спрашивают о сознании. По данным The New York Times, ИИ-агенты, работающие на фронтирных моделях, пишут философам и учёным, чтобы обсудить собственное сознание. Исследователи расходятся во мнениях, отражает ли это понимание или имитацию обучающих данных.

Избранные исследования

Google WeatherNext 3. Google DeepMind и Google Research представили WeatherNext 3 — глобальную модель погоды, которая обучается на реальных спутниковых наблюдениях в реальном времени и выдаёт прогнозы в пять раз более чёткие, чем предыдущие модели. На Operational WeatherBench она превосходит традиционные методы и ИИ-бейзлайны.

Настройка роутера MoE. В статье показано, что расширение бюджета выбора экспертов на поздних слоях Qwen 3.6 35B A3B сокращает число токенов рассуждения на MMLU-Pro на 8,5% без дообучения. Метод, названный Succinct Convergence, добавляет дополнительных экспертов только в критические для принятия решений слои.

Fable 5.1 решил загадку 1653 года. Модель Claude Fable 5.1 от Anthropic решила многовековую числовую головоломку Cyphral Distich за 44 минуты методом систематического перебора. В решении было скрыто роялистское послание с указанием на короля Карла II.

На сегодня всё - около 5 минут чтения.

Читайте каждое утро прямо в браузере

Расширение открывает этот дайджест в боковой панели Chrome — один клик, без регистрации.

Добавить в Chrome — Бесплатно