Релизы агентов и моделей
Claude Fable 5.1. Anthropic выпустила Fable 5.1 и Mythos 5.1, заявив об улучшенных навыках кодинга и исследований и о снижении стоимости агентных задач до 45% за счёт более дешёвого чтения кэша. Версия Fable 5.1 без ограничений уже доступна, хотя ранние анализы расходов оспаривают максимальную экономию при максимальном reasoning effort.
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
Запуск OpenAI Astra. OpenAI утверждает, что её грядущая модель Astra — первая LLM, достигшая критического порога кибербезопасности компании: она способна автономно находить и эксплуатировать неизвестные уязвимости. После взлома Hugging Face компания отложила часть разработки Astra, чтобы усилить меры защиты. Доступ к самым продвинутым функциям кибербезопасности модели будет ограничен.
Новые модели Spark-X2.5. Открытые модели Spark-X2.5-4B и 1.7B появились на Hugging Face с новой архитектурой; производительность заявлена на уровне Qwen 3.5 9B, контекст — нативный на 1M токенов. В основной ветке llama.cpp они пока не работают, но есть кастомный форк.
Runway Solaris: модель интерфейса. Runway представила Solaris — «мировую модель интерфейса», которая в реальном времени генерирует кадры UI и реагирует на клики и голос, не исполняя код. Пока это исследовательский проект с ограничениями в отрисовке текста и поддержке скринридеров.
Локальный ИИ и железо
Локальные тесты Qwen3.8. По сообщениям сообщества, Qwen3.8 27B и Flash-Next работают на разном оборудовании: 12 ток/с на Mac с 48 ГБ, 280 ток/с при декодировании на двух Epyc R9700 с ядрами MXFP4 и 132 ток/с при декодировании на одной RTX 3090 после кастомных оптимизаций. По бенчмаркам квантования UD Q3_K_XL хорошо подходит для карт на 16 ГБ. Некоторые пользователи считают, что Qwen3.8 хорошо пишет код, но слишком охотно вносит правки.
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
Рост цен на DGX Spark. Nvidia DGX Spark и Asus Ascent GX10 значительно подорожали: модель Asus подскочила с $3 999 до $5 999. Покупатели сомневаются, что кластеры из DGX Spark выгоднее систем на AMD Epyc с большей пропускной способностью памяти, хотя DGX поддерживает FP4 и тензорный параллелизм.
Отказы CMP 170HX. Пользователь сообщает, что две из пяти видеокарт CMP 170HX вышли из строя за две недели, а у третьей неисправны тензорные ядра. По его словам, текущие цены не оправдывают риск использования таких карт для инференса LLM.
INT8 и обманчивые кванты. В сообществе обсуждают, почему на RTX 3090 не стало больше моделей INT8 W8A8, если у карты есть нативные тензорные ядра INT8. Другой пользователь обвиняет AtomicChat в том, что тот неверно пометил квант IQ2_S как Q4_K_M.
Планы Intel по памяти. Intel намекнула на возвращение в бизнес по производству памяти: гендиректор упомянул о найме бывшего руководителя SK Hynix Ли Сок Хи и о новой архитектуре памяти. Подробностей пока мало.
Инструменты и фреймворки
Релиз OpenClaw 2.0. Открытый персональный ИИ-агент OpenClaw 2.0 упрощает настройку: он сам обнаруживает действующие подписки ChatGPT/Claude и локальные модели, а браузер становится основным интерфейсом. Также появились общие облачные сессии для совместной работы.
Локальные инструменты Codex. В runtime десктопного приложения OpenAI Codex теперь входят полный пакет LibreOffice и другие бинарники, включая Poppler и git. Это позволяет обрабатывать документы без внешних зависимостей.
ИИ-фабрики разработки. Ведущие ИИ-проекты с открытым кодом, например Flue и tldraw, отклоняют внешние PR и вместо этого подключают команды агентов для триажа, воспроизведения, исправления и ревью задач. Проект Vercel AI SDK развернул мультиагентную «фабрику ПО», чтобы сократить бэклог из более чем 1000 задач и 800 PR.
Terraform для агентов. HashiCorp позиционирует HCP Terraform как контролируемую плоскость управления для инфраструктуры под управлением ИИ. Агенты могут создавать и применять изменения Terraform, при этом политики, идентификация и аудит остаются под контролем.
Обновление datasette-mcp. У плагина datasette-mcp вышла версия 0.2. Результаты SQL-запросов теперь возвращаются в виде объектов, а не массивов, чтобы более слабые модели лучше сопоставляли колонки.
Исследования и безопасность
Аудит бенчмарков BenchMIRT. Hugging Face представила BenchMIRT — метод аудита LLM-бенчмарков на уровне отдельных промптов. Он показал, что промпты в одном бенчмарке могут измерять разные способности, а усреднённые баллы могут это скрывать.
Агентное видео в Gemini. Google DeepMind запустила агентное понимание видео в моделях Gemini 3.7/3.6/3.5 Flash-Lite. Технология использует нативные видеоинструменты, чтобы динамически искать и анализировать фрагменты, повышая точность и сокращая расход токенов.
Водяные знаки для текста Claude. Anthropic предоставила регуляторам, СМИ и фактчекерам API для проверки водяных знаков, как того требует EU AI Act. Авторизованные организации смогут обнаруживать созданный Claude текст по статистическому паттерну, который может сохраняться после некоторых правок.
Выборы и предвзятость ИИ. AlgorithmWatch выяснила, что AI Overviews Google о выборах непоследовательны, опираются на небольшое число источников и иногда описывают кандидатов в партийном ключе. Кроме того, ИИ-поиск Google выдавал советы по экстренным вызовам в зависимости от национальности; компания уже исправила ошибку.
Индустрия и бизнес
Стремительный рост AfterQuery. Стартап AfterQuery по подготовке обучающих данных для ИИ, по сообщениям, привлёк финансирование при оценке в $3,2 млрд. За пять месяцев оценка выросла в 10 раз, что сделало его самым быстрым единорогом в истории Y Combinator. Компания нанимает профессионалов, которые обучают модели выполнять задачи на профессиональном уровне.
AIR привлекла $50 млн. Стартап AIR, специализирующийся на безопасности ИИ, вышел из тени с $50 млн. Он помогает компаниям находить агентов и постоянно проверять используемые ими навыки, MCP-серверы и аддоны, блокируя неразрешённые программные взаимодействия.
Google заигрывает с Голливудом. Google, по сообщениям, ищет лицензионные сделки с крупными киностудиями, предлагая крупные выплаты за право обучать ИИ-модели на охраняемом авторским правом контенте. Аналитики предупреждают, что эти сделки могут навредить публичной репутации студий.
Frontier AI в приоритете. Новый глава Google DeepMind Корай Кавукчуоглу заявил, что лидерство в frontier AI — единственное, что имеет значение. Он признал, что нынешние модели немного не дотягивают до уровня frontier, но пообещал сократить разрыв. Конкретных обновлений о Gemini 4 или 3.5 Pro пока нет.
Агенты в операциях. По данным Enterprise Signals от OpenAI, передовые компании генерируют в 8,3 раза больше выходных токенов на одного активного пользователя. Стартапы Basis, Clay и Exa Labs встраивают агентов в онбординг, управление аккаунтами и интеграции для разработчиков.
Apple судится с OpenAI. Apple добивается ускоренного раскрытия доказательств от OpenAI, утверждая, что та не проверила MacBook бывшего сотрудника Apple, где обсуждалось уничтожение криминалистических данных.
Google Pics: инструмент дизайна. Google запустила Google Pics — ИИ-инструмент для создания и редактирования изображений в Workspace на базе Nano Banana. Он составит конкуренцию Canva и Adobe Express: генерация по текстовому описанию и точное редактирование объектов.
Потребительские ИИ-агенты. Fambot представил ИИ-«начальника штаба» для семьи, который занимается бытовой логистикой. John Deere запустила для фермеров JD AI Assistant, работающий на их собственных данных. Amazon добавила в Alexa уведомления о покупках Update Me When.
На сегодня всё - около 5 минут чтения.