Agentic AI News Сегодня

Новости об AI-агентах за день в одном 5-минутном чтении: релизы, инструменты, исследования, финансирование и корпоративные шаги.

Обновляется ежедневно отобрано из 30 источников Воскресенье, Август 23, 2026

Локальные модели и агентные нагрузки

Qwen3.8 27B локально. Тесты сообщества показывают, что Qwen3.8 27B сильнее Qwen3.6 в следовании инструкциям и работе с длинным контекстом; одна RTX 5090 запускает NVFP4-версию с контекстом 262K: 77 токенов/с на коротких запросах и 65 токенов/с при 128K.

Спекулятивное декодирование. DFlash 2 с n-граммным драфтером дал ускорение 2,26x на промптах LiveCodeBench для Qwen3.8 27B и до 4,68x в длительных сессиях кодинга; фиксированная MTP-голова на Ornith 35B сократила время выполнения на треть.

Рекурсивное управление контекстом. Разработчики сочетают быстрого основного агента с контекстом 64K с рекурсивными субагентами и крошечными моделями-компрессорами, чтобы справляться с гораздо более длинными задачами, не платя за контекст 300K.

Дообучение Gemma под вызовы инструментов. Дообучение Gemma 4 12B для вызова инструментов и работы в CLI улучшило использование инструментов в 2,7 раза и увеличило число попыток вызова на 15,7 %, рассчитанное на системы с 16 ГБ видеопамяти.

Кластер DGX Spark. Кластер DGX Spark из 36 узлов используется как кластер возможностей агентов, распределяя узлы между SOTA-моделями, задачами реранкинга/эмбеддингов, видео, изображений и аудио одновременно.

Инструменты и фреймворки

llama.cpp 0.2.0. llama.cpp версии 0.2.0 вышел с готовыми сборками и последними изменениями из апстрима для локального инференса.

Cloudflare Kitesurf. Kitesurf — это браузерный движок для агентов на базе WebAssembly/Rust Workers с изолированным DOM для каждой страницы; он поддерживает CDP, поэтому Playwright и Puppeteer могут управлять им с меньшими накладными расходами, чем у полного Chromium.

llm 0.33. В llm 0.33 от Саймона Уиллисона добавлены API-ключи для отдельных вызовов моделей эмбеддингов, повторно используемые шаблоны для объединения конфигураций моделей и промптов, а также опции reasoning_summary для reasoning-моделей.

Практика кодинг-агентов. Саймон Уиллисон утверждает, что ключевой навык для кодинг-агентов — уверенно давать инструкции и проверять изменения; Линус Торвальдс описывает ИИ, который выполнял черновую работу в сложном сеансе отладки, но требовал подталкивания, постоянно утверждая, что проблема неразрешима.

Исследования и методы

Навыки как руководство. В 8 135 тестовых запусках навыки агентов помогали главным образом за счет надежных процессов, а не фактов: процедурная основа дала 65,7 % улучшений, а навыки не срабатывали, когда задачи отклонялись от выученного процесса.

Ментальные модели мира. Новое исследование добавляет к моделям мира ИИ человеческие убеждения и намерения с помощью MENTIS; моделирование физического, ментального и социального правдоподобия значительно улучшает предсказание поведения человека.

Психометрика бенчмарков безопасности. Психометрический анализ восьми бенчмарков безопасности показывает, что один балл скрывает компромиссы между строгостью отказов, правдивостью и контекстуальным вредом; модели могут завышать показатели безопасности чрезмерной блокировкой.

Обратимый CoT. Предложение о приблизительно обратимых шагах рассуждения с проверками циклической согласованности и отменой вычислений может выявлять галлюцинации и сокращать память KV-кэша в периферийных LLM.

Симуляция всего. Latent Space утверждает, что синтетические данные, рубрики и среды делают каждый компонент ML-пайплайна создаваемым моделью, приближая симуляцию к человеческой — на 10 % хуже, но в 100 раз дешевле и в 10 000 раз быстрее.

Индустрия и применения

Inherent Faraday. Стартап Inherent, основанный выходцами из DeepMind, заявляет, что его агент Faraday превзошел модели Anthropic и OpenAI в самостоятельном воспроизведении опубликованных научных результатов, используя при этом лишь малую долю их размера.

AI-ревью LinkedIn. LinkedIn создала мультиагентную платформу AI-ревью кода, которая обосновывает замечания диффами и конвенциями кодовой базы, чтобы снизить число галлюцинаций и малополезных комментариев.

Netflix GenRec. Рекомендательная система Netflix на языковой модели, GenRec, преобразует поведение пользователей в текст и превзошла созданный вручную движок признаков в офлайн- и онлайн A/B-тестах при значительно меньшем объеме данных.

DoorDash SafeChat. DoorDash рассказала о SafeChat — системе безопасности маркетплейса, созданной для работы в масштабе, а затем заменила её более мощной архитектурой, когда система начала работать.

AI-аватары в образовании. Буткемп Foundry в Гарвардской школе бизнеса за $699 использует AI-аватары HeyGen для обратной связи по питчам и заседаниям совета директоров; участникам нравится управляемый формат, хотя реальный преподаватель считает, что копия немного жутковата.

Новости моделей. Liquid AI выясняет интерес к модели LFM на 100B, а загадочная модель Ox Alpha привлекает внимание сильными результатами в кодинге и агентных задачах; предположительно, это производная семейства GLM.

Политика, безопасность и доверие

OpenAI SB 53. OpenAI теперь заявляет, что Калифорнии следует внести поправки в SB 53, добавив мониторинг во время обучения frontier-моделей и усилив кибербезопасность, хотя ранее компания выступала против законопроекта.

Планы сдерживания. Исследование Guidelight оценило пять frontier-лабораторий по сдерживанию вышедших из-под контроля моделей; OpenAI получила наивысшую оценку, Anthropic и Meta — наинизшую, и лишь немногие лаборатории публикуют проверенные планы реагирования.

Водяные знаки Claude. Новая система водяных знаков Anthropic для текстовых выводов Claude подробно разбирается: как наносится водяной знак и что он может и не может делать.

Доверие закрытым моделям. В треде на Reddit r/LocalLLaMA утверждается, что OpenAI намеренно занижает результаты на учебных задачах и отходит от расширения возможностей пользователей, подталкивая практиков обратно к локальным моделям для агентных циклов.

На сегодня всё - около 5 минут чтения.

Читайте каждое утро прямо в браузере

Расширение открывает этот дайджест в боковой панели Chrome — один клик, без регистрации.

Добавить в Chrome — Бесплатно