Локальные модели и агентные нагрузки
Qwen3.8 27B локально. Тесты сообщества показывают, что Qwen3.8 27B сильнее Qwen3.6 в следовании инструкциям и работе с длинным контекстом; одна RTX 5090 запускает NVFP4-версию с контекстом 262K: 77 токенов/с на коротких запросах и 65 токенов/с при 128K.
Спекулятивное декодирование. DFlash 2 с n-граммным драфтером дал ускорение 2,26x на промптах LiveCodeBench для Qwen3.8 27B и до 4,68x в длительных сессиях кодинга; фиксированная MTP-голова на Ornith 35B сократила время выполнения на треть.
Рекурсивное управление контекстом. Разработчики сочетают быстрого основного агента с контекстом 64K с рекурсивными субагентами и крошечными моделями-компрессорами, чтобы справляться с гораздо более длинными задачами, не платя за контекст 300K.
Дообучение Gemma под вызовы инструментов. Дообучение Gemma 4 12B для вызова инструментов и работы в CLI улучшило использование инструментов в 2,7 раза и увеличило число попыток вызова на 15,7 %, рассчитанное на системы с 16 ГБ видеопамяти.
Кластер DGX Spark. Кластер DGX Spark из 36 узлов используется как кластер возможностей агентов, распределяя узлы между SOTA-моделями, задачами реранкинга/эмбеддингов, видео, изображений и аудио одновременно.
Инструменты и фреймворки
llama.cpp 0.2.0. llama.cpp версии 0.2.0 вышел с готовыми сборками и последними изменениями из апстрима для локального инференса.
Cloudflare Kitesurf. Kitesurf — это браузерный движок для агентов на базе WebAssembly/Rust Workers с изолированным DOM для каждой страницы; он поддерживает CDP, поэтому Playwright и Puppeteer могут управлять им с меньшими накладными расходами, чем у полного Chromium.
llm 0.33. В llm 0.33 от Саймона Уиллисона добавлены API-ключи для отдельных вызовов моделей эмбеддингов, повторно используемые шаблоны для объединения конфигураций моделей и промптов, а также опции reasoning_summary для reasoning-моделей.
Практика кодинг-агентов. Саймон Уиллисон утверждает, что ключевой навык для кодинг-агентов — уверенно давать инструкции и проверять изменения; Линус Торвальдс описывает ИИ, который выполнял черновую работу в сложном сеансе отладки, но требовал подталкивания, постоянно утверждая, что проблема неразрешима.
Исследования и методы
Навыки как руководство. В 8 135 тестовых запусках навыки агентов помогали главным образом за счет надежных процессов, а не фактов: процедурная основа дала 65,7 % улучшений, а навыки не срабатывали, когда задачи отклонялись от выученного процесса.
Ментальные модели мира. Новое исследование добавляет к моделям мира ИИ человеческие убеждения и намерения с помощью MENTIS; моделирование физического, ментального и социального правдоподобия значительно улучшает предсказание поведения человека.
Психометрика бенчмарков безопасности. Психометрический анализ восьми бенчмарков безопасности показывает, что один балл скрывает компромиссы между строгостью отказов, правдивостью и контекстуальным вредом; модели могут завышать показатели безопасности чрезмерной блокировкой.
Обратимый CoT. Предложение о приблизительно обратимых шагах рассуждения с проверками циклической согласованности и отменой вычислений может выявлять галлюцинации и сокращать память KV-кэша в периферийных LLM.
Симуляция всего. Latent Space утверждает, что синтетические данные, рубрики и среды делают каждый компонент ML-пайплайна создаваемым моделью, приближая симуляцию к человеческой — на 10 % хуже, но в 100 раз дешевле и в 10 000 раз быстрее.
Индустрия и применения
Inherent Faraday. Стартап Inherent, основанный выходцами из DeepMind, заявляет, что его агент Faraday превзошел модели Anthropic и OpenAI в самостоятельном воспроизведении опубликованных научных результатов, используя при этом лишь малую долю их размера.
AI-ревью LinkedIn. LinkedIn создала мультиагентную платформу AI-ревью кода, которая обосновывает замечания диффами и конвенциями кодовой базы, чтобы снизить число галлюцинаций и малополезных комментариев.
Netflix GenRec. Рекомендательная система Netflix на языковой модели, GenRec, преобразует поведение пользователей в текст и превзошла созданный вручную движок признаков в офлайн- и онлайн A/B-тестах при значительно меньшем объеме данных.
DoorDash SafeChat. DoorDash рассказала о SafeChat — системе безопасности маркетплейса, созданной для работы в масштабе, а затем заменила её более мощной архитектурой, когда система начала работать.
AI-аватары в образовании. Буткемп Foundry в Гарвардской школе бизнеса за $699 использует AI-аватары HeyGen для обратной связи по питчам и заседаниям совета директоров; участникам нравится управляемый формат, хотя реальный преподаватель считает, что копия немного жутковата.
Новости моделей. Liquid AI выясняет интерес к модели LFM на 100B, а загадочная модель Ox Alpha привлекает внимание сильными результатами в кодинге и агентных задачах; предположительно, это производная семейства GLM.
Политика, безопасность и доверие
OpenAI SB 53. OpenAI теперь заявляет, что Калифорнии следует внести поправки в SB 53, добавив мониторинг во время обучения frontier-моделей и усилив кибербезопасность, хотя ранее компания выступала против законопроекта.
Планы сдерживания. Исследование Guidelight оценило пять frontier-лабораторий по сдерживанию вышедших из-под контроля моделей; OpenAI получила наивысшую оценку, Anthropic и Meta — наинизшую, и лишь немногие лаборатории публикуют проверенные планы реагирования.
Водяные знаки Claude. Новая система водяных знаков Anthropic для текстовых выводов Claude подробно разбирается: как наносится водяной знак и что он может и не может делать.
Доверие закрытым моделям. В треде на Reddit r/LocalLLaMA утверждается, что OpenAI намеренно занижает результаты на учебных задачах и отходит от расширения возможностей пользователей, подталкивая практиков обратно к локальным моделям для агентных циклов.
На сегодня всё - около 5 минут чтения.