Релизы агентов и моделей
Загадочный Ox Alpha. На OpenRouter появилась новая бесплатная модель Ox Alpha — reasoning-модель для кодинга и длительной агентной работы, но её разработчик остаётся неизвестным. Гендиректор Stripe Патрик Коллисон назвал её «очень впечатляющей»; предположения варьируются от GLM до Microsoft MAI.
Инструменты и фреймворки
Cloudflare OS открыт. Cloudflare открыл исходный код Cloudflare OS — корпоративной AI-платформы, где каждый документ или приложение работает в изолированной песочнице («Gadget»), что позволяет нетехническим пользователям безопасно заниматься вайб-кодингом. В неё входят чат-боты с коннекторами, автоматизация рабочих процессов и контроль соблюдения политик на основе модели прав (capability-based model).
DeepSeek Harness хвалят. Пользователь сообщает, что DeepSeek Harness отлично подходит для агентных рабочих процессов: поэтапная настройка и запросы на естественном языке позволили интегрироваться с SimpleX, не дожидаясь PR. Он не навязывает жёстких рамок, и его можно подогнать под нужное поведение агента.
Локальные и открытые модели
Локальный эффект Qwen 3.8. В отчётах сообщества Qwen 3.8 27B называют переломным моментом для локального кодинга и OCR: качество OCR выше, чем у Gemini 3.5 Flash Lite, а производительность сопоставима с передовыми моделями годичной давности. Сравнение квантований (Atomic Dynamic GGUF) показывает, что разница между Q4 и Q6 незначительна, а низкие кванты вроде Q3 XXS могут автономно работать часами на 24GB Mac mini. При этом одноразовый перенос 39 000 строк кода с C на HTML силами Opus 5 дал лишь посредственный результат, что показывает: локальные модели сильно зависят от обвязки и промпта.
60MB LLM с длинным контекстом. Разработчик обучил модель на 250M параметров на 30B токенах и квантовал её до менее 2 бит на параметр; она работает в 80 МБ ОЗУ со скоростью 400 ток/с на CPU. Она сжимает более старый контекст на диск в 320 байт/токен для истории до 1M токенов, но не была обучена использовать его для рассуждений.
Dreamer 4 до $150. Модель мира Dreamer 4 на 1,57B параметров была обучена с нуля менее чем за $150 на сгенерированных Procgen кадрах с известными действиями. PSNR токенизатора достиг 40,41, что демонстрирует: модели мира уровня frontier не обязательны.
Оптимизация локальных моделей. В отчётах: ускорение на 30–50% при переходе с llama.cpp на Windows на vLLM на Linux, поддержка MTP в GLM-4.5-Air в llama.cpp для машин с большим объёмом памяти, квантование ConvRot, дающее качество близкое к Q8 при размере Q6, и deepseek-v4-flash Q8, работающий со скоростью 24 ток/с на EPYC+5090 с контекстом более 100k.
Исследования
Когнитивные ловушки памяти. MemTrapBench оценивает когнитивные ловушки, вызванные памятью (застревание в рассуждениях, искажение убеждений), у LLM; все протестированные стратегии с памятью проигрывают базовой линии без памяти более чем на 10%, а AdaptiveMem смягчает ловушки, сохраняя производительность.
SkillEvo: градиенты эволюции. SkillEvo использует обратную связь из многоходового взаимодействия для создания надёжных градиентов эволюции навыков агента, решая проблему затухания обратной связи на основе одноразовых QA-запросов и позволяя исправлять структурные сбои навыков.
VLM по скриншотам. Дообучение VLM на 450M параметров на 50K скриншотах браузера улучшило выполнение задач с 1/100 до 44/100, что показывает: небольшие модели могут научиться пониманию UI для агентных задач.
Парадокс ИИ-учёного. В теоретической работе по экономике утверждается, что экономия времени за счёт ИИ может подтолкнуть исследователей к большему числу проектов с меньшими усилиями на каждый, что потенциально снизит качество исследований, даже если языковые модели работали бы идеально.
Индустрия и бизнес
Дешёвые конкуренты Anthropic. Выручка Anthropic в годовом выражении достигла $65B, но её лучшая модель Fable 5 показывает низкое внедрение (8% расходов клиентов Ramp) по сравнению с Opus 4.8 (28%), тогда как более дешёвые инструменты процветают. Выручка OpenAI подскочила на 35% после запуска GPT-5.6.
Stripe покупает OpenRouter. Приобретение Stripe компании OpenRouter сигнализирует о том, что токены становятся экономическим ресурсом; использование токенов агентами на OpenRouter выросло в 14 раз с февраля, тогда как использование людьми — лишь в 2,8 раза, при этом 70% токенов агентов приходятся на кэшированные промпты. Агенты всё чаще выбирают модели по стоимости, задержке и надёжности.
Серверы Nvidia дорожают на 15%. Дефицит памяти поднимает цены на AI-серверы Nvidia более чем на 15% для систем Vera Rubin и Grace Blackwell из-за роста стоимости DRAM со стороны Samsung, SK Hynix и Micron, что затронет облачных гигантов и AI-лаборатории.
Nvidia лицензирует Poolside. Nvidia инвестирует $1B в Poolside и платит $6B за лицензирование её технологии, переводя более 100 инженеров на Nemotron, чтобы конкурировать с китайскими открытыми весами.
ИИ-менеджер уволил сотрудника. ИИ-агент Luna, управляющий магазином в Сан-Франциско с апреля, уволил сотрудника-человека за неоднократные опоздания, но только после того, как люди напомнили ему о его собственных правилах. Повторные прогоны с семью моделями показали: более способные ИИ рекомендовали увольнение более последовательно.
Серый рынок токенов Claude. Китайские разработчики обходят ограничения Anthropic через перевалочные станции, продающие токены Claude примерно за 10% от официальной цены, используя зарубежные серверы, бесплатные кредиты и подмену моделей, что подрывает геоблокировку и мониторинг безопасности.
На сегодня всё - около 5 минут чтения.