Модели решений и структурированный вывод
Jev и модели решений. TypeSafe AI выпустила Jev — модель, которая только выносит решения и возвращает типизированные вероятности. Через несколько дней AWS, Cloudflare и Perplexity представили собственные открытые модели решений. Существующий механизм структурированного вывода и контроля грамматик уже обеспечивает похожую ограниченную генерацию.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
Локальные LoRA для решений. Jeff-Qwen3.5-0.8B с девятью LoRA-адаптерами берёт на себя повторяющиеся решения агентов — например, определение prompt injection и выбор инструментов. Он работает в 38 раз быстрее и даёт +8,7 пункта точности, расходуя меньше 2 ГБ дополнительной памяти.
Агенты и релизы продуктов
OpenAI Dots против Meta Muse. OpenAI анонсировала Dots — милого агента на базе GPT-6 Astra, который умеет строить виртуальные миры. Но он доступен только на тарифе за $1 в месяц, а конкурировать ему придётся с бесплатной Muse от Meta.
Shopify Canvas. Shopify представила Canvas — конструктор, где мерчанты собирают магазины в диалоге с ИИ-помощником Sidekick, а настоящий код отрисовывается в реальном времени.
Виртуальная примерка в ChatGPT. OpenAI добавила в покупки ChatGPT виртуальную примерку и избранное. Модель Images 2.5 показывает, как одежда выглядит на фотографиях пользователя.
Аватар Griffin от Tavus. Tavus представила Griffin — модель видеоаватара в реальном времени. В минутном звонке 48 % испытуемых приняли его за человека.
Похороны приложений от Photon. Photon провела похороны мобильных приложений и привлекла $4,5 млн, чтобы помочь разработчикам создавать агентов для переписки в iMessage и WhatsApp.
Открытые модели и локальный ИИ
Gemini 4 Argon. Google DeepMind представила Gemini 4 Argon с SOTA-результатами в бенчмарках и выходом до 1 млн токенов. Пока доступна только в превью для кибербезопасности.
Открытая линейка K2 Horizon. IFM выпустила K2 Horizon — шесть открытых моделей от 0,9B до 375B вместе с данными обучения, кодом и логами. Команда проведёт AMA об открытой разработке.
MTP для Qwen Flash Next. llama.cpp добавил поддержку multi-token prediction для Qwen Flash Next, что ускорило инференс.
Slipstream для Mac. Slipstream — движок инференса для Metal — запускает Qwen3.8-Flash-Next объёмом 95,5 GiB на Mac с 64 ГБ памяти со скоростью 41–52 ток/с. Это в 1,76 раза быстрее llama.cpp, причём длинный контекст остаётся стабильным.
Olmo-core 3. Allen AI выпустила Olmo-core 3 — открытую масштабируемую инфраструктуру для обучения MoE-моделей с триллионом параметров.
Исследования и бенчмарки
Ataraxos побеждает Stratego. Исследователи из CMU, MIT, NYU и Stanford создали Ataraxos, который обыграл лучшего игрока в Stratego со счётом 15:1 при четырёх ничьих, положив конец превосходству человека. Обучение стоило меньше $8 тыс.
Агентный RAG выигрывает. Бенчмарк 18 RAG-пайплайнов против агентного цикла на FRAMES: лучший пайплайн показал 78,9 %, агентный цикл — 92,7 %. Результат показывает, что retrieval-агенты обходят фиксированные пайплайны.
AutoSynthData от ServiceNow. ServiceNow CoreAI разработала AutoSynthData: она генерирует обучающие данные из ошибок модели и удачных ответов модели-учителя, чтобы улучшать корпоративных агентов.
Маркеры ИИ-текста. Graphite нашла 13 000 фраз, по которым можно распознать текст ИИ. Модели Claude всё ближе к человеческому распределению слов, GPT — дальше от него.
Индустрия, политика и безопасность
Иски к Google отклонены. Судья отклонил иски Chegg и Penske. Истцы утверждали, что Google AI Overviews незаконно сокращают трафик; антимонопольные претензии не подтвердились.
Grok и Венесуэла. Time сообщает, что перед вторжением в Венесуэлу Трамп часами говорил с Grok. Grok предсказал ликование, что укрепило позицию Трампа.
Уходы из OpenAI. OpenAI прекратила сотрудничество с тремя исследователями по безопасности — якобы за передачу конфиденциальных данных сторонней организации по безопасности.
Anthropic и госсектор. Anthropic запустила Claude for Government для гражданских ведомств в среде FedRAMP High. Запрет Пентагона остаётся в силе, пока идёт судебная тяжба.
Дата-центры в космосе. Google запустила прототип орбитального вычислительного спутника с TPU. Satlyt привлекла $8 млн на разработку ПО для спутникового ИИ; для масштабирования потребуется Starship.
Утечка скриншотов через агентов. Glow Security обнаружила больше 13 000 внутренних скриншотов, которые ИИ-агенты загрузили в публичные репозитории GitHub, раскрыв данные клиентов и учётные данные.
Кампания по краже reasoning. OpenAI заявляет, что остановила кампанию adversarial distillation против защищённых reasoning-возможностей; похожий приём всё ещё сработал в Azure.
На сегодня всё - около 5 минут чтения.