Моделі рішень і структурований вивід
Jev і моделі рішень. TypeSafe AI випустила Jev — модель лише для ухвалення рішень, яка повертає типізовані ймовірності. За кілька днів AWS, Cloudflare і Perplexity випустили власні відкриті моделі рішень. Наявне структуроване виведення й примусове дотримання граматики вже дають схожу обмежену генерацію.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
Локальні LoRA для рішень. Jeff-Qwen3.5-0.8B із дев’ятьма LoRA-адаптерами обробляє повторювані агентні рішення — як-от prompt injection чи вибір інструментів — із 38-кратним прискоренням і приростом точності на 8,7. Додаткової пам’яті потрібно менш ніж 2 ГБ.
Агенти й релізи продуктів
OpenAI Dots проти Meta Muse. OpenAI анонсувала Dots — милого агента на базі GPT-6 Astra, який уміє створювати віртуальні світи. Втім, він доступний лише на тарифі за $1 на місяць, тоді як Meta пропонує безкоштовну Muse.
Shopify Canvas. Shopify запустила Canvas: він дозволяє продавцям створювати магазини у чаті з AI Sidekick, а справжній код рендериться в реальному часі.
Віртуальна примірка в ChatGPT. OpenAI додала віртуальну примірку й додавання в обране до покупок у ChatGPT: модель Images 2.5 візуалізує одяг на фото користувачів.
Аватар Tavus Griffin. Tavus представила Griffin — модель відеоаватара в реальному часі; 48% учасників тестування сприйняли його за людину під час хвилинного дзвінка.
Похорон застосунків від Photon. Photon влаштувала похорон мобільним застосункам і залучила $4,5 млн, щоб допомогти розробникам створювати агентів для повідомлень у iMessage/WhatsApp.
Відкриті моделі й локальний ШІ
Gemini 4 Argon. Google DeepMind представила Gemini 4 Argon із SOTA-бенчмарками та до 1 млн вихідних токенів, але спочатку — лише в прев’ю для кібербезпеки.
Відкритий флот K2 Horizon. IFM випустила K2 Horizon — шість відкритих моделей від 0,9B до 375B із тренувальними даними, кодом і логами; команда провела AMA про відкриту розробку.
MTP для Qwen Flash Next. У llama.cpp з’явилася підтримка multi-token prediction для Qwen Flash Next, що підвищує швидкість інференсу.
Slipstream для Mac. Slipstream — рушій інференсу на Metal — запускає Qwen3.8-Flash-Next обсягом 95,5 ГіБ на Mac із 64 ГБ і видає 41–52 ток./с. Це в 1,76 раза швидше за llama.cpp, зі стабільним довгим контекстом.
Olmo-core 3. Allen AI випустила Olmo-core 3 — відкриту масштабовану інфраструктуру для тренування MoE-моделей із трильйоном параметрів.
Дослідження й бенчмарки
Ataraxos перемагає в Stratego. Дослідники з CMU/MIT/NYU/Stanford створили Ataraxos, який обіграв найкращого гравця в Stratego з рахунком 15:1 і чотирма нічиїми, поклавши край перевазі людини; тренування коштувало менш ніж $8 тис.
Agentic RAG перемагає. Бенчмарк 18 RAG-пайплайнів проти агентного циклу на FRAMES: найкращий пайплайн — 78,9%, агентний цикл — 92,7%. Це показує, що retrieval-агенти перевершують фіксовані пайплайни.
AutoSynthData. ServiceNow CoreAI створила AutoSynthData, щоб генерувати тренувальні дані з помилок моделей і успіхів teacher-моделей та покращувати корпоративних агентів.
Ознаки ШІ-тексту. Graphite виявила 13 000 фраз-маркерів ШІ; моделі Claude дедалі ближче підходять до людського розподілу слів, а GPT — дедалі далі.
Індустрія, політика й безпека
Позови проти Google відхилено. Суддя відхилив позови Chegg і Penske: компанії стверджували, що Google AI Overviews незаконно зменшили трафік. Антимонопольні аргументи суд не прийняв.
Grok вплинув на Венесуелу. Time повідомляє, що Трамп годинами розмовляв із Grok перед вторгненням у Венесуелу; Grok передбачив святкування, що зміцнило думку Трампа.
Звільнення в OpenAI з безпеки. OpenAI припинила співпрацю з трьома дослідниками з безпеки: вони нібито передали конфіденційну інформацію сторонній безпековій організації.
Anthropic просувається до уряду. Anthropic запустила Claude for Government для цивільних відомств у середовищі FedRAMP High; заборона Пентагону залишається чинною на тлі судової суперечки.
Дата-центри в космосі. Google запустила прототип орбітального обчислювального супутника з TPU; Satlyt залучила $8 млн на розробку софту для супутникового ШІ, а для масштабування знадобиться Starship.
Витік скриншотів від агентів. Glow Security виявила понад 13 000 внутрішніх скриншотів, які AI-агенти завантажили в публічні репозиторії GitHub. Це розкрило дані клієнтів і облікові дані.
Викрадення reasoning. OpenAI каже, що зупинила кампанію змагальної дистиляції проти захищеного reasoning; схожий трюк усе ще спрацював в Azure.
Це все на сьогодні - приблизно 5 хвилин читання.