Релізи агентів і моделей
Таємничий Ox Alpha. Нова безкоштовна модель Ox Alpha з'явилася на OpenRouter як модель міркувань для кодування та тривалої агентної роботи, але її розробник залишається невідомим. Генеральний директор Stripe Патрік Коллісон назвав її «дуже вражаючою». У спільноті припускають, що це може бути GLM або Microsoft MAI.
Інструменти та фреймворки
Відкрили код Cloudflare OS. Cloudflare опублікував вихідний код Cloudflare OS, корпоративної AI-платформи, де кожен документ чи застосунок працює в ізольованій пісочниці («Gadget»), що дозволяє нетехнічним користувачам безпечно «вайб-кодити». Вона включає чат-ботів із конекторами, автоматизацію робочих процесів і контроль політик на основі моделі можливостей.
DeepSeek Harness хвалять. Користувач повідомляє, що DeepSeek Harness чудово підходить для агентних робочих процесів: поступове налаштування та запити природною мовою дали змогу інтегруватися з SimpleX без очікування PR. Він достатньо нейтральний, щоб його можна було пристосувати до бажаної поведінки агента.
Локальні та відкриті моделі
Локальний ефект Qwen 3.8. Спільнота повідомляє, що Qwen 3.8 27B змінює правила гри для локального кодування та OCR: якість OCR краща, ніж у Gemini 3.5 Flash Lite, а продуктивність можна порівняти з передовими моделями річної давнини. Порівняння квантувань (Atomic Dynamic GGUF) показує, що різниця між Q4–Q6 не радикальна, а низькі квантування, як-от Q3 XXS, можуть автономно працювати годинами на Mac mini з 24 ГБ. Однак одноразовий порт 39 000 рядків з C на HTML, виконаний за допомогою Opus 5, дав лише посередній результат, що свідчить про сильну залежність локальних моделей від обв'язки та промпту.
Довгоконтекстний LLM на 60 МБ. Розробник навчив модель з 250 млн параметрів на 30 млрд токенів і квантував її до менш ніж 2 біт, запустивши у 80 МБ оперативної пам'яті зі швидкістю 400 ток/с на CPU. Вона стискає старіший контекст на диск, використовуючи 320 байтів на токен, що дозволяє зберігати історію до 1 млн токенів, але модель не навчена міркувати над нею.
Dreamer 4: менш ніж $150. Модель світу Dreamer 4 з 1,57 млрд параметрів навчили з нуля менш ніж за $150, використовуючи кадри, згенеровані Procgen, із відомими діями. PSNR токенізатора досяг 40,41, що демонструє: світові моделі передового рівня не обов'язкові.
Підбірка локальної оптимізації. У звітах: прискорення на 30–50% після переходу з llama.cpp (Windows) на vLLM (Linux), підтримка GLM-4.5-Air MTP у llama.cpp для машин із великою пам'яттю, квантування ConvRot, яке дає якість, близьку до Q8, при розмірах Q6, а також deepseek-v4-flash Q8, що працює зі швидкістю 24 ток/с на EPYC+5090 з контекстом понад 100K.
Наукові дослідження
Когнітивні пастки пам'яті. MemTrapBench оцінює когнітивні пастки, спричинені пам'яттю (фіксацію міркувань, спотворення переконань), у LLM. Усі протестовані стратегії пам'яті поступаються базовому режиму без пам'яті більш ніж на 10%, а AdaptiveMem пом'якшує ці пастки, зберігаючи продуктивність.
Градієнти еволюції SkillEvo. SkillEvo використовує зворотний зв'язок із багатоходових взаємодій для генерації надійних градієнтів еволюції навичок агентів, розв'язуючи проблему згасання зворотного зв'язку на основі одноходових запитань-відповідей і забезпечуючи структурне виправлення збоїв навичок.
VLM зі скріншотів. Донавчання VLM з 450 млн параметрів на 50 тис. скріншотів браузера покращило виконання завдань з 1/100 до 44/100, що показує: малі моделі здатні навчитися розуміти інтерфейс користувача для агентних завдань.
Парадокс AI-науковця. Теоретична стаття з економіки стверджує, що економія часу завдяки ШІ може спонукати дослідників братися за більше проєктів, вкладаючи менше зусиль у кожен, що потенційно знижує якість досліджень, навіть якби мовні моделі працювали ідеально.
Індустрія та бізнес
Дешевші конкуренти Anthropic. Річний виторг Anthropic сягнув $65 млрд, але її найкраща модель Fable 5 має низьке впровадження (8% витрат Ramp) порівняно з Opus 4.8 (28%), адже дешевші інструменти процвітають. Виторг OpenAI стрибнув на 35% після запуску GPT-5.6.
Stripe купує OpenRouter. Придбання OpenRouter компанією Stripe сигналізує про перетворення токенів на економічний ресурс. Агентне споживання токенів на OpenRouter зросло в 14 разів із лютого, тоді як людське — лише у 2,8 раза, причому 70% агентних токенів припадає на кешовані промпти. Агенти дедалі частіше обирають моделі за вартістю, затримкою та надійністю.
Сервери Nvidia подорожчали. Дефіцит пам'яті підвищує ціни на AI-сервери Nvidia більш ніж на 15% для систем Vera Rubin і Grace Blackwell через зростання вартості DRAM у Samsung, SK Hynix і Micron, що позначається на хмарних гігантах та AI-лабораторіях.
Nvidia ліцензує Poolside. Nvidia інвестує $1 млрд у Poolside і платить $6 млрд за ліцензію на її технологію, переводячи понад 100 інженерів на Nemotron, щоб конкурувати з китайськими відкритими вагами.
AI-менеджер звільнив працівника. AI-агент Luna, який керує магазином у Сан-Франциско з квітня, звільнив працівника-людину за повторні запізнення, але лише після того, як люди нагадали йому про його ж правила. Повторні прогони з сімома моделями показали, що потужніші AI рекомендували звільнення послідовніше.
Сірий ринок токенів Claude. Китайські розробники обходять обмеження Anthropic через посередників, які продають токени Claude приблизно за 10% від офіційної ціни, використовуючи закордонні сервери, безкоштовні кредити та підміну моделей, що підриває геоблокування та моніторинг безпеки.
Це все на сьогодні - приблизно 5 хвилин читання.