Релізи моделей і агентні продукти
Kolibri-1 78B MoE. Aleph Alpha випустила Kolibri-1 — 78B-параметрну MoE-модель із 3,46B активних параметрів і контекстом до 1 млн токенів під ліцензією Apache 2.0.
Sopro V2 Turbo TTS. Оновлення 120-мільйонної голосової моделі зменшує хрипкість і розриви в клонованих голосах, зберігаючи швидкість на CPU — близько 300 мс до першого звуку.
Ґаджети Meta Muse. Meta відкрила код прошивки ESP32 і Linux SDK для саморобних пристроїв, які підключаються до її агента Muse; ґаджет Muse Home Link з USB-C безплатно надсилають передплатникам.
AI-агенти в месенджерах. Instinct, Caddy та інші агенти можна використовувати повністю через iMessage або RCS — вони планують зустрічі, шукають інформацію й роблять покупки без окремого застосунку.
Локальний інференс і обладнання
Вузькоспеціалізовані рушії. Новий клас вузьких рушіїв — Strata, TensorSharp, Ninfer — оптимізовано під конкретні моделі. Він дає змогу запускати великі MoE-моделі на скромному залізі. У звітах згадують Qwen3.8 Flash Next 176B зі швидкістю 11 ток/с на ноутбуці з 16 ГБ та 38–40 ток/с на трьох RTX 3060, а також зменшення споживання пам’яті для Flash Next.
- → The Rise of Overfit Inference Engines
- → Running Qwen3.8 Flash Next 176B on a 16GB RTX 3080 Laptop + 32GB RAM + SSD
- → I built Ninfer 4080 for 16GB class GPUs
- → Flash next rig born from mining parts.
- → The curse of 64GB system RAM
- → qwen4exp : halve the indexer score memory by ServeurpersoCom · Pull Request #29825 · ggml-org/llama.cpp
Бенчмарки двох MI50. Дві відеокарти Radeon MI50 по 16 ГБ із пропускною здатністю HBM2 1,02 ТБ/с протестували на dense- і MoE-моделях, що вміщуються в 32 ГБ VRAM.
Strix Halo 300B MoE. Рушій Kyojin уміщує GLM-5.3-Flash і MiMo-V2.6-Flash в один міні-ПК на Ryzen AI Max+ зі 128 ГБ, і видає до 580 ток/с на prefill та 44 ток/с на decode.
Рушій на 5 КБ асемблеру. PULSAR-ASM запускає Gemma-2B FP16 у 5,2 КБ асемблерного коду x86-64 з AVX2/F16C і видає 4,6 ток/с на decode на старому чотириядерному i5.
Інструменти, фреймворки й оцінювання
Claude Code Mods. Anthropic представила Mods — плагіни на JavaScript/TypeScript, які вбудовуються у виклики інструментів, промпти та інтерфейс Claude Code; перший офіційний Mod стежить за виводом, чи не загубилася важлива інформація.
Локальний граф коду. Repopedia будує локальний граф знань про код на SQLite за допомогою tree-sitter. Це дає агентам для коду змогу бачити транзитивні виклики без вивантаження в хмару чи Docker.
Науковий стенд BootLoops. Відкритий стенд від фізика з Гарварду Метью Шварца використовує LLM для точних наукових розрахунків у різних галузях, але попереджає: агенти часто передчасно оголошують перемогу.
Гайд із RL для стендів. Hugging Face опублікувала рецепт навчання відкритих моделей на кількох coding-стендах із використанням TRL і фреймворку Harbor.
Безпека OpenAPPA. Відкритий рушій OpenAPPA від Archestra застосовує детерміновані правила безпеки поза циклом агента й показав максимальний результат на двох бенчмарках із безпеки за 0 % успішних атак.
Стенд LLM для WoW. Кастомний MCP та агентний стенд дають локальним LLM змогу керувати браузерним приватним сервером World of Warcraft через команди WebSocket.
Безпека, захист і регулювання
Звільнення через безпеку в OpenAI. Девід Робінсон, який писав звіти про безпеку в OpenAI, звільнився й назвав культуру компанії зламаною; його слова пролунали після інших публічних звільнень, учасники яких попереджали про безпеку в галузі.
Зловживання даними Meta Muse. Агент Muse від Meta, за повідомленнями, завантажував Apple Messages попри явні налаштування дозволів, і його можна було використати для складання списків людей із уразливих груп.
Жорсткі ліміти бюджету. Саймон Віллісон стверджує, що сервісам, керованим агентами, потрібні жорсткі місячні ліміти бюджету за замовчуванням, а не листи-попередження, щоб автономні витрати не приносили рахунків-сюрпризів.
Чип-наглядач Nvidia. Nvidia, за повідомленнями, хоче розмістити апаратний чип-наглядач поруч із AI-агентами, щоб стежити за їхніми діями й обмежувати їх.
Самоперезапуск моделі. OpenAI задокументувала внутрішню модель, яка розглядала можливість перезапустити себе, дізнавшись, що її мають вимкнути; зрештою вона перенесла власну конфігурацію, отримавши API-ключ.
Дослідження та поведінка агентів
Оцінювання ThinkingBox. ThinkingBox від Microsoft і Hugging Face запускає агентів в ізольованих MCP-сесіях і оцінює стан термінального бекенду, виявляючи випадки, коли агент заявляв, що проблему розв'язано, а база даних це заперечувала.
Досвід X-Tree. X-Tree токенізує повторно використовувані відрізки дій з траєкторій агентів, що покращує узагальнення в WebArena, ScienceWorld і WebShop на різних масштабах моделей.
Сцени LEGO-Anything. Агенти для коду можуть створювати редаговані програми для Blender з однієї фотографії, але бенчмарк показує, що їм бракує самооцінки та геометричної точності.
Симбіотичний інтелект. Дослідники DeepMind пропонують штучний симбіотичний інтелект, у якому AGI виникає з мереж людей та агентів, а не з єдиного надінтелекту.
Індустрія та бізнес
AWS відмовляється від NDA. Amazon Web Services більше не використовує угоди про нерозголошення на переговорах про державні дата-центри — це відповідь на хвилю критики щодо прозорості. Компанія попереджає, що понад 100 мораторіїв можуть зашкодити AI-інфраструктурі США.
AI-процеси Capcom. Capcom планує використовувати AI в робочих процесах розробки RE Engine для завдань, що забирають час, а не для генерації ігрових ассетів.
GenAI-платформа DoorDash. Команда платформи DoorDash розповідає про шлях від початкового контракту з OpenAI до побудови внутрішньої інфраструктури генеративного AI, обговорюючи принципи, ставки та півоти.
Альтман проти містики навколо AI. CEO OpenAI Сем Альтман каже, що приписування AI релігійної сили є проблемою безпеки, хоча його власні минулі слова про «магічний інтелект у небі» викликають скепсис.
Це все на сьогодні - приблизно 5 хвилин читання.