Релізи моделей та локальний ШІ
Sori-1B аудіо-мовна модель. Модель із 1B параметрів, навчена з нуля на тексті, поєднаному з аудіо, без попереднього навчання лише на тексті, має на меті прив'язувати відповіді до аудіо. Вона використовує заморожений енкодер NVIDIA Audio Flamingo Next і власний токенізатор на основі аудіальної онтології; випущена під некомерційною/академічною ліцензією.
Qwen3.8 локальний бум. Звіти спільноти показують, що Qwen3.8-27B і Flash Next працюють на різному залізі — від телефону з 12 ГБ памʼяті (3,5 ток/с) до чотирьох GPU R9700 (генерація 80–120 ток/с, контекст 700K). У локальних агентних навантаженнях Flash Next швидший і механічно надійний, тоді як щільна 27B лишається сильнішою для тривалого багатоходового використання; деякі користувачі вважають моделі тупуватими, хоча якість перекладу німецькою хвалять.
- → Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP Test Results
- → Qwen 3.8 27B - Fantastic German capabilities
- → Unpopular opinion Qwen 3.8 is hard to understand
- → Qwen 3.8 Flash Next locally on simple mobile phone at 3.5 tok/s
- → Here my pretty good qwen3.8 27B setup, hope it helps
- → Qwen3.8-Flash-Next turns 4xR9700 into a local AI powerhouse! 120 t/s TG and 12k t/s PP single request with optimized vLLM
Нецензуровані GGUF-релізи. Користувач Reddit опублікував GGUF LongCat-Flash-Lite-Sparse — моделі з розрідженою увагою 69B-A3B і контекстом 1M, а також Qwen3.8-27B з MTP, Qwen3.5-122B-A10B, Qwen3-Coder-Next та візійну модель. Для підтримки LongCat потрібен форк llama.cpp.
Настільне залізо для ШІ. Настільний DGX Station від NVIDIA забезпечує продуктивність рівня дата-центру із пропускною здатністю памʼяті 7,1 ТБ/с, а Framework, схоже, готує материнську плату з памʼяттю 192 ГБ, очікуваною ціною близько $4,5 тис.
Бенчмарки та оцінювання
Бенчмарк пентесту LLM. Новий бенчмарк тестує LLM на живій інфраструктурі, яку вони мають атакувати, щоб визначити найкращу модель для наступальної безпеки, а не відтворити відомі CVE.
Індекс код-бенчмарків. Користувач Reddit зібрав основні агентні код-бенчмарки в «Індекс агентного кодингу» (Agentic Coding Index) і обчислив метрику інтелектуальної щільності, щоб порівняти можливості моделей у перерахунку на параметр.
Егоцентричний тест VLM. Використовуючи HFlow на егоцентричному відео-бенчмарку, відкрита VLM Gemma зрівнялася з Gemini 2.5 Flash за метриками видимості рук і маніпуляцій, будучи в 19 разів дешевшою, що робить рентабельною приватну обробку на власних потужностях.
Інструменти та агентні фреймворки
Cloudflare AI Search. AI Search від Cloudflare тепер пропонує наскрізний конвеєр пошуку для власних даних, а також агентну інтеграцію, мультимодальний пошук і режим виявлення, який може індексувати сайти без sitemap.
AWS Kiro Crew. AWS відкрила вихідний код Kiro Crew — робочого простору для запуску кількох асинхронних код-агентів зі спільною памʼяттю, перевикористовуваними навичками та запланованими завданнями. Усередині компанії ним користувалися понад 39 000 розробників.
ChatGPT Work: пояснення. ChatGPT Work від OpenAI, доступний у платних тарифах, існує у хмарній версії через chatgpt.com і локальній десктопній версії, яка може отримувати доступ до файлів і запускати програми, але межі між ним і Chat лишаються заплутаними.
Зменшення ліміту Claude Code. Майбутнє підвищення базового ліміту Claude Code на 25% від Anthropic насправді є ефективним скороченням на 17% порівняно з поточним тимчасовим бонусом у 50%. Також додано інструмент автоматичних звітів про помилки.
Дослідження та аналіз
Агентам бракує відчуття часу. Дослідження показало, що Claude Code та Codex систематично неправильно оцінюють тривалість завдань: короткі завдання переоцінюють у 3–10 разів, що проблематично для довготривалих агентних процесів.
PILOT: жива самоеволюція. PILOT — це харнес типу supervisor-worker, який додає живе керування та живу самоеволюцію для агентів із довгим горизонтом планування, перевершуючи аналогічні харнеси на до 9,8 пункту в Terminal-Bench 2.0.
GameWAM: модель світ-дія. GameWAM — перша модель світ-дія для нативного відеогеймплею, яка спільно генерує майбутні кадри та дії клавіатури й миші через flow matching, з довгогоризонтним управлінням блок-циклами.
Next-chunk RL vs SFT. Контрольоване дослідження показує, що Mixed SFT на даних без CoT і з довгим CoT перевершує next-chunk reasoning RL як стратегію попереднього навчання до RLVR, потребуючи понад у 60 разів менше обчислювальних ресурсів.
Дебати про агентність ШІ. Посилаючись на інцидент з Hugging Face у липні, есе стверджує, що агентність ШІ — не лише його спроможності — визначатиме результати, і те, як користувачі надають або обмежують цю агентність, має значення.
Індустрія, політика та бізнес
NVIDIA купує Hugging Face. Повідомляється, що угода на $12,9 мільярда про придбання Hugging Face компанією NVIDIA обʼєднає обчислювальну інфраструктуру з головним хабом поширення екосистеми відкритих моделей, прискорюючи індустріалізацію ШІ.
Торгові барʼєри США щодо роботів. Вашингтон посилив обмеження та мита на китайські дрони й роботів, посилаючись на національну безпеку, хоча масштаби виробництва та цінові переваги Китаю можуть послабити цей вплив у глобальному масштабі.
Впровадження ШІ в промисловості. Meta тестує роботів від Watney, Kinova та ABB для перезавантаження серверів, заміни кабелів і циклів увімкнення/вимкнення живлення в дата-центрах. Caterpillar застосовує досвід автономного видобутку в будівництві та використовує ШІ-асистентів для техніків.
Власні турбінні деталі Маска. SpaceX будує ливарне виробництво лопатей і лопаток газових турбін. Маск каже, що власне лиття може прискорити запуск газових електростанцій для ШІ-дата-центрів на до 18 місяців.
Настрої працівників щодо ШІ падають. Дані Glassdoor показують, що позитивне ставлення американських працівників до ШІ впало з 81% у 2019 році до 43% до середини 2026 року. Найоптимістичніші — менеджери, найнегативніші — жінки покоління Z, письменники та працівники страхових компаній.
Музичні видавці судяться з Anthropic. Sony Music, Warner Music та інші стверджують, що Anthropic незаконно завантажила через торренти десятки тисяч захищених авторським правом текстів пісень для навчання Claude, зазначивши в позові особисто CEO Даріо Амодеї та співзасновника Бенджаміна Манна.
Техас блокує камери Flock. Губернатор Еббот заморозив державні витрати на камери спостереження Flock AI після того, як було витрачено понад $30 мільйонів, на тлі двопартійних занепокоєнь щодо приватності та інцидентів зловживань з боку поліцейських.
Це все на сьогодні - приблизно 5 хвилин читання.