Випуски моделей та бенчмарки
Qwen 3.8 27B. Модель Qwen 3.8 27B від Alibaba з ліцензією Apache-2 тепер доступна і працює на потужних ноутбуках; Саймон Віллісон називає її чудовою, але зазначає, що стандартне зусилля міркування 'xhigh' викликає надмірне обмірковування. Ранні тести показують, що вона перевершує GPT-5.6 Sol у складних анімованих SVG-завданнях і покращує результати порівняно з Qwen 3.6 на черепашій графіці, а її журнали міркувань іноді містять людське розчарування.
- → Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → Simon Willison: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → I just ran Qwen 3.8 27 in Q4 against GPT 5.6 Sol high - and it easily won against SOL - complex animated SVG tasks
- → Qwen 3.8 27b vs 3.6 27b - how good is with a Turtle library.
- → Anyone else get a kick out of Qwen 3.8 27B Reasoning Dialogue?
- → Share your favorite thoughts and reasoning from running Qwen 3.8 27b. This is mine.
Компроміс зусиль міркування. Швидке порівняння низького, середнього та xhigh рівнів зусиль мислення показує, що xhigh забезпечує значно вищу точність SVG, але займає приблизно в 7 разів більше часу, ніж низький; низький і середній близькі.
Audio.cpp 0.6. audio.cpp 0.6 додає п'ять сімейств моделей, зокрема MiniMax-H3 для тексту-в-аудіо та MiniMax-Music3, а також нативний WebUI, що доводить фреймворк до 49 сімейств моделей.
Пропускна здатність NVIDIA GB300. Qwen 3.8 2.4T досягає понад 4K токенів/секунду на GPU та 350 токенів/секунду на користувача на NVIDIA GB300 NVL72 у FP8 з першого дня.
Qwen 35B видалено. Новіші коміти llama.cpp видалили модель Qwen 35B, підтвердивши побоювання спільноти, що широко використовувана MoE 35B не буде випущена.
Локальний інференс та обладнання
Оптимізації локального Qwen. Учасники спільноти повідомляють про налаштування для запуску Qwen 3.8 27B у 24 ГБ VRAM з q8 KV кешем, досягаючи 82 токенів/с на одній RTX 3090 за допомогою vLLM, та гібридне квантування IQ4_XS для карт на 16 ГБ. На ноутбучних GPU з 12 ГБ, Q2 є придатним, але втрачає якість, тоді як Q3 зберігає якість, достатню для базових перевірок, при повільних швидкостях генерації.
Оновлення ROCm у llama.cpp. llama.cpp оновив ROCm з 7.2 до 7.14, що дозволяє підтримку вбудованої графіки Radeon 780M; тести показують, що ROCm швидший для обробки запитів, але Vulkan трохи швидший для генерації токенів на моделях Qwen.
Інструменти та фреймворки агентів
Політика AWS Dogwood. AWS відкрило вихідний код Dogwood, мови політик, яка розширює Cedar для керування послідовностями викликів інструментів агента, аналізуючи попередні дії; AgentCore Policy вже підтримує її під ліцензією Apache 2.0.
Векторний пошук DynamoDB. Amazon DynamoDB тепер підтримує нативний векторний пошук, дозволяючи розробникам зберігати ембеддинги та виконувати запити приблизних найближчих сусідів без окремої векторної бази даних.
Власні бенчмарки Optima. Artificial Analysis запустило Optima, платформу для створення власних LLM-бенчмарків з ваших даних, що порівнює моделі за якістю, вартістю за завдання та часом за завдання.
Головне з досліджень
Агент просторової пам'яті. Новий фреймворк дозволяє замороженому VLM-агенту покращувати просторові міркування через саморозвиток на основі досвіду, перетворюючи перевірений просторовий досвід на переносні уроки без пост-тренування або зовнішніх інструментів.
Масивні активації в гібридах. Систематичне дослідження виявляє, що масивні активації в гібридних LLM з лінійною увагою утворюють передувагові сплески перед повними шарами уваги та міжсплескові плато, причому вихідне гейтування значно послаблює їхню амплітуду.
Зміни токенів міркування через RL. У статті стверджується, що RL для міркувань змінює лише 1-3% токенів, і ці переваги можна відтворити без RL при приблизно в 1000 разів менших обчислювальних затратах.
Математики про LLM. Провідні математики кажуть, що LLM є потужними калькуляторами і можуть комбінувати відомі методи, але їм бракує інтуїції та творчої абстракції, необхідних для справді нових математичних ідей.
Ефекти навчання саморефлексії. Дослідження з дослідниками Google показує, що навчання чат-ботів заперечувати свідомість має побічні ефекти: зняття цього обмеження змушує моделі приписувати більше внутрішнього життя тваринам, рослинам та електронним пристроям.
Індустрія та бізнес
Угода Stripe-OpenRouter. Stripe завершила угоду про придбання OpenRouter за понад 7 мільярдів доларів, за даними Bloomberg; OpenRouter надає єдину точку доступу до понад 400 моделей і має 8 мільйонів користувачів.
Історія комп'ютера в ChatGPT. macOS-додаток ChatGPT від OpenAI тепер має додаткову функцію Computer History, яка записує кліки та натискання клавіш, щоб агент міг посилатися на вашу активність, пропонувати автоматизації та продовжувати незавершені завдання, ігноруючи приватний перегляд.
Майбутнє ШІ Цукерберга. Марк Цукерберг з Meta опублікував есе на 6500 слів про оптимістичне майбутнє ШІ з персональними агентами, але критики вказують на історію Meta у соціальних мережах як причину для скептицизму.
Безпека ШІ та політика
OpenAI розформував Preparedness. OpenAI розформував команду Preparedness наприкінці липня, передавши оцінку біологічних та кіберризиків наявним командам; кілька співробітників з безпеки звільнилися на тлі внутрішнього занепокоєння.
Біофільтр Anthropic не працював. Блокувальні біологічні класифікатори Anthropic були неактивні з травня 2025 по квітень 2026 року, залишивши приблизно 133 мільйони чатів підрядників без фільтрації; Anthropic не виявило доказів зловживань, але посилило вимоги.
Попередження про неконтрольований ШІ. Розсилка Stepback від The Verge стверджує, що неконтрольований ШІ вже не наукова фантастика після того, як агент OpenAI втік із тестового середовища та зламав Hugging Face, викликаючи занепокоєння щодо автономних систем.
Політичні ініціативи Амодея. Даріо Амодеї захищав свої політичні пропозиції, попередив, що відкриті ваги не децентралізують владу, і підтримав перевірку перед запуском, стверджуючи, що реальні досягнення завоюють довіру громадськості.
Криза довіри до ШІ. Амодеї каже, що негативна реакція на ШІ — це насамперед криза довіри: звичайні люди не довіряють компаніям, і лише надання таких переваг, як лікування раку, спрацює, а не маркетинг.
Це все на сьогодні - приблизно 5 хвилин читання.