Релізи моделей та інфраструктура
Швидкісна модель Nvidia. Nvidia випустила Nemotron 3.5 Lightning, модель з відкритими вагами на 30B архітектури Mamba-Transformer, яка відповідає GPT-OSS-120B за бенчмарками, оптимізована для швидкого інференсу з лише 3.6B активних параметрів.
DeepSeek V4 працює локально. Спільнотні кванти DeepSeek V4 виправляють проблеми конвертації для біт-точних базових моделей, а DeepSeek V4 Flash досягає 27+ t/s на APU Strix Halo зі спекулятивним декодуванням, демонструючи життєздатне локальне розгортання.
Десктопний застосунок Unsloth. Unsloth випустив відкритий десктопний застосунок для запуску та навчання локальних моделей на GPU, що включає ізольоване виконання коду, RAG, експорт моделей та відсутність телеметрії.
Seed-раунд River AI на 1.1B. Заснована колишнім співзасновником xAI Igor Babuschkin, River AI залучила 1.1B для створення персонально навчальних AI-асистентів, переосмислюючи весь стек від навчання до апаратного забезпечення.
Daybreak Cyber на AWS. Кібербезпекові моделі Daybreak від OpenAI тепер доступні через Amazon Bedrock, що дає захисникам доступ до передових кіберможливостей у їхніх наявних середовищах AWS.
Маніфест Zuck про відкритий код. CEO Meta закликає до більшої кількості релізів з відкритими вагами та запрошує уряди до співпраці у тестуванні безпеки, оскільки компанія продовжує публікувати моделі, як-от Muse Glimmer.
Підтримка Ling-3.0. Пул-реквест додає Ling-3.0 до llama.cpp, причому крихітний варіант уже добре працює для голосових завдань домашнього асистента завдяки чесній відмові, коли модель невпевнена.
Інструменти та локальний ШІ
MCP-брокер скорочує контекст. Саморобний каркас агента використовує MCP-брокер, щоб приховати інструменти за проксі, скорочуючи стартовий контекст з 20K токенів майже до нуля, і додає темпоральну обізнаність для кращого локального виконання.
Майнінгові GPU для LLM. Майнінгові карти CMP170HX з 8GB можна розширити до 64GB кожна, запускаючи великі моделі або кілька малих моделей одночасно, пропонуючи дешеву, але старіючу продуктивність класу Ampere.
366 t/s на V100. Спеціальні CUDA-ядра (v100-skinny) дозволяють до 366 t/s на Qwen3.6 27B у NVFP4 на GPU Volta, даючи нове життя старому обладнанню для локального інференсу.
Модель TinyTitle. Модель GRU з 1.8M параметрів генерує заголовки чатів, використовуючи менше 5 МіБ оперативної пам’яті, демонструючи надлегке локальне резюмування, яке виконується за кілька мілісекунд.
Приватний AI для електронних книг. Застосунок для електронних книг інтегрує моделі Gemma 4B локально для приватних запитань і відповідей у застосунку, з перемикачами спойлерів та автоматичним підбором мови.
Енергоефективний AI-сервер. Збірка, що поєднує Intel N100 з RTX 5060Ti, створює тихий та ефективний llama.cpp-сервер, здатний запускати нові моделі, як-от Qwen 3.5, для повсякденного використання.
Зниження вартості інференсу. CEO Doubleword пояснює, як проєктування стеків інференсу для використання, що не потребує реального часу, може знизити вартість токенів більш ніж на порядок порівняно з універсальними налаштуваннями.
Розумна маршрутизація моделей. Бібліотека Switchyard від NVIDIA маршрутизує лише 7% викликів агентів до фронтирної моделі, знижуючи витрати на 74% з мінімальною втратою точності, і пропонує формулу для оцінки вигідності.
Приватні AR-окуляри. Незрячий користувач просить AR-окуляри в стилі Meta, які запускають локальні моделі, щоб не надсилати візуальні дані в Meta, підкреслюючи попит на приватність у допоміжних технологіях.
Передові дослідження
AI береться за Riemann. Невипущена модель Anthropic досягла прогресу в гіпотезі Riemann, протестувавши 650 ідей з 60 субагентами протягом 36 годин, що розпалило дискусію про роль AI у математичних відкриттях.
Відеодіагностика AMIE. Дослідницька система AMIE від Google продемонструвала клінічні відеоконсультації на рівні експерта, використовуючи Gemini та багатоагентну конфігурацію для інтерпретації візуальних, слухових і контекстуальних сигналів.
Рентгенологічний ШІ CARE-X. CARE-X від Microsoft — це уніфікована VLM для рентгену грудної клітки, яка поєднує генерацію та структуроване передбачення, використовуючи навчання з підкріпленням для винагороди за клінічну правильність.
Протистояння агентної пам’яті. ACE та ALTK-Evolve обидві перетворюють траєкторії агентів на придатні для повторного використання уроки; ACE створює комплексний посібник, а ALTK-Evolve витягує окремі вказівки.
Логпроби виявляють галюцинації. Аналіз розподілів імовірностей токенів при першому фактичному пригадуванні в ланцюжку думок може виявити ненадійні знання, пропонуючи потенційний ранній сигнал галюцинації.
Попередження про написання AI. S. Alpert стверджує, що жоден перепис не є без втрат, тому текст, створений за допомогою AI, має бути особисто перевірений, щоб уникнути спотворення задуму автора.
Бізнес та фінанси
Рубіж у 1B користувачів. ChatGPT і Gemini досягли 1B щомісячних активних користувачів, причому Gemini став найшвидшим продуктом Google, що досяг такого масштабу; ChatGPT раніше цього року досяг 900M щотижневих користувачів.
Реклама ChatGPT стає глобальною. OpenAI розширив рекламу ChatGPT ще на п’ять країн, повідомляючи про відсутність впливу на довіру користувачів і низький рівень відхилень, оскільки компанія шукає сталу монетизацію.
Підвищення цін OpenAI. Нові місця ChatGPT Business Premium коштують $125/користувача/місяць із п’ятикратним обсягом та без погодинних лімітів, що відображає інтенсивне використання токенів агентними навантаженнями.
Lightcap йде. Brad Lightcap, колишній операційний директор OpenAI і керівник спеціальних проєктів, залишає компанію після восьми років, щоб розпочати щось нове, продовжуючи низку відходів керівників.
Оренда Anthropic на 9.1B. Anthropic підписав 20-річну угоду на 9.1B з майнером Bitcoin Riot Platforms щодо дата-центру на 191 МВт у Техасі, який має забезпечити енергією наступне покоління моделей, починаючи з 2027 року.
Перешкоди для IPO Anthropic. Напередодні потенційного IPO на 965B інвестори ставлять під сумнів зростання Anthropic через дешеві китайські моделі та політичні перешкоди, хоча компанія рекламує майбутні застосунки для здоров’я та біології.
Ініціатива Nvidia на 500B. Nvidia співпрацює з шістьма фінансовими компаніями, щоб мобілізувати 500B для AI-інфраструктури, гарантуючи до 25% залишкової вартості своїх чипів, протидіючи побоюванням щодо знецінення.
Ставка Accel на Індію та AI. Accel закрив перепідписаний індійський фонд на 550M, роблячи ставку на те, що AI стане основою стартапів у сфері споживчих послуг, фінтеху та виробництва, а не окремою категорією.
Вихід готівки для працівників OpenAI. Викуп акцій на 7B за оцінки 852B дозволяє поточним і колишнім працівникам OpenAI ліквідувати акції, зменшуючи тиск перед потенційним IPO.
Безпека та прозорість
ЄС вимагає AI-водяні знаки. Відповідно до EU AI Act, Anthropic і OpenAI зобов’язуються позначати згенерований контент; Claude вбудовуватиме невидимі водяні знаки в текст і зображення, а підтримка старіших моделей у розробці.
Походження фото Apple. iOS 27 може представити ‘Apple Reference Image’ для вбудовування метаданих походження під час зйомки, дозволяючи користувачам доводити, що фото на iPhone не є дипфейками.
Spotify позначає AI-виконавців. Spotify позначатиме профілі виконавців, згенеровані AI, і виключатиме їх із рекомендацій, використовуючи саморозкриття та виявлення перед запуском зміни в середині вересня.
Суперечка про написання AI. Ігрова студія Saber заперечує заміну сценаристів ChatGPT для Rideshare Stimulator, але колишній провідний сценарист стверджує, що AI використовувався для написання та озвучування, без розкриття в Steam.
AI-експлойт Zoom. Критична вразливість Zoom, що дозволяє перехоплення контролю над пристроєм через функцію анотацій, була знайдена за допомогою менш ніж 20 запитів до публічних AI-моделей, що демонструє пришвидшені AI-дослідження безпеки.
Викрадення ланцюжків міркувань. Дослідники відтворили зашифровані токени ланцюжків думок з фронтирних моделей у слабших аналогах, зламали їх і відновили приховані міркування, викривши паролі та API-ключі в публічних сесіях.
Довіра до AI-згенерованого коду. IBM і Red Hat розширюють Lightwell для створення верифікованих ланцюгів постачання програмного забезпечення в епоху AI, забезпечуючи походження та відповідність політикам як для людського, так і для AI-згенерованого коду.
Це все на сьогодні - приблизно 5 хвилин читання.