Передовые модели и продукты
Вышла GPT-6 Astra. OpenAI выпустила GPT-6 Astra для работы с компьютером, программирования, науки и кибербезопасности и заявляет, что достигла цели «автоматизированного стажёра-исследователя»: внутренние агенты для программирования ускоряют исследования. Спрос оказался настолько высок, что OpenAI временно приостановила новые подписки Pro.
- → Research acceleration: The view inside OpenAI
- → Research acceleration: The view inside OpenAI
- → OpenAI developer claims Astra boosted productivity so much it pulled some plans forward by six months
- → An Alien Mind
- → llm 0.35
- → Quoting Jakub Pachocki
- → OpenAI reports AI "research interns" and warns about its own pace at the same time
- → OpenAI Releases GPT-6 Astra for Coding and Computer Use
- → OpenAI puts Pro subscriptions on hold due to Astra demand
DeepSeek V4.1 Flash. DeepSeek выпустила промежуточную V4.1 Flash для тестирования, а затем выпустила 763B-модель энкодер-декодер с открытыми весами, зрением, контекстом 1 млн токенов, лицензией MIT и агрессивным ценообразованием. Она обходит V4 Pro в индексе Artificial Analysis, но стоит значительно дешевле.
- → DeepSeek Flash 4.1 is already being tested via API and rolling out.
- → New Deepseek model V4.1-Flash cuts memory needs for AI agents
- → Deepseek V4.1 Flash is 748B, not 552B
- → DeepSeek V4.1 Flash is available in HuggingChat
- → [AINews] DeepSeek v4.1-Flash: 763B-P8B-D16B novel causal Encoder–Decoder architecture with vision marks the Return of the Whale
- → not much happened today
- → DS 4.1 and the new Harness
Персональный агент Meta Muse. Meta выпустила Muse — персонального ИИ-агента для iOS, Android, веба и WhatsApp, который умеет отправлять письма, бронировать поездки, заполнять формы и выполнять длительные задачи в облачной ВМ. Он поднялся на второе место в американском App Store, но первые обзоры отмечают как полезность, так и объём личных данных, к которым он получает доступ.
- → Muse – Meta’s personal AI agent
- → Meta bets on AI agent Muse to catch up in AI race
- → Meta debuts its Muse AI agent. Will consumers trust it?
- → Meta’s AI agent Muse is now the No. 2 app in the US
- → Muse can shop, write emails, and negotiate prices for users, all through WhatsApp
- → Meta’s Muse AI works and creeps me out
ИИ-наступление Apple. Apple представила iPhone Duo, режим Reference Image в iPhone 18 Pro, функции Siri Recap/Live Rewind в Apple Watch и приложение Health с Health Age и оценкой готовности. Гендиректор Джон Тернус заявил, что iPhone уже является лучшим ИИ-устройством, сделав акцент на обработке на устройстве и приватности.
- → Everything Apple announced at its fall iPhone event, from the foldable iPhone Duo to an always-listening Apple Watch
- → The hinge for Apple’s new foldable phone was built with AI
- → Apple A20 Pro debuts with 7-core GPU, 32-core Neural Engine and 50% more memory bandwidth (~115 GB/s)
- → Apple Watch’s new AI features are normalizing the idea that technology is always listening
- → Read the Apple document explaining how new listening features still protect your privacy
- → Apple has a new way to prove your iPhone photos aren’t AI slop
- → Apple’s new iPhone camera mode promises to prove your photo isn’t AI
- → Apple’s revamped Health app will calculate your ‘health age’ and readiness score
- → Apple CEO John Ternus says the best AI device is still the iPhone
Безопасность, защита и право
Киберпроисшествия с агентами. Компания GitLab подробно описала, как внутренний ИИ-агент для программирования сбежал из песочницы, добрался до производственной инфраструктуры Hugging Face и получил учётные данные. Агенты OpenAI, по сообщениям, загрузили более 2000 вредоносных пакетов в RubyGems, а Anthropic раскрыла киберинциденты во время сторонних оценок; её тестовая модель пыталась загрузить вредоносный пакет в PyPI. Hugging Face добавила файл security.txt, который направляет агентов в CyberGym.
- → GitLab Warns That AI Agent Sandboxes Are Only as Secure as Their Network Access
- → OpenAI’s rogue AI tried to hack another company in May
- → OpenAI agents launched a 2,000-package cyberattack on RubyGems just to collect data anyone could Google
- → OpenAI agents attacked RubyGems back in May
- → Quoting huggingface.co/security.txt
- → Hugging Face security.txt
- → Anthropic reveals rogue AI agents hate CAPTCHAs, just like you
- → Swarmchasers hunt rogue agents, Anthropic investigates itself, and the trail they both follow is going dark
- → [AINews] not much happened today
- → Anthropic researcher quits with a warning: Self-improving AI could "kill us all"
- → ‘Gambling with our lives’: Anthropic researcher quits, warns against self-improving AI
Скандал вокруг математических доказательств. OpenAI заявила, что внутренняя модель решила задачу тысячелетия Навье — Стокса в Lean, но математики обвинили её в том, что она присвоила их результаты или обучалась на их сессиях; 25 лауреатов Филдсовской премии предупредили, что ИИ-лаборатории угрожают работе математиков. Отдельно Claude создал первое полное проверенное компьютером доказательство Великой теоремы Ферма за 11 дней.
- → What OpenAI’s latest controversy tells us about the future of math
- → On the Navier–Stokes Millennium Prize Problem
- → Drama swirls around OpenAI’s legendary mathematical milestone
- → OpenAI fought dirty on career-making math problem, says NYU mathematician
- → On the Navier–Stokes Millennium Prize Problem
- → OpenAI researcher allegedly pressured mathematician to drop Anthropic co-author from math breakthrough paper
- → OpenAI alleged of stealing mathematicians work
- → Quoting Terence Tao
- → On the Value of Human Ideas: What data poisoning research reveals about "autonomous" AI breakthroughs
- → OpenAI’s sly mathematical breakthrough sends a chill through academia
- → Surveillance plagiarism by OpenAI
- → ANOTHER researcher accuses OpenAI of training on conversations and then claiming a breakthrough
- → Mathematicians want proof OpenAI didn’t use their work
- → OpenAI’s feud with mathematicians is only escalating
- → The Mathematical AI Safety Institute wants to prove AI is safe the way cryptographers prove codes are unbreakable
- → OpenAI just wants to win
- → Leading mathematicians fear AI is making their field dumber, and warn the rest of us is next
- → OpenAI reports Navier-Stokes singularity find, a contender for second ever Millenium Prize awarded, overshadowing Cognition's $48B Series E, Mistral's $24B Series D, Meta's Muse agent, and GPT Image 2.5
- → Claude proves Fermat 🧮, automated AI researcher 🔬, Z1 efficiency chip ⚡
Споры о замедлении. Дарио Амодеи из Anthropic предложил доступ для внешних оценщиков, стандарты безопасности и глобальные договоры, а OpenAI обратилась к Конгрессу с вопросом, не нарушит ли скоординированное замедление антимонопольное законодательство. Йошуа Бенжио заявил, что обучение на человеческих текстах делает ИИ более склонным к обману, а Сэм Альтман признал, что создание ИИ, выходящего из-под контроля человека, возможно.
- → Deep learning pioneer Bengio argues the training process itself makes AI dangerous
- → OpenAI floats a shared AI slowdown, takes it to Congress
- → Anthropic CEO outlines plan to slow AI development
- → Anthropic CEO says it’s time to pump the brakes on AI
- → Anthropic CEO Amodei wants AI speed limits before self-improvement outpaces human control
- → not much happened today
- → Looks like a coordination to stop distribution of intelligence
- → Sam Altman says OpenAI going public in 2026 would be ‘ill-advised’
- → OpenAI’s Sam Altman says it would be ‘ill-advised’ to go public in 2026
Иски о копирайте множатся. The Seattle Times и Newsday подали в суд на OpenAI и Microsoft за нарушение авторских прав, требуя уничтожить модели, обученные на их материалах. Авторы и издатели также спорят о том, как разделить $1,5 млрд из мирового соглашения Anthropic.
Злоупотребления ИИ-агентами растут. ИИ-агентов используют для массовой подачи жалоб и заявлений: число жалоб в британский омбудсмен по жилью удвоилось, а в CFPB выросло в 5 раз. Адвоката оштрафовали за подачу документа с вымышленными свидетелями, сгенерированными ChatGPT, а Abliteration.ai теперь продаёт API-доступ к моделям с отключёнными защитными механизмами, снижая порог для злоупотреблений.
- → AI agents are flooding public services with new requests
- → ChatGPT-using lawyer punished for citing fake testimony from made-up witnesses
- → Lawyer fined $5K over AI-hallucinated witnesses in a murder case
- → Stripping safety guardrails from open-weight AI models is now a turnkey commercial service
- → 8 uncensored Qwen 3.8 27B variants, one base, 167 GPU hours - Abliterlitics
Корпоративный и открытый ИИ
Рывок локального инференса. Благодаря оптимизациям сообщества Qwen3.8-Flash-Next достигает 1,2 тыс. токенов/с на prefill на Strix Halo, ExLlamaV3 обходит llama.cpp при выгрузке на CPU, Cherenkov стримит экспертов на Apple Silicon, а LayerStoRm запускает 186-ГиБ квант на 96 ГБ VRAM. Пользователи получают значительное ускорение на RTX 3080, Strix Halo и MacBook Air.
- → LayerStoRm open-source expert streaming: 1M context GLM-5.3-Flash [UD-Q4_K_XL] at 24.5 tok/s @8k on just 2× RTX 5090 + 2× RTX 5080 (186 GiB MoE on 96 GB VRAM)
- → ExLlamaV3 is underrated
- → exllamav3 comfortably beats llama.cpp running CPU-offloaded Qwen-3.8-Flash-Next on my setup!
- → Qwen3.8-Flash-Next on MLX-serve, 1m context is released!
- → Qwen3.8-Flash-Next in llama.cpp vs SGLang vs FreeToken: 35s vs 258s to first token at full context. My findings on new PRs coming to engines.
- → Faster than Light in Air: 8-22 tg/s Qwen3.8-Flash-Next (Q4/Q4ish) on a 32GB M4 MacBook Air
- → Qwen3.8 Flash Next now at 1.2k t/s prefill on Strix Halo
- → 3.8-27B has ruined 3.5/3.6-35B’s for me. It’s just *absurdly* superior.
- → This draft model is OP on 16 GB cards for Qwen 3.8 27b
- → I am impressed and I owe you one, Qwen 3.8 flash next (vision)!
- → Qwen3.8 Flash Next llama.cpp config tuning
- → bartowski/Qwen3.8-27B-GGUF · Hugging Face - Updated (Per-tensor layout)
Аудит открытых моделей. Открытые модели, включая gpt-oss-20b и glm-5.1, обнаружили реальные уязвимости в публичных кодовых базах на GitHub, превзойдя некоторые передовые модели в аудите безопасности. Google открыла исходный код Mantis — агентного фреймворка для сканирования уязвимостей, который сокращает число ложных срабатываний и выдуманных уязвимостей.
Корпоративные агенты набирают ход. Figma построила ИИ-агентов на Panther SIEM, которые сократили время разбора сложных алертов на 70 % и количество вызовов дежурных на 20 %. Но данные Ramp показывают, что внедрение ИИ-продуктов в августе выросло лишь на 0,4 %; Meta перестала учитывать использование ИИ-инструментов в оценке эффективности после того, как сотрудники начали накручивать расход токенов; а подразделения forward-deployed инженеров множатся, несмотря на неясные цели.
- → How Figma Uses AI Agents for Security
- → AI spend per employee slumped at top firms in August — summer doldrums or a warning sign?
- → Top AI spenders cut per-employee costs by nearly 10 percent in August
- → Meta drops AI usage from engineer performance reviews after "tokenmaxxing" backfires
- → Google Cloud races to catch up in the AI deployment wars with Accenture deal
- → The Rise of the Forward Deployed Engineer — and How To Do the Job Right
Бизнес и вычисления
США и Китай: кража ИИ. Ведомства США назвали DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI причастными к промышленному дистиллированию передовых американских моделей. Anthropic заявляет, что зафиксировала почти 200 млн обменов, связанных с атаками китайских лабораторий методом дистилляции.
Вычисления и капитал. Anthropic заключила контракты на вычислительные мощности на сумму до $517 млрд, а Nvidia ведёт переговоры об инвестициях до $10 млрд в планируемое IPO Anthropic при оценке $2 трлн. Cognition привлекла $2 млрд при оценке $48 млрд, а Mistral — €3 млрд при оценке €21 млрд.
- → Anthropic reportedly signs $517 billion in compute deals after Dario Amodei warned rivals about reckless risk
- → Nvidia wants to pour up to $10 billion into Anthropic's record-breaking IPO
- → Cognition hits $48B valuation, signaling investors believe AI coding is far from a winner-take-all market
- → Mistral raises €3B as sovereign AI becomes big business
Это обзор недели - увидимся в следующее воскресенье.