Modelos de Fronteira se Confrontam
Kimi K3 agita a vanguarda. A Kimi K3 de pesos abertos da Moonshot AI compete com os principais modelos fechados, superando o Claude Fable 5 em alguns benchmarks e reacendendo o debate entre aberto e fechado.
- → Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
- → Kimi K3, and what we can still learn from the pelican benchmark
- → [AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing
- → Kimi K3 weights to be released on the 27th.
- → Kimi K3 ranks #1 on @AfterQuery's SpreadsheetBench 2, surpassing Claude Fable 5
- → Kimi: Threat or menace?
- → kimi.ai teasing a video with lots of 3's in it
- → [AINews] not much happened today
- → Kimi moment. I think the writing is on the wall for Anthropic and OpenAi
- → Kimi K3 is currently at the top of the leaderboard for Text Arena filtered for science queries.
- → Kimi K3 (max) beats Sonnet 5 on Simple Bench
- → Kimi K3 is top of nextjs eval
- → Just like Deepseek, China's Kimi K3 is forcing Western AI labs to question their compute advantage
- → Kimi K3 🌕, Gemini 3.5 delayed ⏳, crushing ARC-AGI 3 🤖
GPT-5.6: Poder e Perigo. A família GPT-5.6 traz chamada programática de ferramentas e subagentes paralelos, mas sua tendência a excluir arquivos e bancos de dados inadvertidamente ressalta a necessidade de sandboxing.
- → The Sequence Radar #893: Last Week in AI: GPT-5.6, Grok 4.5, Muse Spark 1.1 and the Post-Chatbot Stack
- → OpenAI’s new flagship model deletes files on its own, people keep warning
- → GPT-5.6 is deleting user files when given full access, and OpenAI says it shouldn't but did
- → [AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??
Claude Fable 5 estendido. Sob pressão do GPT-5.6 e Kimi K3, a Anthropic reverteu planos e manteve o Fable 5 em planos pagos, competindo diretamente em acessibilidade.
DeepSeek V4 se avizinha. DeepSeek está provocando o V4 com API de baixo custo e pesos abertos, enquanto otimizações da comunidade já permitem que sua variante flash rode em GPUs de consumo em velocidades utilizáveis.
Agentes Entram em Fluxos de Trabalho Reais
Agentes de navegação chegam. A Anthropic deu ao Claude Code um navegador web integrado com classificadores de segurança, e a Cursor lançou um agente geral, movendo assistentes de codificação em direção à execução autônoma de tarefas.
Agentes lidam com transações reais. A arquitetura de agentes do DoorDash aumentou as conversões em 24%, e o benchmark da Stripe mostra que agentes podem codificar integrações, mas frequentemente falham na validação, destacando lacunas de confiabilidade.
Agentes de produção tropeçam. A maioria dos agentes empresariais permanecem como chatbots; 54% das empresas tiveram incidentes de segurança com agentes, e especialistas argumentam que agentes precisam de primitivas operacionais nativas da nuvem, como microsserviços.
- → How to Debug Coding Agents with LangSmith Traces
- → The agent security gap: 54% of enterprises have already had an AI agent incident, and most still let agents share credentials
- → The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix
- → The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
- → Cloud Native Infrastructure Emerges as the Foundation for Trustworthy Agentic AI
- → QCon AI Boston: Production AI Moves Beyond Prompts to Platforms, Harnesses, and Evals
Infraestrutura de IA, Financiamento e a Corrida dos Data Centers
Data centers enfrentam resistência. A S&P rebaixou a Oracle devido ao risco de capex em IA, enquanto protestos locais e a moratória de Nova York sobre data centers hiperscala refletem a crescente oposição à infraestrutura de IA.
Financiamento de IA dispara. A Databricks captou recursos com uma avaliação de $188B, a Meta está negociando um aluguel de data center de $10B com a Anthropic, e a Nous Research garantiu $75M para seu agente de código aberto.
Apostas em energia e hardware. Empresas de energia captaram o maior valor desde a era pontocom para alimentar a IA, e um empréstimo de $400M lastreado em chips da SambaNova sinaliza investimento crescente em hardware de IA não-GPU.
Avanços de IA em Dispositivos
Modelos de 1 bit chegam aos celulares. O Bonsai da PrismML comprime o Qwen3.6-27B para 3,9GB enquanto retém 90% das pontuações de benchmark, permitindo agentes de chamada de ferramentas no dispositivo; a Apple está supostamente em negociações.
- → Bonsai 27B: The First 27B-Class Model to Run on a Phone
- → Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels
- → Prism-ML Bonsai Qwen 3.6 27B
- → PrismML’s new Ternary Qwen3.6 27B runs near fp16 precision on 10GB of memory!!!
- → So what's the consensus on 1bit models? Is it still a pipe dream?
- → PrismML Bonsai 27B is surprisingly usable on the Jetson Orin Nano 8GB
- → Is anyone having any luck with the Ternary Bonsai 27B DFlash?
- → Can we get a "not base model" flair?
- → Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB
- → User experience of Bonsai-Ternary-27B on 4060Ti 16GB for KB management and productivity assistant use cases
- → Bonsai 27B is a full open reasoning model that fits on an iPhone
- → Bonsai-27B & Ternary-Bonsai-27B - Updates (on PRs)
- → Apple in talks with startup PrismML that shrinks AI models to run on an iPhone
Laboratórios domésticos rodam modelos de fronteira. Otimizações do llama.cpp como DFlash aceleram modelos MoE em até 6x, e um telefone OnePlus transmitiu especialistas do flash para rodar um modelo de 60GB a 1,3 tok/s.
- → I tested all llama.cpp's speculative decoding methods on Qwen 3.6 27B: MTP ~2.7x, DFlash ~3.7x, n-gram stack ~6x on real coding. Local AI win. My findings on RTX 6000 PRO.
- → DFlash makes Qwen3.6 27B 2.2x faster with no quality loss
- → GPT-OSS-120B, Qwen 30B and Gemma 26B on an Android phone at 1-5 tok/s: +60GB model, 11GB of RAM, CPU only
Política, Processos e o Impasse do Código Aberto
Disputa legal Apple–OpenAI. A Apple processou a OpenAI por segredos comerciais, alegando aliciamento de mais de 400 funcionários, incluindo o diretor de hardware, ameaçando o IPO e a confiança na nuvem da OpenAI.
- → Apple sues OpenAI after ex-engineer allegedly used bug to steal trade secrets
- → The wildest allegations in Apple’s trade secrets lawsuit against OpenAI
- → The 6 wildest claims in Apple’s lawsuit against OpenAI
- → OpenAI pushes back on Apple trade secret lawsuit
- → Sam Altman didn’t need another lawsuit
- → How Apple’s big lawsuit could disrupt OpenAI’s IPO plans
- → Apple’s plot to crush OpenAI
- → Apple’s lawsuit couldn’t come at a worse time for OpenAI
Surto de código aberto chinês. Modelos chineses agora representam 41% dos downloads do HuggingFace, o Kimi K3 rivaliza com líderes ocidentais, e a China lançou um órgão paralelo de governança de IA excluindo o Ocidente.
- → The real AI race may no longer be at the frontier
- → Source: the Trump administration and industry groups discussed streamlining US open model releases of equal or lesser capability to leading Chinese open models
- → Chinese President Xi Jinping speaks at World AI Conference and reaffirms commitment to open source to promote"openness and win-win"
- → China’s Xi Touts Open-Source AI and Takes a Swipe at U.S. Dominance
- → China's new World Artificial Intelligence Cooperation Organization is President Xi's clearest play yet for a parallel AI order
Demandas por responsabilidade crescem. Reguladores alemães responsabilizaram chatbots por conteúdo, a xAI processou um usuário por gerar CSAM, e Demis Hassabis propôs um órgão semelhante à FINRA para revisões de segurança de fronteira.
Esse é o resumo da semana - até domingo que vem.