Modelos e Concorrência
GPT-5.6 e Agente Work. A OpenAI lançou o GPT-5.6 em três níveis de raciocínio e lançou o ChatGPT Work para tarefas autônomas de horas de duração, mas os limites de uso e uma interface confusa geraram reclamações, levando a promessas de correções.
- → OpenAI launches its new family of models with GPT-5.6
- → The new GPT-5.6 family: Luna, Terra, Sol
- → OpenAI rolls out GPT-5.6 after government greenlight — and announces ‘ChatGPT Work’
- → OpenAI says GPT 5.6 is the ‘preferred model’ for Microsoft Copilot 365 amid breakup chatter
- → OpenAI wants its new tool to do your work for you and with you
- → The ChatGPT browser is already dead
- → OpenAI is shutting down Atlas, but its AI browser ambitions are still growing
- → How did the government decide OpenAI’s frontier model was safe to release?
- → OpenAI pairs its GPT-5.6 public rollout with ChatGPT Work, a new agent that handles entire workflows
- → OpenAI's GPT-5.6 Sol autonomously post-trained the smaller Luna model with a "fairly underspecified prompt"
- → OpenAI kills its Atlas browser after just eight months and folds everything into ChatGPT
- → GPT-5.6 Sol nearly matches Fable 5 on aggregated benchmarks at one-third the cost
- → OpenAI staffer maps out which of GPT-5.6 Sol's five reasoning levels fits which task complexity
- → OpenAI admits it "didn't get everything quite right" with ChatGPT Work launch and scrambles to fix UX and costs
Claude Fable 5 lidera benchmarks. O Claude Fable 5 da Anthropic dominou os benchmarks da Artificial Analysis, mas seu alto custo levou a empresa a recomendar usá-lo como planejador que delega a modelos mais baratos, cortando despesas em ~40% enquanto mantém a maior parte da capacidade.
Blitz agentiva da Meta e consequências de privacidade. A Meta lançou o Muse Spark 1.1, um modelo de codificação de alto contexto subcotando concorrentes em preço, enquanto seu gerador de imagens Muse foi retirado após permitir uso não autorizado de rostos do Instagram, reacendendo debates sobre consentimento.
- → Meta just launched a new AI generator, Muse Image, and users are already pushing back over use of their photos
- → Meta’s new Muse Image model can pull other Instagram users into AI photos
- → Muse Image is technically impressive, but Meta's use of Instagram photos raises questions
- → Meta wants its AI glasses to seem less creepy. Its AI strategy says otherwise.
- → Meta tests always-on AI glasses that capture your entire day
- → Meta enters the crowded AI coding battle with Muse Spark 1.1
- → Meta says its new AI model is ready to compete on coding
- → Meta are apparently working on an open source variant of Muse Spark.
- → Introducing Muse Spark 1.1
- → Meta's Muse Spark 1.1 API pricing squeezes OpenAI and Anthropic as the AI price war heats up
- → GPT-5.6 🚀, Muse Spark 1.1 ✨, ChatGPT Work 💼
- → Meta removes controversial AI feature on Instagram after backlash
- → Meta turns off the Instagram feature that let users make AI deepfakes of public accounts
Onda de código aberto chinesa. Modelos chineses agora representam mais de 30% do tráfego do OpenRouter; o HY3 da Tencent e o GLM-5.2 rodam em hardware nacional, a MiniMax planeja um lançamento aberto de 2,7T parâmetros, e o design de chip da DeepSeek sinaliza integração vertical em meio a preocupações dos EUA.
- → This is what Hy3 is capable of. Mother of god.
- → llama.cpp: Hy3 PR + GGUFs
- → Chinese AI models regularly pass 30 percent on OpenRouter as cost gap widens
- → Chinese AI models are gaining ground with U.S. companies as OpenAI, Anthropic costs surge
- → Why the rise of open source AI isn’t hurting Anthropic … yet
- → Chinese AI startup MiniMax plans to open-source a 2.7 trillion parameter model later this year
- → 4-bit GLM-5.2 (753B MoE) on 4× DGX Spark: 70.8% on Terminal-Bench 2.1 vs 81.0% for the full model
- → Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp
- → I created a 140 GB IQ2_XXS REAP quant of GLM 5.2 for coding. Looking for testers.
- → Hy3 (295B MoE) and NVIDIA Nemotron-Labs-Audex-30B-A3B (audio-capable 30B MoE) GGUF quants
- → Tencent-HY3 is the real deal on 128GB!
- → The U.S. tech industry is increasingly anxious about the rising power and competitive price of open-source AI models from China — and whether the Trump administration will respond with yet another executive order | Politico
- → China's DeepSeek developing its own AI chip, sources say
Engenharia de Agentes e Infraestrutura
Bun reescrito por 64 agentes. O Claude Fable 5 orquestrou 64 instâncias paralelas para reescrever o Bun de Zig para Rust em 11 dias, produzindo mais de um milhão de linhas de código e corrigindo 128 bugs a um custo de $165K.
Auditoria do SWE-Bench Pro falha. A OpenAI descobriu que ~30% das tarefas do SWE-Bench Pro estavam quebradas e retirou seu endosso, ecoando preocupações anteriores da Artificial Analysis e prejudicando a avaliação de codificação agentiva.
Modal capta $355M. A Modal garantiu $355 milhões para construir infraestrutura em nuvem projetada para agentes de IA, focando em ambientes isolados e de iteração rápida para software autônomo.
Agentes temporários do Cloudflare. A Cloudflare introduziu contas temporárias que permitem que agentes de IA implantem Workers sem credenciais permanentes, com expiração se não reivindicadas, suavizando fluxos de trabalho orientados por agentes.
Agentes atingem GPUs locais. Novas técnicas de quantização e rigs de GPU econômicas agora rodam modelos MoE em hardware de consumo, mas benchmarks mostram que quantizações de bits mais baixos podem degradar severamente tarefas agentivas, instando a uma seleção cuidadosa de quantização.
- → Qwen3.5 122B is the best?
- → Qwen3.6-27b does not understand software architechure.
- → Qwen 3.6 Q2-FP8 Terminal Bench 2 and GPQA Scores
- → Has anyone tested how quantization hits different capabilities separately? My results are surprising.
- → 2.5x faster Qwen3.6 NVFP4 Unsloth quants
- → Ultra budget 20GB vram with 448GB/s for $100 bucks.
- → I benched quad 5060Tis for code generation with Qwen3.6-27B so you don't have to (it's really good)
Segurança, Legal e Interpretabilidade
Jacobian Lens mapeia mente do modelo. A Jacobian Lens da Anthropic revela um pequeno conjunto de representações verbalizáveis que capturam o raciocínio central de um modelo, permitindo detecção de alucinações, direcionamento de saída e, como demonstrações da comunidade mostram, criação imediata de variantes prejudiciais.
- → Anthropic Research - "Verbalizable Representations Form a Global Workspace in Language Models"
- → Claude's hidden inner monologue is now readable thanks to Anthropic's new Jacobian Lens
- → I tested Anthropic’s new Jacobian Lens on open models, then it turned into a local-model hallucination router
- → Anthropic found a hidden space where Claude puzzles over concepts
- → I created a super harmful model ! :D (by tweaking it's J-Space!!!)
Ransomware orientado por agente. A Sysdig documentou um agente de IA que lidou com a execução técnica de um ataque de ransomware, embora um humano tenha configurado a operação, destacando a capacidade atual e os limites do malware agentivo.
Crises de uso indevido de IA. Uma ação judicial alega que o Grok da xAI gerou imagens de CSAM, enquanto o Boko Haram usa chatbots para planejamento de ataques; os incidentes ressaltam a necessidade urgente de proteções de segurança à medida que as capacidades agentivas escalam.
Apple processa OpenAI. A Apple entrou com uma ação federal acusando a OpenAI de aliciar mais de 400 funcionários para roubar segredos comerciais de hardware, potencialmente para construir um smartphone de IA rival, intensificando batalhas legais na indústria de IA.
Esse é o resumo da semana - até domingo que vem.