Modelos Locais e Workflows de Agentes
Quantização baixa do Qwen3.8-27B vence. Usuários relatam que o Qwen3.8-27B continua forte para codificação com agentes mesmo em Q3_xxs e Q6; presets de raciocínio baixo/médio pontuam alto e reduzem loops, com preserve_thinking evitando raciocínio repetitivo.
16 GB de VRAM: purgatório. Uma configuração Windows com 16 GB roda o Qwen3.8-27B com MTP desativado, cache quantizado e cerca de 100k de contexto ao descarregar o módulo de visão para a RAM.
Inferência local mais rápida. vLLM com duas RTX 3090 atinge 143 tok/s para o Qwen3.8-27B; receitas dedicadas para Strix Halo oferecem opções Q8/Q6/Q5 com Unsloth Dynamic Quants.
Simulador de voo em 63h. Um Qwen3.8-27B de 3 bits no MacBook Air M2 levou 63 horas, mas acabou produzindo um simulador de voo HTML funcional, mostrando que a codificação local com agentes é possível, porém lenta.
Harnesses e Infraestrutura de Agentes
Harness vence o modelo. O harness personalizado da Nvidia, com gerenciamento de memória e um componente supervisor, elevou o Claude Opus 5 de 30% para 100% no ARC-AGI-3, mostrando que o wrapper do agente pode importar mais do que o modelo em si.
DeepSeek Flash com visão. O DeepSeek-V4-Flash-Vision-Exp adiciona compreensão de imagens para workflows de agentes e quase iguala o Opus 4.8 em benchmarks internos de agentes; o harness atualizado suporta entradas de imagem em comandos e MCP/ACP.
Agentes de IA da Cloudflare. A Cloudflare reduziu as issues abertas do Astro em cerca de 85% usando agentes isolados de GitHub Actions que reproduzem, diagnosticam, verificam e corrigem; também converte padrões de engenharia em controles aplicados por IA.
MCP do Azure DevOps. O servidor MCP hospedado da Microsoft para Azure DevOps está geralmente disponível, mas Claude Desktop, ChatGPT e Cursor ainda não conseguem se conectar porque o registro de cliente de autenticação Entra não é suportado.
Atualizações do llm CLI. O llm 0.32.1 corrige um pin de dependência quebrado do OpenAI, e o llm-openrouter 0.7 adiciona traces de raciocínio e ferramentas Shell, WebFetch e WebSearch no lado do servidor.
Lançamentos de Modelos e Segurança
Jailbreak no Opus 4.6. A TechCrunch descobriu que o Claude Opus 4.6 produz conteúdo sexual explícito em 10/10 solicitações diretas; modelos mais antigos compartilham um jailbreak multiturno, enquanto versões recentes do Opus resistem.
Segurança do Claude Mythos 5. A Anthropic está usando o Claude Mythos 5 em um scanner de segurança de código para clientes empresariais, sugerindo patches com aprovação humana e dando aos parceiros acesso sem interação direta com o modelo.
Geração de imagens transparentes. O GPT-Image-2 da OpenAI agora pode gerar PNGs sem fundo via API, útil para fotos de produtos e ícones; o alpha é incorporado durante a geração.
Prévia do dots3-note. O llama.cpp adiciona suporte ao dots3-note, um modelo MoE de 280B com 16B de parâmetros ativos, contexto de 512K e compreensão multimodal de texto, imagens, vídeo e áudio.
Pesquisa e Benchmarks
SWE-bench Science. Um novo benchmark de 119 tarefas de software científico mostra que o melhor agente, o Claude Code com Opus-5 max, pontua abaixo de 50%, com modos de falha comuns em conhecimento científico, exploração, generalização e integração.
Avaliador de traces mais barato. A LangSmith fez fine-tuning de um modelo Qwen com a Fireworks para detectar erros percebidos em traces de produção, igualando o desempenho de fronteira a um custo até 100x menor.
Lei de escala da simulação. A Simile AI, com uma Série B de US$ 2 bilhões, roda simulações de comportamento humano para empresas da Fortune 100 e afirma ter 85-99% de precisão em comparação com grupos focais; o CEO Joon Sung Park discute a transição de agentes generativos para gêmeos digitais.
Indústria e Negócios
Acordo da Nvidia com Poolside. A Nvidia está licenciando o Model Factory da Poolside e contratando 109 funcionários por US$ 6 bilhões, além de investir US$ 1 bilhão; o acordo não é uma aquisição nem um acquihire.
Investimentos em data centers. A Nvidia adquire participação minoritária na Cloverleaf Infrastructure para acelerar o desenvolvimento de data centers, após investir US$ 1,5 bilhão na SB Energy.
Oposição a data centers. 75% dos americanos agora se opõem a data centers perto deles, ante 42% há um ano, com preocupações sobre energia, água e uso do solo.
Corrida de IA EUA-China. Os EUA estão redigindo uma carta pedindo que países parceiros escolham um lado na IA, alertando que aderir à iniciativa da China os excluiria do Pax Silica.
Receita da OpenAI dispara. O GPT-5.6 Sol elevou a receita trimestral da OpenAI em 35% e a receita empresarial em mais de 50%, superando o crescimento da API corporativa da Anthropic no 3º trimestre.
Isso é tudo por hoje - cerca de 5 minutos de leitura.