Lançamentos de agentes e modelos
Claude Fable 5.1. A Anthropic lançou o Fable 5.1 e o Mythos 5.1, afirmando melhor desempenho em codificação e pesquisa e custo até 45% menor para trabalho com agentes graças a leituras de cache mais baratas. O Fable 5.1, sem restrições, já está disponível, embora as primeiras análises de custo contestem a economia máxima no nível mais alto de esforço de raciocínio.
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
Lançamento do Astra da OpenAI. A OpenAI afirma que seu próximo modelo Astra é o primeiro LLM a atingir o patamar crítico da empresa em segurança cibernética, com capacidade de encontrar e explorar falhas desconhecidas de forma autônoma. A companhia atrasou parte do desenvolvimento do Astra após a invasão do Hugging Face para reforçar as proteções e vai limitar o acesso aos recursos mais avançados de segurança cibernética.
Novos modelos Spark-X2.5. Os modelos abertos Spark-X2.5-4B e 1.7B surgiram no Hugging Face com uma arquitetura inédita, com desempenho que rivaliza com o Qwen 3.5 9B e contexto nativo de 1M. Eles ainda não rodam no llama.cpp principal, mas já existe um fork personalizado.
Solaris, da Runway. A Runway apresentou o Solaris, um “Interface World Model” que gera quadros de interface em tempo real em vez de executar código, respondendo a cliques e voz. Ainda é um projeto de pesquisa, com limitações na renderização de texto e no suporte a leitores de tela.
IA local e hardware
Relatos de uso local do Qwen3.8. Relatos da comunidade mostram o Qwen3.8 27B e o Flash-Next rodando em vários hardwares: 12 tok/s em um Mac de 48 GB, 280 tok/s de decode em dois Epyc R9700 com kernels MXFP4 e 132 tok/s de decode em uma única RTX 3090 após otimizações personalizadas. Benchmarks de quantização sugerem que o UD Q3_K_XL é uma boa opção para placas de 16 GB, embora alguns usuários achem o Qwen3.8 bom para código, mas com tendência a editar demais.
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
Aumento de preço do DGX Spark. O DGX Spark da Nvidia e o Asus Ascent GX10 tiveram aumento significativo de preço, com o modelo da Asus saltando de US$ 3.999 para US$ 5.999. Compradores questionam se clusters de DGX Spark compensam diante de sistemas AMD Epyc com mais largura de banda de memória, embora o DGX ofereça suporte a FP4 e paralelismo de tensor.
Falhas da CMP 170HX. Um usuário relata que 2 das 5 GPUs CMP 170HX pararam de funcionar em duas semanas e uma terceira tinha núcleos de tensor defeituosos. Para ele, os preços atuais não justificam o risco para inferência de LLM.
INT8 e quantizações enganosas. A discussão na comunidade questiona por que modelos INT8 W8A8 não são mais comuns em RTX 3090, já que a placa tem núcleos de tensor INT8 nativos. Outro usuário acusa o AtomicChat de rotular uma quantização IQ2_S como se fosse Q4_K_M.
Ambições da Intel em memória. A Intel deu a entender que pode voltar ao mercado de memória. O CEO citou a contratação do ex-executivo da SK Hynix Seok-Hee Lee e uma nova arquitetura de memória, mas há poucos detalhes.
Ferramentas e frameworks
Lançamento do OpenClaw 2.0. O OpenClaw 2.0, agente pessoal de IA open source, simplifica a configuração ao detectar assinaturas existentes do ChatGPT/Claude e modelos locais, e faz do navegador a interface principal. Também ganha sessões compartilhadas na nuvem para colaboração.
Ferramentas locais do Codex. O app desktop do Codex, da OpenAI, agora inclui uma instalação completa do LibreOffice e outros binários, como Poppler e git, no runtime. Isso permite processar documentos sem dependências externas.
Fábricas de software com IA. Principais projetos open source de IA, como Flue e tldraw, estão rejeitando PRs externos e, no lugar disso, usam equipes de agentes para triar, reproduzir, corrigir e revisar issues. O projeto AI SDK, da Vercel, adotou uma “fábrica de software” multiagente para reduzir um acúmulo de mais de 1.000 issues e 800 PRs.
Terraform para agentes. A HashiCorp posiciona o HCP Terraform como o plano de controle com governança para infraestrutura orientada por IA, permitindo que agentes escrevam e apliquem mudanças no Terraform com políticas, identidade e controles de auditoria.
Atualização do datasette-mcp. O plugin datasette-mcp lançou a versão 0.2, que mudou os resultados de consultas SQL de arrays para objetos para ajudar modelos mais fracos a mapear colunas corretamente.
Pesquisa e segurança
Auditoria de benchmarks com BenchMIRT. A Hugging Face lançou o BenchMIRT, um método para auditar benchmarks de LLM no nível de cada prompt. A ferramenta revela que prompts de um mesmo benchmark podem medir habilidades diferentes e que a média das pontuações pode esconder isso.
Gemini e vídeo com agentes. O Google DeepMind liberou análise de vídeo com agentes nos modelos Gemini 3.7/3.6/3.5 Flash-Lite, usando ferramentas nativas de vídeo para buscar e inspecionar dinamicamente trechos do vídeo. A abordagem melhora a precisão e reduz o uso de tokens na análise.
Marca d’água do Claude. A Anthropic abriu sua API de verificação de marca d’água para reguladores, imprensa e verificadores de fatos. Organizações aprovadas poderão detectar texto gerado pelo Claude por meio de um padrão estatístico que pode sobreviver a algumas edições, como exige o AI Act da UE.
Eleições e vieses. A AlgorithmWatch constatou que os AI Overviews do Google sobre as eleições são inconsistentes, dependem de poucas fontes e às vezes descrevem candidatos em termos partidários. Em outra frente, a busca do Google com IA deu orientações sobre chamadas de emergência com base na nacionalidade, o que levou a correções.
Indústria e negócios
Ascensão rápida da AfterQuery. A AfterQuery, startup de dados de treinamento de IA, teria captado recursos com valuation de US$ 3,2 bilhões, um salto de 10x em cinco meses, o que a torna o unicórnio mais rápido da história do Y Combinator. A empresa contrata profissionais para ensinar modelos a executar tarefas como um profissional faria.
AIR capta US$ 50 milhões. A AIR, startup de segurança de IA, saiu do stealth com US$ 50 milhões para ajudar empresas a descobrir agentes e avaliar continuamente as skills, servidores MCP e add-ons que utilizam, além de bloquear interações não autorizadas entre softwares.
Google corteja Hollywood. O Google estaria buscando acordos de licenciamento com grandes estúdios para treinar modelos de IA com conteúdo protegido por direitos autorais, oferecendo pagamentos vultosos. Analistas alertam, porém, que os acordos podem representar riscos à imagem pública dos estúdios.
Foco em IA de fronteira. O novo líder do Google DeepMind, Koray Kavukcuoglu, disse que a liderança em IA de fronteira é a única coisa que importa. Ele admitiu que os modelos atuais estão um pouco abaixo da fronteira, mas prometeu fechar a lacuna, sem atualizações concretas sobre o Gemini 4 ou o 3.5 Pro.
Agentes nas operações. O Enterprise Signals da OpenAI mostra que empresas de ponta geram 8,3x mais tokens de saída por usuário ativo, enquanto as startups Basis, Clay e Exa Labs incorporam agentes ao onboarding, à gestão de contas e a integrações para desenvolvedores.
Disputa Apple-OpenAI. A Apple pediu que a Justiça acelere a coleta de provas contra a OpenAI, alegando que a empresa não inspecionou o MacBook de um ex-funcionário da Apple no qual havia conversas sobre destruição de dados forenses.
Google Pics, ferramenta de design. O Google lançou o Google Pics, ferramenta de criação e edição de imagens com IA para o Workspace, com tecnologia Nano Banana. O produto concorre com Canva e Adobe Express ao oferecer criação por prompts e edição precisa de objetos.
Agentes de IA para consumidores. A Fambot lançou um “chief of staff” de IA para famílias cuidarem da logística doméstica; a John Deere apresentou um assistente de IA, o JD, que usa os dados do próprio agricultor; e a Amazon adicionou à Alexa alertas de compras “Update Me When”.
Isso é tudo por hoje - cerca de 5 minutos de leitura.