Modelos e interfaces
Claude Haiku 5.5. O novo modelo rápido e barato da Anthropic traz contexto de 1 milhão de tokens e derruba o preço do prompt para US$ 0,10 por milhão até 100 mil tokens, no mesmo patamar do GPT-6 Luna. Mas seu tokenizador conta de 25% a 30% mais tokens, e o preço sobe 5x acima de 100 mil. Nos benchmarks, o salto sobre o Haiku 4.5 é grande, e o desempenho em codificação agêntica é competitivo.
Mistral Large 4 “Le Chonk”. A Mistral lançou em prévia um modelo de pesos abertos com 1 trilhão de parâmetros, otimizado para programação, ciberdefesa e setores específicos, e afirma ter capacidade próxima à dos modelos de fronteira dos EUA e da China.
Modelos de decisão da Liquid AI. A Liquid AI abriu o código dos d1-3B e d1-omni-600M, modelos multimodais de decisão que devolvem respostas calibradas de sim/não, de escolha ou de pontuação sem gerar nenhum token de saída. O d1-3B se diz o melhor da categoria abaixo de 10B no Decision Index e roda em apenas 16 ms em hardware NVIDIA Jetson, e uma versão para navegador com WebGPU também apareceu.
API Decisions da OpenAI. A OpenAI lançou em beta a API Decisions, para avaliações de sim/não, categóricas e de escala em texto ou imagens, cerca de 10x mais rápida que a Responses. Ela suporta o GPT-6 Luna a US$ 0,10 por milhão de tokens de entrada, com tokens de saída gratuitos.
Interface inteligente do ChatGPT. Com o GPT-6, o ChatGPT passa a gerar gráficos interativos, botões, formulários e mini apps em vez de texto simples. A OpenAI afirma que o raciocínio começa já na etapa de pensamento, o que corta o tempo de espera, e usuários pagantes recebem o GPT-6 Sol, enquanto os gratuitos ficam com o Luna.
Geração de vídeo Kandinsky 6.0. O Kandinsky Lab lançou o Kandinsky 6.0 Pro (29B) e o Lite (3B), com suporte a ComfyUI e Diffusers, além de um upscaler de vídeo.
Nemotron nas competições. Modelos Nemotron ajustados por fine-tuning alcançaram resultados não oficiais de nível ouro na IOI 2026 (535,4/600) e nota de ouro oficial na IMO 2026, com 30/42, usando SFT, RL e o ciclo gerar-verificar-refinar.
Agentes e frameworks
Agentes da Nous Research. A Nous Research levantou US$ 90 milhões com valuation de US$ 1,5 bilhão e lançou o Hermes for Businesses, voltado a agentes de IA corporativos. Seu Hermes Agent de código aberto já foi clonado 24 milhões de vezes e responde por cerca de 2,5% do uso global de tokens de IA.
Deep Agents da LangChain. A LangChain apresentou atualizações do Skills que vinculam ferramentas a habilidades para manter o contexto enxuto, além do Managed Deep Agents v0.9, com agendamentos criados pelo próprio agente, configuração por execução e reações no Slack.
Ações do Copilot. O Hybrid Intelligence da Microsoft vai permitir que o Copilot acesse arquivos locais e execute ações no Windows em nome do usuário, como localizar, renomear, compactar e enviar documentos por e-mail.
Muse da Meta no iPad. O Muse, assistente agêntico da Meta, agora tem suporte nativo a iPad depois de atingir 6,6 milhões de instalações, e ganha conectores para ferramentas como Canva, GitHub e QuickBooks.
Agent Lightning. A Microsoft Research publicou em código aberto o Agent Lightning v1.0, um framework de RL agêntico de 3.500 linhas que usa harnesses de implantação reais e Kubernetes nativo. Em um exemplo, ele elevou o Pass@1 do Qwen3.5-9B no SWE-bench Verified de 41,8% para 56,4% com cerca de 6.000 amostras de treinamento.
IA local e ferramentas para desenvolvedores
ROCm 10.1. O ROCm 10.1 da AMD ataca o gargalo de movimentação de dados na inferência local; o lançamento foi discutido por usuários de IA local no Reddit.
llama.cpp acelera MoE. O llama.cpp ganhou um cache de GPU para especialistas MoE mantidos na memória do host, o que promete grandes ganhos de velocidade em modelos que não cabem inteiros na VRAM, e adicionou suporte a GLM5Next MTP.
Checagem de repositórios no Unsloth Studio. O Unsloth Studio agora recheca repositórios de modelos confiáveis antes de executar, depois que versões comprometidas do LiteLLM no PyPI mostraram como ataques de cadeia de suprimentos podem chegar às ferramentas de IA.
GLM-5.3-Flash em duas GPUs. Uma configuração com duas CMP 170HX de 64 GB roda o GLM-5.3-Flash com contexto de 384K e cerca de 90 tokens/s usando EXL3. O MoE de 320B mantém os pesos ativos na HBM, e há benchmarks comparativos com o Qwen3.8-Flash-Next.
Benchmarks do Qwen local. Avaliações recentes da comunidade comparam fine-tunes do Qwen3.8-27B e o Qwen3.8-Flash-Next com modelos de fronteira em tarefas de domínio específico e de programação. Um teste com 469 perguntas mostrou que modelos locais conseguem chegar perto dos resultados de fronteira, com privacidade e custo menor, embora o uso excessivo de tokens de pensamento siga sendo um problema.
Hardware e Windows
Novos Surface com IA. A Microsoft anunciou o Surface Laptop Ultra e o Surface RTX Spark Dev Box, ambos baseados no chip RTX Spark da Nvidia, de arquitetura Arm. O notebook parte de US$ 2.599, com até 128 GB de memória unificada, e chega em 16 de outubro; o Dev Box parte de US$ 5.999 e mira a execução de modelos locais de 120B ou mais.
Indústria e negócios
Gargalo de compreensão de código. Uma pesquisa com 300 líderes sêniores de engenharia mostrou que os agentes de código com IA deslocaram o gargalo para a depuração e a compreensão: as equipes passam hoje 9,8 horas por semana escrevendo código, mas 16,9 horas por semana depurando. O relatório aponta risco crescente em bases de código críticas.
Iniciativa da célula virtual. O Biohub coordena um esforço de US$ 1,8 bilhão para construir modelos de IA capazes de prever o comportamento das células. Google DeepMind, Meta e Isomorphic Labs investem US$ 300 milhões, e o Departamento de Energia dos EUA entra com mais de US$ 500 milhões para medições em laboratório e computação.
Clones open source da Adobe. O desenvolvedor Brandon Thomas usou o Claude Opus 5.5 para criar o Artcraft, um conjunto de sete aplicativos open source em Rust/WebAssembly que clonam Photoshop, Illustrator, Premiere e outros programas da Adobe. Os apps são incipientes e ainda têm muitas limitações, mas o projeto mostra a reimplementação clean-room assistida por IA.
Detector público do SynthID. O Google abriu ao público seu detector SynthID, que permite a qualquer pessoa verificar imagens, vídeos e áudios em busca de marcas d'água do Google ou de parceiros. O sistema já marcou mais de 180 bilhões de itens de mídia e também está embutido no Chrome e no Gemini.
Playground, do Google. O Google Labs lançou o Playground, uma plataforma no navegador em que adultos nos EUA podem criar jogos a partir de prompts de texto, com Gemini, Nano Banana e Lyria por trás. A Unity também anunciou o Unity Spark para desenvolvimento profissional de jogos assistido por IA.
Isso é tudo por hoje - cerca de 5 minutos de leitura.