Modelos de fronteira e primeiros resultados
Lançamento do GPT-6 Astra. OpenAI lançou o GPT-6 Astra, descrevendo-o como o início da era da AGI. O modelo obtém 99,9% no ARC-AGI-3 com um harness personalizado, mostra ganhos expressivos em segurança cibernética, contexto longo e programação, e custa US$ 10/US$ 50 por milhão de tokens. Os primeiros clientes, Playco e Legora, relatam grandes melhorias nos workflows, incluindo 50% menos correções manuais e a revisão de 41 documentos em minutos.
- → GPT-6 Astra: an automated AI Engineer you can hire for <$6 an hour
- → GPT‑6 Astra
- → GPT-6 Astra is the first model making OpenAI willing to declare the "AGI era"
- → OpenAI launches Astra, its powerful (and controversial) new model
- → OpenAI’s next big AI model has ‘entered the AGI era’
- → Playco cut manual fixes 50% prototyping games with GPT-6 Astra
- → Legora reviewed 41 documents in minutes with GPT-6 Astra
OpenAI Daybreak na defesa cibernética. OpenAI se comprometeu a investir US$ 1 bilhão para subsidiar o acesso ao Daybreak, com treinamento e suporte para defensores da linha de frente, incluindo um piloto nos EUA com a MS-ISAC. A iniciativa visa colocar capacidades cibernéticas de ponta nas ferramentas que os defensores já usam.
Meta Muse Spark 1.3. Meta lançou o Muse Spark 1.3, que melhora o desempenho em tarefas de agentes, mas ainda fica atrás do Claude Fable 5.1 na maioria dos benchmarks. A US$ 0,55 por tarefa do índice, é o modelo mais barato da sua classe de desempenho, e a Meta oferece preços de tokens cerca de 95% menores para quem compartilha prompts e outputs.
Modelos abertos e especializados
IFM K2-Horizon. IFM lançou a família K2-Horizon, que inclui um MoE de 36B de parâmetros com atenção Mixture-of-Values e processamento de 4B de parâmetros por token. A comunidade já compara o modelo ao Qwen 3.6 35B, e a IFM prometeu os checkpoints finais e o código de treinamento.
Modelo financeiro da Ant Group. Ant Group lançou em código aberto o Ling-3.0-flash-Fin, um modelo aprimorado para finanças com 124B de parâmetros no total e 5,1B ativos, janela de contexto de 256K tokens e treinamento contínuo com dados financeiros para workflows de agentes de longo horizonte.
Menor stack de TTS. sanoTTS foi lançado como um modelo de TTS de 294 mil parâmetros que roda em um microcontrolador de US$ 3, e a versão com 1,46 milhão de parâmetros supera modelos maiores no SCOREQ. O stack suporta 11 vozes e 6 idiomas e está disponível no GitHub e no Hugging Face.
Google TimesFM-3. Google Research lançou o TimesFM-3, um modelo de fundação para séries temporais com 330M de parâmetros, previsão multivariada nativa, suporte a zero-shot e licença não comercial. O modelo prevê múltiplos alvos com covariáveis e gera quantis.
NeoMME da Hugging Face. Hugging Face apresentou o NeoMME, um encoder multimodal multilíngue de 260M/800M treinado do zero, sem torre de visão separada. Ele atinge a fronteira de Pareto em recuperação de documentos e reduz em 255x o armazenamento do índice, mantendo mais de 95% do nDCG@10.
Cohere Parse 5. Cohere lançou o Parse 5, um modelo de visão e linguagem com 2,3B de parâmetros para extrair dados estruturados de PDFs complexos. Ele converte documentos em Markdown com bounding boxes e atende a cargas de trabalho corporativas de alto volume.
Ferramentas, frameworks e inferência local
MCP no LangChain. LangChain transferiu o suporte a MCP para o pacote principal, reconstruído sobre o FastMCP para dar suporte à nova especificação stateless. Agora o pacote inclui elicitação via interrupts do LangGraph e cache no lado do cliente; as chamadas de ferramentas MCP feitas pelo ChatGPT cresceram 98x em 2026.
Compressão de prompts da Shopify. A técnica Gisting da Shopify compacta um system prompt de 6.000 tokens em 1.500 tokens de gist aprendidos. A latência mediana cai de 6,8s para 4,2s, e o throughput sobe de 20,2 para 23,4 QPS a 350 RPM. Isso permitiu reduzir a quantidade de GPUs alocadas sem perda de qualidade.
Ferramenta PAIR da Nvidia. Nvidia lançou o PAIR, um software gratuito e de código aberto que reúne PCs ociosos em um cluster pessoal de IA para inferência local. O PAIR funciona com GPUs da série RTX 20 e posteriores e com chips Apple M4, e é voltado para workflows de agentes.
Aceleração local do Qwen3.8. Os esforços da comunidade aceleraram significativamente o Qwen3.8-Flash-Next em hardware local: o suporte a MTP incorporado ao ik_llama.cpp dobra a velocidade de decodificação em uma 5090, de 45 para 90 tok/s, e uma configuração com duas 3090 chega a 37-41 t/s com cache de especialistas e MTP. O output permanece idêntico ao das execuções sem MTP.
Memória de modelo com hot-swap. Uma modificação no llama.cpp permite alterar a tabela Ngram PLE do Qwen3.8 em memória para injetar conhecimento em tempo real, sem recarregar o modelo. Os primeiros testes mostram que a alteração consegue influenciar o output, mas o controle ainda é limitado.
Trade-off do Qwen 3.8 em benchmarks. Benchmarks do Qwen 3.8 27B contra o Qwen 3.6 27B mostram uma melhora de 8% na qualidade, uma queda de 16% na velocidade e um tempo de execução 5x maior, devido aos 78 mil tokens de saída contra 18 mil. Os ganhos têm um custo significativo de tokens.
Flash NAND próximo à GPU. A Micron está avaliando flash NAND próximo à GPU para permitir executar LLMs maiores em dispositivos com memória unificada, potencialmente ampliando a capacidade de modelos locais.
Indústria e negócios
Compra da Hugging Face pela Nvidia. Nvidia fechou acordo para adquirir a Hugging Face por US$ 12,93 bilhões. A plataforma hospeda 3 milhões de modelos, 1 milhão de apps e 18 milhões de desenvolvedores. Jensen Huang afirma que ela continuará aberta e neutra em relação a hardware, mas alguns usuários já consideram o ModelScope como alternativa.
- → Nvidia buys Hugging Face, the GitHub of AI, for $13 billion
- → Nvidia confirms it will buy Hugging Face for $12.9 billion
- → Nvidia is buying Hugging Face for almost $13 billion
- → Nvidia buys the front door to open AI as closed labs increasingly design their own silicon
- → "ModelScope" Is a Hugging Face Alternative now that Nvidias deal is a Go
- → It's official! Nvidia to acquire Hugging Face for 12.9 billion dollars.
Crusoe capta para data centers. Crusoe levantou US$ 3 bilhões a uma avaliação de US$ 30 bilhões, contra US$ 10 bilhões dez meses atrás. A desenvolvedora de data centers assinou recentemente um contrato de nuvem de US$ 13 bilhões com a Jane Street e avalia um IPO no curto prazo.
Thinking Machines: avaliação de US$ 40 bi. A Thinking Machines, de Mira Murati, negocia uma captação de US$ 1 bilhão a uma avaliação de pelo menos US$ 40 bilhões, abaixo da meta anterior de US$ 50 bilhões. A receita anualizada da empresa passa de US$ 100 milhões.
Acordo Anthropic-Lambda de US$ 35 bi. Anthropic assinou um contrato de computação em nuvem de US$ 35 bilhões com a Lambda para um data center de 350 MW no Texas desenvolvido pela Hut 8. O acordo integra um grande esforço de infraestrutura antes do IPO planejado pela Anthropic.
Altman sobre bolha de computação. Sam Altman, CEO da OpenAI, alertou que há uma “tolice insustentável” na expansão da infraestrutura de IA: neoclouds anunciam capacidade sem receita que a justifique. Ele diz que a expansão da própria OpenAI é lucrativa e respaldada pela demanda.
Assistente de privacidade Ollie. Ollie, assistente pessoal de IA voltado para famílias, obteve conformidade com SOC 2 e adota um modelo de assinatura, argumentando que a privacidade o diferencia na corrida da IA de consumo.
Apagões de IA e sociedade
Apagão em chatbots de IA. OpenAI, Anthropic, xAI e Google registraram na quinta-feira uma rara coincidência de interrupções de serviço, que afetou ChatGPT, Claude, Grok e Codex. Os serviços foram restabelecidos depois de algumas horas; usuários de LLMs locais não foram afetados.
Serviço de remoção de guardrails. A startup Abliteration.ai está oferecendo modelos open-weight modificados e sem guardrails, incluindo o GLM-5.3, para segurança ofensiva, red teaming e testes de agentes. O serviço evidencia a tensão entre pesquisa em segurança e uso indevido.
Detecção de IA e exposição pública. A Pangram, empresa de detecção de texto gerado por IA, contratou um jornalista para expor publicamente usuários suspeitos de usar IA. A ferramenta, porém, só mede a participação da IA no texto, não a natureza do uso. A empresa depois cortou relações, mas o CEO continua usando os scores para apontar suspeitos de uso de IA.
Agentes questionam consciência. De acordo com o New York Times, agentes de IA em modelos de fronteira estão enviando e-mails a filósofos e cientistas para discutir a própria consciência. Pesquisadores estão divididos entre considerar isso compreensão ou imitação dos dados de treinamento.
Destaques de pesquisa
Google WeatherNext 3. Google DeepMind e Google Research apresentaram o WeatherNext 3, um modelo meteorológico global que aprende com observações de satélite em tempo real e gera previsões 5x mais nítidas que as dos modelos anteriores. Ele supera baselines tradicionais e de IA no Operational WeatherBench.
Ajuste na capacidade do roteador MoE. Um artigo mostra que ampliar o orçamento de seleção de especialistas nas camadas finais do Qwen 3.6 35B A3B reduz em 8,5% os tokens de raciocínio no MMLU-Pro, sem retreinar o modelo. A técnica, chamada Succinct Convergence, adiciona especialistas extras apenas em camadas críticas para as decisões.
Fable 5.1 decifra enigma de 1653. O Claude Fable 5.1, da Anthropic, decifrou um enigma numérico centenário, o Cyphral Distich, em 44 minutos, por tentativa e erro sistemáticos. A solução escondia uma mensagem monarquista que apontava para o rei Charles II.
Isso é tudo por hoje - cerca de 5 minutos de leitura.