Lançamentos de agentes e modelos
Preview do Hy4 da Tencent. A Tencent lançou o Hy4 preview, um aumento significativo de tamanho em relação ao Hy3, com raciocínio alto por padrão e um modo no_think. A comunidade já conta com um quant oficial de ~2,38 bits e um GGUF de ~200 GB que, segundo relatos, mantém cerca de 98% do desempenho do BF16.
Inferência local e hardware
Port do FlashMLA para sm_120. Um build comunitário estende o FlashMLA às GPUs Blackwell sm_120 para consumidores, mostrando acelerações de 2 a 3 vezes em relação ao SDPA do PyTorch em vários workloads esparsos de MLA e 8% menos latência no decode de KV cache FP8.
Correção do Nemotron em 16 GB. Os GGUFs de baixa precisão do Nemotron-3.5-Lightning estavam, na verdade, com ~4,70 bpw por causa da quantização por largura de linha; um build corrigido do llama.cpp gera um arquivo real de 3,07 bpw / 11,77 GiB, que roda contexto de 262K em 16 GB.
Qwen3.8-Flash-Next no Mac. Uma versão de 2 bits e 79 GB do Qwen3.8-Flash-Next rodou em um M5 Max de 128 GB com slot de contexto de 350K usando llama.cpp, incluindo um prefill frio de 333 s para um prompt de 105K e decodificação especulativa com ngram-mod.
DeepSeek V4 Flash em duas GPUs. Em setups com 2x DGX Spark/GX10, o DeepSeek V4 Flash 0731 mantém 67–84 tok/s, com HumanEval Pass@1 local de 94,5% contra 97,0% do GLM-5.3-Flash NVFP4. O GLM terminou o benchmark em cerca de metade do tempo.
Contexto de 1M em duas 5090. Um fork do NInfer adiciona paralelismo de tensores e escala YaRN ×4 para rodar o Qwen3.8-27B NVFP4 com contexto de 1.048.576 tokens em duas 5090, decodificando a 48–100 tok/s em 1M e mantendo a aceitação do MTP onde o vLLM cai para zero.
27B em 16 GB. Quantização híbrida combinada com as configurações de kvarn cache permite que o Qwen3.8-27B rode com contexto de 100K a 50 tok/s em uma RTX 4070 Ti SUPER de 16 GB, usando decodificação especulativa MTP e KV cache de precisão na cauda.
FreeToken, engine para MoE. Pesquisadores da UC Berkeley e do MIT apresentaram o FreeToken, um engine open-source que co-agenda dinamicamente as transferências de especialistas MoE para que modelos esparsos de ponta possam decodificar em GPUs de consumo sem travar em misses de PCIe/RAM.
Benchmarks e avaliações
Terminal Bench 4.0. O Terminal Bench 4.0 foi lançado com leaderboard atualizado e foco em iteração rápida para combater a saturação; o GLM-5.3 pontua no nível do Fable 5 dentro da margem de erro.
Transparência em benchmark financeiro. O benchmark card do Ling-3.0-flash-Fin mostra o quanto o scaffolding de agentes, as ferramentas e os pipelines de avaliação moldam os resultados divulgados; muitas execuções usaram ReAct com busca na web e Python, e alguns conjuntos de eval são internos ou ainda não públicos.
Pesquisa e infraestrutura para agentes
Memória WikiSkill do Google. O WikiSkill do Google Research dá aos agentes uma base de conhecimento persistente, no estilo wiki, de falhas e sucessos passados, empacotando Agent Skills reutilizáveis que orientam o comportamento sem alterar os pesos do modelo.
Padrão de hardware para modelos da Anthropic. A Anthropic está desenvolvendo o MHS, uma interface unificada para agentes controlarem dispositivos físicos como microscópios e braços robóticos; os primeiros testes reduziram a integração multi-máquina de semanas para horas, mas a supervisão humana continua necessária.
Camada de dados para agentes. Uma apresentação da TOTVS argumenta que sistemas transacionais e data lakes não são otimizados para o raciocínio de agentes, que consome muitos tokens e é sensível à latência, e descreve a evolução do acesso a dados em direção a MCP e modelos semânticos.
Big Video Dataset da LAION. A LAION lançou o BVD, um dataset apenas para pesquisa com 10 milhões de horas de vídeo, 55 milhões de clipes e 300 milhões de imagens estáticas, que vincula vídeo, áudio e texto; modelos treinados nele superaram as baselines do InternVid em até 2,1 pontos em alguns benchmarks.
Indústria e negócios
Sony e Warner processam a Anthropic. A Sony Music Publishing, a Warner Chappell e outras editoras processaram a Anthropic, alegando torrenting e scraping de obras protegidas por direitos autorais para treinar o Claude, e pedindo indenizações de até US$ 150.000 por obra. A Anthropic diz que vai se defender.
OpenAI corta o Cursor. A OpenAI está encerrando o contrato com a Cursor após a aquisição pela SpaceX, citando o histórico das empresas de Elon Musk de quebrar contratos. A Anthropic respondeu posicionando-se como a parceira mais confiável e prometeu continuidade de computação para o uso do Claude na Cursor.
Nvidia além das GPUs. A narrativa de resultados da Nvidia está mudando da participação em GPUs para a orquestração de datacenter e os sistemas em torno da GPU, onde a empresa construiu hardware de rede e orquestração de última geração enquanto a computação de IA escala para gigawatts.
Isso é tudo por hoje - cerca de 5 minutos de leitura.