Modelos locais e workloads de agentes
Qwen3.8 27B local. Testes da comunidade mostram que o Qwen3.8 27B é superior ao Qwen3.6 em seguir instruções e em tarefas de contexto longo; uma única RTX 5090 executa uma versão NVFP4 com contexto de 262K a 77 tok/s para entradas curtas e 65 tok/s a 128K.
Decodificação especulativa. DFlash 2 com um drafter de n-gramas entregou 2,26x em prompts do LiveCodeBench para o Qwen3.8 27B e até 4,68x em sessões longas de codificação; uma cabeça MTP fixa no Ornith 35B reduziu o tempo de execução em um terço.
Gerenciamento recursivo de contexto. Desenvolvedores estão combinando um agente principal rápido de 64K com subagentes recursivos e pequenos modelos de compressão para lidar com tarefas muito mais longas sem pagar por contexto de 300K.
Gemma ajustada para tool calling. Um fine-tune do Gemma 4 12B para tool calling e uso de CLI melhorou o uso de ferramentas em 2,7x e aumentou as tentativas de chamada de ferramentas em 15,7%, visando configurações com 16GB de VRAM.
Cluster DGX Spark. Um cluster DGX Spark de 36 nós é usado como um cluster de capacidades para agentes, dividindo os nós entre modelos SOTA, rerank/embeddings e tarefas de vídeo, imagem e áudio simultaneamente.
Ferramentas e frameworks
llama.cpp 0.2.0. llama.cpp 0.2.0 foi lançado com binários pré-compilados e as últimas mudanças upstream para inferência local.
Cloudflare Kitesurf. Kitesurf é um motor de navegador para agentes construído sobre Workers WebAssembly/Rust com DOM isolado por página; ele suporta CDP, permitindo que Playwright e Puppeteer o controlem com menor sobrecarga do que um Chromium completo.
llm 0.33. O llm 0.33 de Simon Willison adiciona chaves de API por chamada para modelos de embedding, templates repetíveis para combinar configurações de modelo e prompts, e opções reasoning_summary para modelos de raciocínio.
Prática com agentes de código. Simon Willison argumenta que a habilidade-chave para agentes de codificação é instruir e verificar mudanças com confiança; Linus Torvalds descreve uma IA que fez trabalho braçal em uma sessão difícil de debug, mas precisou ser empurrada depois de afirmar repetidamente que o problema era insolúvel.
Pesquisa e métodos
Skills como playbook. Em 8.135 execuções de teste, as skills dos agentes ajudaram principalmente ao fornecer processos confiáveis, não fatos; o grounding procedural foi responsável por 65,7% dos ganhos, e as skills falharam quando as tarefas divergiram do processo aprendido.
Modelos de mundo mentais. Uma nova pesquisa adiciona crenças e intenções humanas aos modelos de mundo de IA com o MENTIS; modelar a plausibilidade física, mental e social melhora significativamente a previsão do comportamento humano.
Psicometria de benchmarks de segurança. A análise psicométrica de oito benchmarks de segurança mostra que uma pontuação única esconde trade-offs entre rigor de recusa, veracidade e dano contextual; os modelos podem inflar as pontuações de segurança com bloqueio excessivo.
CoT reversível. Uma proposta de passos de raciocínio aproximadamente reversíveis com verificações de consistência cíclica e uncomputation pode detectar alucinações e reduzir a memória de KV-cache em LLMs de borda.
Simular tudo. Latent Space argumenta que dados sintéticos, rubricas e ambientes estão tornando cada componente do pipeline de ML feito por modelos, aproximando-se da simulação humana com desempenho 10% pior, mas 100x mais barato e 10.000x mais rápido.
Indústria e aplicações
Inherent Faraday. A startup Inherent, fundada por ex-integrantes do DeepMind, diz que seu agente Faraday superou os modelos da Anthropic e da OpenAI em reproduzir de forma independente descobertas científicas publicadas, usando uma fração do tamanho.
Revisões de IA do LinkedIn. O LinkedIn construiu uma plataforma de revisão de código com IA multiagente que baseia o feedback em diffs e convenções do codebase para reduzir alucinações e comentários de baixo sinal.
Netflix GenRec. O sistema de recomendação baseado em modelo de linguagem da Netflix, o GenRec, converte o comportamento do usuário em texto e superou seu motor de features construído à mão em testes A/B offline e online, com muito menos dados.
DoorDash SafeChat. O DoorDash detalhou o SafeChat, um sistema de segurança de marketplace construído em escala, e depois o substituiu por uma arquitetura mais poderosa quando começou a funcionar.
Avatares de IA na educação. O bootcamp Foundry de US$ 699 da Harvard Business School usa avatares de IA da HeyGen para feedback de pitch e reuniões de conselho; os participantes gostam da experiência guiada, embora o instrutor real diga que o texto é um pouco assustador.
Novidades de modelos. A Liquid AI está sondando o interesse em um modelo LFM de 100B, enquanto um modelo misterioso chamado Ox Alpha está atraindo atenção por seu forte desempenho em codificação e em tarefas de agente, com especulações apontando para um derivado da família GLM.
Política, segurança e confiança
OpenAI SB 53. A OpenAI agora diz que a Califórnia deveria alterar o SB 53 para adicionar monitoramento durante o treinamento de modelos de fronteira e uma cibersegurança mais forte, depois de ter se oposto anteriormente ao projeto de lei.
Planos de contenção. Um estudo da Guidelight avaliou cinco laboratórios de fronteira em contenção de modelos rebeldes; a OpenAI obteve a maior pontuação, enquanto Anthropic e Meta ficaram com as menores, e poucos laboratórios publicam planos de resposta demonstrados.
Marca d'água do Claude. A nova marca d'água da Anthropic para as saídas de texto do Claude é explicada em detalhes, abordando como a marca d'água é aplicada e o que ela pode e não pode fazer.
Confiança em modelos fechados. Uma discussão no Reddit r/LocalLLaMA argumenta que a OpenAI está segurando o trabalho escolar e se afastando do empoderamento do usuário, empurrando os profissionais de volta para modelos locais em loops agentic.
Isso é tudo por hoje - cerca de 5 minutos de leitura.