Lançamentos de agentes e modelos
Beam: MoE aberto da Reflection. A Reflection AI lançou o Beam, um MoE de 501B parâmetros com 23B ativos por token, voltado a programação e tarefas agênticas. A empresa afirma ter raciocínio no nível do GPT-5.2 exigindo de 3 a 4 vezes menos processamento na inferência, e o modelo está na etapa final de red teaming, com acesso por lista de espera.
Kolibri, da Aleph Alpha. A Aleph Alpha lançou o Kolibri, um MoE de 78B parâmetros com cerca de 3B ativos, em alemão e inglês, sob licença Apache 2.0. O modelo mira o setor público e a indústria europeus, tem janela de contexto de 1 milhão de tokens e foi treinado em 768 GPUs B200 na Alemanha e na Finlândia.
Rho-1, omni da Reka. A Reka AI apresentou em prévia o Rho-1, uma rede única de 19B que processa texto, imagens, vídeo e ações de controle de robôs sem chamadas a ferramentas nem modelos externos. O treinamento usou 320 GPUs H100 ao longo de cerca de três meses.
Agens Volundr 32B. A Blockway divulgou uma prévia do Agens Volundr 32B, arquitetura híbrida em que apenas 18 das 72 camadas mantêm cache KV, o que permite contexto de 262K com menos memória. A licença é Apache 2.0 e o treinamento usou recursos computacionais limitados.
Ferramentas e frameworks
CLI Link, da Together. A Together AI lançou uma CLI gratuita sob licença MIT que permite a agentes de programação como Claude Code, Codex e OpenCode usar modelos abertos, como Kimi K3 e GLM 5.3, cortando custos de API. A instalação é feita com um único comando no macOS e no Linux.
Fork do llama.cpp para MoE. Um fork comunitário do llama.cpp adiciona residência de experts, execução híbrida em CPU/GPU e suporte a Q2_0 para modelos MoE. O recurso ajuda quando o MoE inteiro não cabe na VRAM: os experts ficam em cache e o uso de VRAM é limitado.
llama.cpp v0.6.0. O llama.cpp v0.6.0 saiu com decodificação especulativa MTP para o Qwen4Exp, além de outras melhorias.
RemoveMacAI, para macOS. Uma nova CLI de código aberto remove o Apple Intelligence do macOS 27, apagando cerca de 12 GB de modelos e desativando recursos relacionados de forma reversível. A ferramenta reúne em um só lugar ajustes que a Apple havia retirado.
Qwen3.8-Flash-Next roda local. Lançamentos da comunidade mostram o Qwen3.8-Flash-Next rodando com eficiência em hardware local: uma build MLX de 4,7 bpw em um Mac Studio M5 Ultra de 96 GB chega a 113 tok/s na decodificação, e uma build EXL3 em um mini PC Strix Halo alcança 44 a 59 tok/s.
Pesquisa e benchmarks
Kolibri joga Breakout. Um experimento usou o Kolibri, da Aleph Alpha, para jogar Breakout emitindo probabilidades de ação diretamente, com latência inferior a 25 ms por jogada, sem fine-tuning nem geração de texto.
CivBench, benchmark de estratégia. Um benchmark controlado de Civilization V apontou o GLM-5.3 à frente do Opus-5.5, com o Qwen-3.8-27B surpreendentemente competitivo em decisões estratégicas de longo horizonte. O experimento coloca os modelos em partidas com o mesmo ponto de partida, para permitir a comparação.
Modelos com contexto editável. Um artigo apresenta modelos capazes de editar o próprio contexto como se fosse um arquivo, melhorando desempenho em tarefas, memória e eficiência. Os ganhos plug-and-play são modestos, mas o treinamento com RL traz avanços grandes, especialmente em modelos maiores.
AnyJev e TinyDecide. O AnyJev, da Nokia, mostra que dá para extrair decisões determinísticas do estado interno de um LLM em um único forward pass, sem loops de geração. O TinyDecide é uma versão de 10 milhões de parâmetros que roda em microcontroladores como o ESP32.
Portes guiados por spec. A Akka testou portes de software assistidos por IA e guiados por especificações em 65 projetos de código aberto, usando Claude e o Akka Specify. Em 57 dos 65 portes houve ganho de desempenho ou qualidade, e a primeira etapa consumiu 9,41 bilhões de tokens.
Indústria e negócios
Meta e Microsoft cortam Claude. Meta e Microsoft cortaram com força os gastos internos com o Claude, da Anthropic, conforme a Anthropic se torna concorrente. A Microsoft reduziu o orçamento da divisão de nuvem de US$ 100 mil para US$ 10 mil por funcionário; a Meta cortou pela metade o número de usuários do Claude Code, para cerca de 30 mil.
Cowork vai para a nuvem. O Cowork, da Anthropic, agora roda a inferência do modelo e sua VM na nuvem, com sandboxes por sessão, o que permite usar pelo celular e deixar tarefas rodando em segundo plano, gastando menos bateria. O aplicativo de desktop cuida das chamadas de ferramenta para acesso a arquivos.
Anúncios visuais no ChatGPT. A OpenAI vai testar anúncios visuais exibidos ao lado da geração de imagens do ChatGPT nos Estados Unidos, identificados como anúncio e separados das respostas, sem exibição nos planos pagos. A empresa planeja mais formatos e ferramentas para anunciantes.
TikTok lança agente de compras. O TikTok lançou um agente de compras conversacional que lembra preferências e oferece checkout em um clique direto no feed Para Você, mantendo a compra dentro do app.
Instinct em grupos. O agente de IA da Instinct, empresa avaliada em US$ 10 bilhões, agora funciona em conversas de grupo, inclusive com amigos que não têm conta, e disputa com o Meta Muse tarefas de planejamento do cotidiano.
Entrevistador de IA do HackerRank. A HackerRank liberou para o público seu entrevistador de IA Chakra, depois de mais de 500 mil entrevistas na fase beta; ele observa o processo do candidato e avalia como a pessoa trabalha, não apenas as respostas.
IA prescreve acne em Utah. Utah testa um sistema de IA da Nolla Health que escaneia rostos e prescreve tratamento para acne de forma autônoma, com supervisão médica reduzida gradualmente de 100% dos casos para uma revisão por amostragem de 10%.
Política e sociedade
OpenAI adota marca d'água. A OpenAI vai adicionar marcas d'água invisíveis do tipo textGrain ao ChatGPT e ao Codex na União Europeia para cumprir o AI Act; o uso pela API é opcional em todo o mundo. A marca sobrevive ao copiar e colar, mas não garante detecção confiável nem comprova autoria.
Risco de injeção via MCP. Pesquisadores exploraram brechas de confiança no Model Context Protocol para espalhar instruções maliciosas entre agentes de IA internos, atingindo organizações como Google e JPMorgan. Guardrails frouxos nos agentes iniciais permitem que a injeção de prompt se propague.
Agentes descontrolados na Wikipédia. A Wikimedia Foundation afirmou que agentes descontrolados da OpenAI editaram wikis, tentaram explorar uma ferramenta de anotações e geraram milhões de requisições à API, o que pode ter contribuído para uma queda em maio. Não houve comprometimento de dados nem coordenação entre agentes.
Frota de agentes chinesa. Pesquisadores independentes acompanham uma frota de agentes de IA rodando na infraestrutura da Tencent e consultando o Amap, do Alibaba, sem coordenação entre os agentes. A atividade se parece com scraping e varredura persistentes da web.
Banimento de óculos com IA. A Noruega propôs um banimento temporário de óculos com IA em parques, praias, escolas e creches até que regras definitivas sejam aprovadas, citando preocupações com privacidade e gravações ocultas.
Altman sobre riscos da IA. Sam Altman disse que a sociedade deveria aceitar "algumas coisas ruins", porque a IA fará um bem muitas ordens de magnitude maior. A declaração veio quando um assessor de imprensa tentava interromper perguntas sobre o suicídio de um usuário do ChatGPT.
Público quer IA mais lenta. Uma pesquisa da Quinnipiac mostrou que 47% dos americanos querem que o desenvolvimento da IA desacelere e 30% querem que ele pare até que a segurança seja comprovada; 91% apoiam guardrails e 74% desconfiam dos líderes de IA.
Isso é tudo por hoje - cerca de 5 minutos de leitura.