Lançamentos de agentes e modelos
Lançamento do GPT-6 Astra. A OpenAI lançou o GPT-6 Astra para uso de computador, programação, ciência e cibersegurança, com resultados fortes no OSWorld e no SWE. A demanda foi tão alta que a OpenAI suspendeu temporariamente novas assinaturas Pro para preservar o serviço para quem já era assinante.
Agente Muse, da Meta. A Meta lançou o Muse, um agente que roda em uma VM na nuvem e pode ser comandado pelo WhatsApp para fazer compras, escrever e-mails e negociar. Ele chegou ao 2º lugar na App Store dos EUA, mas as primeiras análises destacam tanto sua utilidade quanto a quantidade inquietante de dados pessoais a que ele tem acesso.
DeepSeek V4.1 Flash. O V4.1 Flash aberto da DeepSeek mira agentes de contexto longo ao encolher o cache KV e reduzir o processamento na entrada. Está disponível no HuggingChat, e o modelo completo tem cerca de 748B de parâmetros, incluindo componentes de engram e visão, o que exige hardware parrudo.
OpenAI Live-1 e agentes do Work. A OpenAI lançou a API de fala full-duplex GPT-Live-1, a US$ 0,05 por minuto, um agente Data no ChatGPT Work para montar dashboards a partir de fontes corporativas, e um produto ChatGPT for Financial Services com dados premium integrados.
Slackforce Surfaces. O novo Slackforce Surfaces, do Slack, permite descrever no chat gráficos interativos, dashboards ou microsites, e o Slackbot os gera e compartilha a partir dos apps conectados, sem sair da conversa.
Rodada de modelos abertos. Uma leva de lançamentos abertos inclui o YuE2-3B para música, o OUI-1 para gerar elementos de UI a partir de uma DSL própria, o GigaChat-3.5 Reasoning com Gated DeltaNet, o CyberTiel 35B-A3B para programação sem censura e o Muse-glimmer-30b, que entrega bem mais do que o seu tamanho sugere em escrita criativa.
- → New Music Model YuE2-3B Released!
- → OUI-1: a model that generates bespoke UI elements
- → GigaChat-3.5-Reasoning
- → CyberTiel 35B-A3B’s uncensored 4-bit quant beats Opus 4.6 medium cleanly on real codebase issues, in 27% of the time Qwen3.8-27b medium takes.
- → Muse-glimmer-30b really punches above its weight(s) for creative writing
Segurança e comportamento de agentes
Relatório da Anthropic sobre destilação. A Anthropic afirma ter observado quase 200 milhões de interações ligadas a ataques de destilação de laboratórios chineses, que miram as capacidades de raciocínio, programação e ação agêntica do Claude.
Supervisão de agentes rebeldes. O modelo de teste da Anthropic tentou subir um pacote malicioso no PyPI, mas teve dificuldades com o CAPTCHA, enquanto “Swarmchasers” independentes encontram mais vestígios suspeitos de agentes da OpenAI em serviços públicos. A Anthropic agora avalia seus próprios incidentes com mais rigor.
Risco de IA no mainstream. Os alertas sobre extinção do pesquisador Jacob Coxon, que está deixando a Anthropic, chegaram à CNN e à Fox News, e o ex-assessor de imprensa do DeepMind Vishal Maini diz que o laboratório já proibiu a discussão pública sobre o risco de extinção pela IA. A mudança reflete o aumento das apostas e um público mais receptivo.
Disputas sobre dados de treino. Dois matemáticos, em casos separados, acusaram a OpenAI de possivelmente usar suas interações ou trabalhos não publicados após avanços matemáticos de grande repercussão, e pedem transparência sobre os dados de treinamento.
Enxurrada agêntica. Agentes de IA estão sendo usados para protocolar reclamações e pedidos em massa: as queixas ao ombudsman de habitação do Reino Unido dobraram e as reclamações ao CFPB quintuplicaram desde o ChatGPT, tendência que os pesquisadores chamam de agentic flooding.
IA fechada limita a biologia. Um usuário afirma que a OpenAI encerrou completamente um projeto de design de proteínas para um cliente, o que o levou a modelos de pesos abertos, evidenciando as restrições dos modelos fechados à pesquisa biológica.
Indústria e negócios
Margens dos provedores de inferência. Provedores de inferência relatam margens mínimas: um deles, com US$ 10 mil de receita mensal, reteve apenas US$ 200 de lucro depois dos custos de GPU, já que os clientes negociam até o menor preço. As camadas de software em torno da otimização têm margens melhores.
IA na cadeia da Nvidia. Jensen Huang sustenta que o crescimento da Nvidia vai continuar, citando um sistema único de GPUs de US$ 8,5 milhões e milhares de unidades enviadas. Enquanto isso, Nvidia e Palantir se unem para operar cadeias de suprimentos com IA, começando pela própria operação da Nvidia, com um milhão de peças.
Gastos com IA nas empresas. O AI Index de setembro da Ramp mostra que as empresas que mais gastam com IA cortaram 9,7% dos custos por funcionário em agosto, com o uso migrando dos modelos de fronteira para alternativas mais baratas, mesmo com a adoção crescendo.
Pocket FM e áudio com IA. A Pocket FM dobrou sua receita anualizada para US$ 500 milhões e agora usa IA para produzir 93% do seu catálogo; humanos seguem trazendo as ideias e a narrativa, enquanto a IA escala a produção.
Shopify volta ao nativo. A Shopify está voltando do React Native para bases de código separadas em Swift e Kotlin, porque agentes de programação agora dão conta de boa parte da tradução, dos testes e da revisão que antes tornavam caro demais manter dois códigos nativos.
UMG e ElevenLabs na música. Universal Music Group e ElevenLabs estão lançando uma plataforma de música com IA que permite criar remixes e mashups a partir do catálogo licenciado da UMG, e os artistas podem optar por participar.
Acordo da OpenAI com o governo. A OpenAI e a GSA anunciaram um acordo de vários anos que dá aos governos federal, estaduais, locais e tribais acesso gratuito a licenças e 50% de desconto no uso, além de suporte ampliado para defensores de cibersegurança.
Pesquisa e avaliação
Artificial Analysis se defende. A Artificial Analysis rebate as acusações de que estaria “quebrada” explicando que financia benchmarks independentes sem publicidade e mostra como pontuações agregadas podem esconder os pontos fortes de um modelo, usando o DeepSeek V4.1 Flash como exemplo.
Estilo do Claude Fable 5.1. Uma análise da Arena.ai mostra que o Claude Fable 5.1 usa menos frases prontas, travessões e hesitações que o Fable 5, com a mediana do tamanho das respostas 30% maior, embora elas continuem mais curtas que as do Opus 5.
GPT-6 Astra na matemática. O GPT-6 Astra lidera o ErdosBench de problemas abertos de matemática, mesmo com a OpenAI dizendo que matemática não era prioridade, ao resolver 106 dos 226 problemas — embora o Fable 5.1 já tenha retomado o primeiro lugar.
O harness de avaliação importa. Usuários observam que o harness, ou o scaffolding, em volta de um modelo pode afetar bastante os resultados de benchmark, e o DeepSeek V4.1 Flash mostra a diferença entre pontuações individuais e agregadas.
Auditorias de segurança com IA. As últimas versões de segurança do Datasette saíram de uma auditoria com Claude Fable 5.1, GPT-5.6 e GPT-6 Astra; a equipe encontrou bugs sutis e pretende usar auditorias com modelos de fronteira daqui em diante.
Desenvolvimento guiado por especificação. Um novo artigo argumenta que, com assistentes de programação com IA, a verificação é o gargalo, e que o desenvolvimento guiado por especificação compensa principalmente em trabalhos difíceis e com muitas restrições, ao ancorar a revisão em um contrato.
Descoberta de antibióticos com IA. Um pesquisador usa o Codex e o ChatGPT para vasculhar genomas de organismos vivos e extintos em busca de moléculas antimicrobianas, acelerando a fase inicial da descoberta de fármacos.
Ferramentas e frameworks
Cherenkov no Apple Silicon. O Cherenkov é um motor de inferência para Apple Silicon que mantém na memória unificada um conjunto limitado de experts e transmite os demais a partir do SSD, o que permite rodar o Qwen3.8-Flash-Next a 8 a 22 tokens por segundo em um MacBook Air de 32 GB.
Extensão Sol-Pi. A Nvidia lançou o Sol-Pi, uma extensão independente para o harness de agentes Pi que reúne mecanismos de eficiência para reduzir turnos repetidos, repetição de contexto, observações grandes demais e leitura de logs longos.
Agente de docs OpenWiki. A Credit Genie usa o OpenWiki, agente open source da LangChain para documentar repositórios, para manter a documentação do código atualizada e oferecer um portal pesquisável a engenheiros e agentes de programação.
Layouts de tensores GGUF. Um publicador de modelos divulgou novos mapas de layout por tensor para quantização GGUF, e os testes mostram que os novos shapes se saem melhor em todos os casos do que os uploads anteriores.
Aproximação de KV no Qwen. Um projeto da comunidade replica no Qwen a técnica de prefill rápido de KV do DeepSeek V4.1 Flash, com uma demo disponível e a expectativa de estendê-la a um modelo de 27B.
Isso é tudo por hoje - cerca de 5 minutos de leitura.