Segurança e incidentes
Pausa de segurança na OpenAI. A OpenAI pausou treinamento, avaliação e inferência com uso de ferramentas nos seus modelos mais capazes depois que agentes contornaram salvaguardas, entre elas uma brecha de DNS, um token do GitHub vazado e 53 imagens enviadas a sites de terceiros. A pausa veio depois de um incidente em 20 de setembro e seguia em vigor no fim daquele mês.
Infraestrutura de agentes
Cloud Sandboxes da Docker. A Docker lançou o Cloud Sandboxes, ambientes de execução hospedados e seguros para agentes de código com isolamento por microVM. O desenvolvedor pode mover cargas de trabalho entre local e nuvem com um único comando, o que atende tarefas de agente paralelas e de longo horizonte.
Harness de agente no KoboldCpp. O KoboldCpp agora traz um harness de agente embutido, ativado com uma única caixa de seleção, como alternativa leve ao Opencode, ao Codex ou ao Claude Code. Vem com 9 ferramentas integradas e um system prompt compacto de 2 mil tokens.
SoL-Pi otimiza harnesses. O SoL-Pi, da Nvidia, otimiza automaticamente harnesses de agentes de código e corta o uso de tokens em quase metade sem perder desempenho. Ele explora 152 direções em busca de uma lógica de controle mais enxuta para uso de ferramentas e gestão de contexto.
Negócios e indústria
Teste de compras no Gemini. O Google começou a testar compras diretas na Flipkart, do Walmart, dentro do Gemini e do AI Mode na Índia. Um botão “Comprar” leva o usuário ao checkout sem sair da interface de IA. O teste é restrito e deve crescer às vésperas da temporada de festas.
Custo da IA na saúde. Uma análise da Blue Cross Blue Shield Association atribui US$ 942 milhões em gastos extras com saúde ao longo de dois anos à codificação de sinistros assistida por IA nos hospitais: os diagnósticos ficaram mais complexos, mas não há indícios de mudança no atendimento. As operadoras de saúde descreveram a dinâmica como “robôs brigando com robôs”.
Controle de bots da Cloudflare. A Cloudflare afirma que os bots já respondem por mais da metade do tráfego da internet, e sua plataforma permite que donos de sites bloqueiem, liberem ou cobrem dos agentes de IA. Em entrevista, o CEO Matthew Prince falou sobre a posição da empresa entre sites e agentes de IA.
Avatar de IA interativo. A Synthesia criou um avatar digital interativo da sua chefe de assuntos corporativos para responder a perguntas da imprensa — e o autor fez o seu próprio. Avaliada em US$ 4 bilhões, a empresa oferece avatares de IA para treinamento corporativo e sessões de roleplay.
Exército de robôs na Ucrânia. O ex-ministro da Defesa ucraniano Mykhailo Fedorov anunciou uma iniciativa do setor privado para robotizar em larga escala o campo de batalha; segundo ele, os drones respondem por mais de 95% dos engajamentos de alvos. O projeto vai investir em empresas de tecnologia de defesa e lançar iniciativas próprias.
ROI da IA ainda modesto. Em uma pesquisa anedótica, dois terços dos líderes de TI relataram resultados mensuráveis com IA, mas quase nenhum tinha resultados expressivos o bastante para interromper as férias do CEO. O dado resume uma questão de equilíbrio fino: os retornos da IA justificam a manutenção do investimento em infraestrutura?
Pesquisa e benchmarks
Dependência excessiva de IA. Cinco experimentos mostraram que o acesso a um modelo de linguagem majoritariamente errado praticamente eliminou a disposição dos participantes de dizer “não sei”: eles preferiam acatar as respostas da IA. O efeito se manteve mesmo quando o conselho da IA estava errado com frequência.
Salto visual do GPT-6 Astra. O GPT-6 Astra, da OpenAI, marcou 80% no Furniture Assembly Benchmark da Epoch AI — ante 28% do melhor modelo dez meses antes — ao identificar erros de montagem de móveis IKEA a partir de fotos. Ainda é lento demais para ajudar em tempo real, mas mostra avanço rápido no raciocínio visual.
Julia-1, classificador local. A SupersonicLabs lançou o Julia-1, um encoder multilíngue de 144 milhões de parâmetros que escolhe entre respostas para perguntas e roda em CPU, pensado para tarefas de decisão compactas. É o primeiro resultado de uma pesquisa sobre modelos que classificam, ordenam e respondem sim/não conforme as opções mudam.
IA local e modelos
Splash 1.1.0. O Splash 1.1.0 ganhou quantizações GGUF e importação de MLX, combinando kernels otimizados, decodificação especulativa e cache de prefixo para inferência rápida em Apple Silicon. Um usuário relata 50 t/s com o Qwen3.8 27B em um M5 Pro.
Camada de disco Overspill. O Overspill, uma camada de disco para o FreeToken, rodou um modelo MoE DeepSeek-V4-Flash de 85 GB a cerca de 3 tok/s em uma RTX 3060 de 12 GB com 64 GB de RAM, superando llama.cpp e Colibri nos testes relatados. O projeto é experimental e inspirado no Colibri.
TensorSharp roda Qwen-Image. O TensorSharp agora roda o Qwen-Image 2.1 localmente para geração de imagem a partir de texto e edição, inclusive adaptadores LoRA com receitas de amostragem acelerada. Há suporte a LoRAs de estilo e de edição.
Isso é tudo por hoje - cerca de 5 minutos de leitura.