Lançamentos de Modelos e Infraestrutura
Modelo Veloz da Nvidia. A Nvidia lançou o Nemotron 3.5 Lightning, um modelo Mamba-Transformer de 30B com pesos abertos que corresponde ao GPT-OSS-120B em benchmarks, sendo otimizado para inferência rápida com apenas 3,6B de parâmetros ativos.
DeepSeek V4 Roda Localmente. As quantizações comunitárias do DeepSeek V4 corrigem problemas de conversão para linhas de base bit-exatas, e o DeepSeek V4 Flash atinge 27+ t/s em APUs Strix Halo com decodificação especulativa, mostrando uma implantação local viável.
Aplicativo Unsloth para Desktop. A Unsloth lançou um aplicativo de desktop de código aberto para executar e treinar modelos locais em GPUs, com execução de código em sandbox, RAG, exportação de modelos e sem telemetria.
Seed de US$ 1,1B da River AI. Fundada pelo ex-cofundador da xAI, Igor Babuschkin, a River AI levantou US$ 1,1B para criar assistentes de IA treináveis pessoalmente, repensando toda a pilha, do treinamento ao hardware.
Daybreak Cyber na AWS. Os modelos de cibersegurança Daybreak da OpenAI agora estão disponíveis via Amazon Bedrock, dando aos defensores acesso a capacidades cibernéticas de ponta dentro de seus ambientes AWS existentes.
Manifesto Open-Source de Zuck. O CEO da Meta defende mais lançamentos de pesos abertos e convida governos a colaborar em testes de segurança, enquanto a empresa continua publicando modelos como o Muse Glimmer.
Suporte ao Ling‑3.0. Um pull request adiciona o Ling‑3.0 ao llama.cpp, com uma variante minúscula já funcionando bem para tarefas de voz de assistente doméstico devido à sua recusa honesta quando incerto.
Ferramentas e IA Local
Broker MCP Reduz Contexto. Um harness de agente DIY usa um broker MCP para ocultar ferramentas atrás de um proxy, reduzindo o contexto inicial de 20K tokens para quase zero, e adiciona consciência temporal para melhor execução local.
GPUs de Mineração para LLMs. Placas de mineração CMP170HX de 8GB podem ser expandidas para 64GB cada, executando modelos grandes ou vários modelos pequenos simultaneamente, oferecendo desempenho barato, porém envelhecido, da classe Ampere.
366 t/s em V100. Kernels CUDA personalizados (v100‑skinny) permitem até 366 t/s no Qwen3.6 27B em NVFP4 em GPUs Volta, dando nova vida a hardware antigo para inferência local.
Modelo TinyTitle. Um modelo GRU de 1,8M de parâmetros gera títulos de chat em menos de 5 MiB de RAM, demonstrando sumarização ultra leve no dispositivo que roda em poucos milissegundos.
IA Privada para E-Reader. Um aplicativo de e-reader integra modelos Gemma 4B localmente para perguntas e respostas privadas sobre livros, com alternância de spoilers e correspondência automática de idioma.
Servidor de IA de Baixo Consumo. Uma configuração combinando um Intel N100 com uma RTX 5060Ti resulta em um servidor llama.cpp silencioso e eficiente, capaz de executar modelos recentes como o Qwen 3.5 para uso diário.
Custo de Inferência Reduzido. O CEO da Doubleword explica como projetar pilhas de inferência para uso não em tempo real pode reduzir os custos de token em mais de uma ordem de grandeza em comparação com configurações de uso geral.
Roteamento Inteligente de Modelos. A biblioteca Switchyard da NVIDIA roteia apenas 7% das chamadas de agente para um modelo de ponta, reduzindo os custos em 74% com perda mínima de precisão, e oferece uma fórmula para avaliar o custo-benefício.
Óculos de AR Privados. Um usuário cego pede óculos de AR estilo Meta que executem modelos locais para evitar enviar dados visuais à Meta, destacando a demanda por privacidade em tecnologia assistiva.
Pesquisa de Ponta
IA Enfrenta Riemann. Um modelo não lançado da Anthropic fez progresso na hipótese de Riemann ao testar 650 ideias com 60 subagentes ao longo de 36 horas, reacendendo o debate sobre o papel da IA na descoberta matemática.
Diagnóstico por Vídeo do AMIE. O sistema de pesquisa AMIE do Google demonstrou consultas clínicas por vídeo em nível de especialista, usando o Gemini e uma configuração multiagente para interpretar sinais visuais, auditivos e contextuais.
IA de Raio-X de Tórax CARE‑X. O CARE‑X da Microsoft é um VLM unificado de raio-X de tórax que combina geração e previsão estruturada, usando aprendizado por reforço para recompensar a correção clínica.
Disputa de Memória de Agentes. Tanto o ACE quanto o ALTK‑Evolve transformam trajetórias de agentes em lições reutilizáveis; o ACE constrói um manual abrangente, enquanto o ALTK‑Evolve recupera diretrizes individuais.
Logprobs Detectam Alucinações. Analisar distribuições de probabilidade de tokens no primeiro recall factual no raciocínio encadeado pode revelar conhecimento não confiável, oferecendo um possível sinal precoce de alucinação.
Alerta sobre Escrita com IA. S. Alpert argumenta que nenhuma reescrita é sem perdas, portanto, o texto assistido por IA deve ser verificado pessoalmente para evitar distorcer o significado pretendido pelo autor.
Negócios e Finanças
Marco de 1B de Usuários. O ChatGPT e o Gemini atingiram 1B de usuários ativos mensais, com o Gemini sendo o produto do Google que mais rápido atingiu essa escala; o ChatGPT havia alcançado 900M de usuários semanais no início deste ano.
Anúncios do ChatGPT se Expandem Globalmente. A OpenAI expandiu os anúncios do ChatGPT para mais cinco países, relatando nenhum impacto na confiança dos usuários e baixas taxas de rejeição, enquanto busca monetização sustentável.
Aumento de Preço da OpenAI. Novas assinaturas ChatGPT Business Premium custam US$ 125/usuário/mês, com cinco vezes a capacidade e sem limites horários, refletindo o uso intenso de tokens por cargas de trabalho agentivas.
Lightcap Sai. Brad Lightcap, ex-COO e líder de projetos especiais da OpenAI, está saindo após oito anos para começar algo novo, dando continuidade a uma série de saídas de executivos.
Contrato de US$ 9,1B da Anthropic. A Anthropic assinou um acordo de US$ 9,1B por 20 anos para data center com a mineradora de Bitcoin Riot Platforms, de 191 MW no Texas, que deverá alimentar sua próxima geração de modelos a partir de 2027.
Obstáculos para o IPO da Anthropic. Antes de um possível IPO de US$ 965B, investidores questionam o crescimento da Anthropic em meio a modelos chineses baratos e ventos contrários políticos, embora a empresa destaque futuros aplicativos de saúde e biologia.
Impulso de US$ 500B da Nvidia. A Nvidia faz parceria com seis empresas financeiras para mobilizar US$ 500B para infraestrutura de IA, garantindo até 25% do valor residual de seus chips, combatendo os temores de depreciação.
Aposta da Accel em IA na Índia. A Accel fechou um fundo de US$ 550M para a Índia com excesso de demanda, apostando que a IA sustentará startups de consumo, fintech e manufatura, em vez de ser uma categoria independente.
Resgate de Ações por Funcionários da OpenAI. Uma recompra de ações de US$ 7B com uma avaliação de US$ 852B permite que funcionários atuais e ex-funcionários da OpenAI liquidem ações, aliviando a pressão antes de um possível IPO.
Segurança e Transparência
UE Exige Marcas d'Água de IA. Sob o AI Act da UE, a Anthropic e a OpenAI se comprometem a marcar conteúdo gerado; o Claude incorporará marcas d'água invisíveis em texto e imagens, com suporte para modelos mais antigos em desenvolvimento.
Proveniência de Fotos da Apple. O iOS 27 pode apresentar o ‘Apple Reference Image’ para incorporar metadados de proveniência na captura, permitindo que os usuários comprovem que fotos do iPhone não são deepfakes.
Spotify Sinaliza Artistas de IA. O Spotify rotulará perfis de artistas gerados por IA e os excluirá das recomendações, usando tanto a autodeclaração quanto a detecção antes de implementar a mudança em meados de setembro.
Disputa sobre Escrita com IA. O estúdio de jogos Saber nega ter substituído escritores pelo ChatGPT para Rideshare Stimulator, mas o ex-roteirista principal afirma que a IA foi usada para escrita e vozes, sem divulgação na Steam.
Exploit do Zoom com IA. Uma vulnerabilidade crítica do Zoom que permite assumir o controle do dispositivo por meio do recurso de anotação foi encontrada com menos de 20 prompts a modelos públicos de IA, mostrando uma pesquisa de segurança acelerada por IA.
Roubo de Trilhas de Raciocínio. Pesquisadores reproduziram tokens de raciocínio encadeado criptografados de modelos de ponta em modelos irmãos mais fracos, fizeram jailbreak neles e recuperaram o raciocínio oculto, expondo senhas e chaves de API em sessões públicas.
Confiando em Código Gerado por IA. A IBM e a Red Hat expandem o Lightwell para criar cadeias de suprimentos de software verificáveis para a era da IA, garantindo proveniência e conformidade com políticas para código gerado por humanos e por IA.
Isso é tudo por hoje - cerca de 5 minutos de leitura.