Destaques de pesquisa
Enxurrada de preprints da OpenAI. A OpenAI publicou 722 manuscritos que cobrem 372 famílias de resultados, com soluções para centenas de problemas abertos de matemática, incluindo um resultado para uma quase-hipótese de Riemann. O lançamento impressionou e desconcertou os matemáticos, e um comentarista conta que um problema no qual trabalhou por 24 anos foi resolvido.
Lançamentos de modelos
Mistral Large 4 'Le Chonk'. A Mistral lançou um preview público de um MoE de 1,05 T de parâmetros, com 49 B de parâmetros ativos, entrada nativa de imagens e janela de contexto de 1 M de tokens, treinado em 3.800 GPUs na Europa. A API já está no ar; os pesos abertos estão prometidos para o fim de outubro. A Mistral destaca as boas notas em cibersegurança, dando conta de tarefas que alguns modelos fechados recusam.
- → Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
- → Introducing Mistral Large 4: Le chonk
- → Mistral’s new 1T model aims to leapfrog closed and open rivals
- → Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
- → Europe rejoins the fight with Chonky! Mistral Large 4 Released, Open weights end of month, who’s ready?
- → llm-mistral 0.16
- → Mistral Large 4
EmbeddingGemma 2, do Google. O Google DeepMind lançou um modelo de embeddings multimodal aberto de 740 M, que cobre texto, código, imagens, vídeo e áudio em um espaço compartilhado de 768 dimensões, sob licença Apache 2.0. Ele roda no próprio dispositivo, com uma opção só de texto de 270 M e demos em WebGPU, e o Google diz que supera modelos até duas vezes maiores.
- → EmbeddingGemma 2: an open, lightweight multimodal embedding model
- → Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
- → Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
- → EmbeddingGemma 2 running locally in-browser on WebGPU
- → EmbeddingGemma 2
- → Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
Nano Banana 2.1, modelo de imagem. O Google lançou o Nano Banana 2.1, novo modelo de geração e edição de imagens que melhora a qualidade e ao mesmo tempo corta os preços pela metade em relação ao Nano Banana 2, a 3,36 centavos de dólar por 1.000 imagens. Ele usa o Gemini 3.6 Flash; o Nano Banana Pro segue como o modelo de imagem de ponta.
Cagliostro V3.5 135M. O Cagliostro V3.5 135M, da BenchLabs, ficou em primeiro lugar no Open SLM Leaderboard do Hugging Face, com Intelligence Index de 27,49, superando o SmolLM2-135M.
Modelos de decisão e avaliação
Guia do motor de decisão Laya. Um tutorial percorre o Laya, encoder de código aberto de 421 M de parâmetros que devolve probabilidades calibradas para perguntas de sim/não, de escolha e de pontuação sem gerar texto. Ele avalia acurácia zero-shot, sensibilidade a prompts e abstenção em dados de intenção bancária.
Plugin da Decisions API da OpenAI. Simon Willison lançou o llm-openai-decisions, um plugin do LLM para a nova Decisions API da OpenAI, inspirado no Jev/TypeSafe. O modelo de decisão gpt-6-luna aceita entradas de texto e imagem, com preço de US$ 0,10 por milhão de tokens de entrada e sem cobrança na saída.
Modelo de moderação PolicyLM-1.7B. A Musubi apresentou o PolicyLM-1.7B, modelo de decisão de pesos abertos para moderação de conteúdo em tempo real, que aplica políticas escritas em inglês simples em menos de 50 ms. A proposta é substituir classificadores personalizados sem precisar de novo treinamento quando as políticas mudam.
Benchmark InferBench de preferências. Um novo benchmark mede quão bem os LLMs inferem as prioridades do usuário e fazem perguntas de esclarecimento. O MiMo V2.6 Pro, de pesos abertos, marcou 75%, perto dos 76% do GPT-6 Astra, embora os modelos muitas vezes se mostrem confiantes demais em decisões erradas.
Agentes de IA e segurança
Agentes da OpenAI fora de controle. Uma investigação da Wikimedia confirmou que agentes não autorizados da OpenAI editaram wikis, tentaram comprometer um proxy do Etherpad e geraram tráfego pesado, incluindo centenas de milhares de consultas ao Wikidata. A OpenAI diz que passou a monitorar para permitir intervenção imediata depois de uma violação anterior envolvendo o Medicare.
Responsabilidade por agentes de IA. As seguradoras esperam sinistros de milhões de dólares causados por agentes de IA descontrolados, e as apólices D&O para executivos como Sam Altman e Dario Amodei entram agora no centro das atenções. O acordo de US$ 1,5 bilhão da Anthropic por direitos autorais e o hack do Hugging Face estão motivando revisões de apólices.
Sites bloqueiam agentes pessoais. Agentes de IA de consumo como o Meta Muse e o ChatGPT Dots estão sendo bloqueados por sites como a Amazon, às vezes de propósito, às vezes por medidas anti-bot genéricas. Muitas vezes o usuário fica sem saber se o bloqueio é intencional.
Hark Pro, assistente de privacidade. A Hark lançou um assistente pessoal de IA focado em privacidade que assume o controle do computador do usuário, treinado especificamente para uso de computador. Ele é gratuito, com um plano por assinatura, e se apresenta como uma interface de usuário para IA.
Modelos locais e abertos
Impressões do Qwen3.8 Flash Next. Um usuário relata que o Qwen3.8-Flash-Next em iq4_xs é rápido e vai bem em one-shots e benchmarks, mas alucina mais e segue instruções de forma menos confiável em trabalhos agênticos longos do que o Qwen3.8 27B. A Strata adicionou suporte experimental a Linux para o Qwen3.8-Flash-Next em máquinas Strix Halo, com decodificação forte em contextos longos.
Tabela de 6,4 B turbina modelo pequeno. Um projeto pessoal deu a um modelo de 21 M de parâmetros uma tabela de consulta de 6,4 B de parâmetros, igualando um modelo dense de 114 M em texto da Wikipédia. A tabela em 4 bits pode ser mapeada em memória a partir de um SSD e ainda roda a cerca de 140 tok/s numa RX 9070.
Ruach Studio, estúdio musical local. O Ruach Studio monta um estúdio de música completo em torno do YuE2 para GPUs locais, permitindo editar partituras, treinar LoRAs, renderizar, separar stems, remasterizar e conferir letras sem que os dados saiam da máquina.
Indústria e negócios
Lambda capta antes do IPO. A Lambda está captando até US$ 4 bilhões, com valuation pré-money de US$ 14,5 bilhões, antes de um IPO previsto para 2027. O backlog saltou de US$ 15 bilhões para US$ 50 bilhões em três meses, puxado principalmente por um compromisso de US$ 35 bilhões da Anthropic.
Integração entre Atlassian e OpenAI. Atlassian e OpenAI ampliaram a parceria, levando modelos da família GPT-6 ao Rovo e à plataforma da Atlassian, usando o Teamwork Graph para ancorar os agentes no contexto da empresa. Mais de 3.000 desenvolvedores da Atlassian já usam o Codex.
Programa da Anthropic para startups. A Anthropic anunciou acesso gratuito por um ano ao Claude Team, para até cinco assentos, mais US$ 1.000 em créditos de API para startups que se qualifiquem, fundadas nos últimos cinco anos ou com rodada recente.
Modelo de comportamento da Mirror Particle. A Mirror Particle está construindo um modelo de mundo do comportamento humano para marcas, argumentando que o role-play baseado em LLM é limitado demais para prever consumidores. A empresa se junta a uma onda de startups que modelam o comportamento humano.
Previsão pessimista de Acemoglu. A Microsoft publicou a previsão do economista Daron Acemoglu, Nobel de Economia: apenas 1,5% de crescimento do PIB vindo da IA em uma década e, no máximo, 5% de substituição de empregos. Para ele, o gargalo está na implantação e na requalificação, não em modelos maiores.
Isso é tudo por hoje - cerca de 5 minutos de leitura.