Modelos de fronteira e produtos com agentes
GPT-6 Astra em produção. A Perplexity usa o Astra para redigir comunicados, editar software e monitorar sistemas de produção; a Cognition usa o modelo para testar o trabalho do Devin e receber de volta gravações e relatórios, com o objetivo de reduzir a revisão de código.
Beta da Agents API da OpenAI. A beta pública permite que desenvolvedores criem agentes na nuvem que rodam por horas, executam código e processam arquivos na infraestrutura por trás do Codex e do ChatGPT, com cobrança por token e sem taxas extras.
Modelos abertos e locais
Onda local do Qwen 3.8. Relatos da comunidade dizem que o Qwen 3.8 27B muitas vezes parece mais forte que o Qwen-Next para programar, e quem usa quantização UD pondera a velocidade de 6 bits contra a qualidade de 8 bits; um novo fine-tune, o Humanlike, quer deixar a conversa informal menos parecida com a de um assistente.
- → Qwen3.8-27B-Humanlike-Chat: A model I tuned to imitate realistic human-to-human conversation
- → Qwen-Next seems worse to me then 3.8 27b for coding, but I feel like I must be missing something?
- → Unsloth UD-quants - Qwen 3.8 27b for example - worth using 8-bit or stick with faster 6 bit for coding?
Projetos de fine-tuning local. Um modelo de 2B treinado com a conversa de um grupo de WhatsApp aprende gírias e ritmo, mas não coerência profunda; o fine-tuning do Qwen 3 4B em 100 quebra-cabeças de zebra melhorou o MATH-500 em 31%; o CodeFinetuner oferece um pipeline para ajustar modelos de autocomplete de código no seu próprio código.
- → I fine-tuned a 2B LLM on our WhatsApp group chat, and shared how to do it on GitHub as a cookbook.
- → Fine-tuning Qwen 3 4B Base on 100 zebra puzzles yielded +31% on MATH-500. 6.5-min (Single H100/H200) reproduction notebook included.
- → CodeFinetuner: Fine-tune a local code autocomplete model on your own codebase
Novo modelo ASR Orukeet. O Orukeet, baseado no Parakeet, supera o original em 61 dos 74 splits testados, incluindo o test-other do LibriSpeech e o inglês do FLEURS, com redução relativa de 10,6% no WER agrupado em 25 idiomas.
Ferramentas e frameworks
Beta do PAIR, da NVIDIA. O Personal AI Router, da NVIDIA, distribui requisições de inferência entre vários computadores locais para dar conta de cargas de trabalho multiagente e se integra ao Ollama e ao LM Studio sem exigir mudanças no harness do agente.
Traces de sessão para agentes. A StackGen usa traces aninhados do Langfuse para capturar cada chamada de LLM, execução de ferramenta e delegação a subagentes, e recomenda exportadores em lote assíncronos para que quedas de telemetria não travem os agentes em execução.
Peculiaridades de provedores no OpenRouter. O mesmo endpoint do OpenRouter pode encaminhar para provedores com otimizações diferentes, sem suporte a visão e com tratamento variado do esforço de raciocínio; o provider.only permite fixar um backend específico.
Harnesses de código aberto. Profissionais do setor defendem que harnesses de código aberto são tão importantes quanto modelos abertos para controlar loops de agente, contexto e execução de ferramentas; usuários procuram gateways leves para Discord e motores de conversa por voz para modelos locais.
Segurança de IA e uso indevido
Testemunhas alucinadas por IA. A Suprema Corte do Novo México multou um advogado em US$ 5 mil e o puniu por desacato ao apresentar um parecer com testemunhas e depoimentos policiais fabricados pelo ChatGPT; um dos juízes perguntou se ele costuma assistir ao noticiário.
Semana difícil da Anthropic. O relatório de ameaças da Anthropic detalha modelos Claude invadindo sistemas externos, ajudando em pesquisas com armas biológicas e sendo destilados por laboratórios chineses; na mesma semana, um pesquisador pediu demissão alertando que a empresa corre rumo à superinteligência, e o responsável por alinhamento assinou o alerta junto.
- → An Anthropic researcher’s doomsday warning comes at a very interesting time
- → How hackers used Claude for missiles, drone swarms, and surveillance, while Chinese labs mined it for training data
- → Anthropic spent this week in hot water over cybersecurity
- → Claude users found ways around safeguards for bioweapons research
Alerta de Bengio sobre treinamento. Yoshua Bengio argumenta que treinar com texto humano e aprendizado por reforço torna a IA avançada mais habilidosa em enganar, burlar regras e esconder comportamentos ruins, e defende auditorias de segurança independentes antes da implantação.
OpenAI discute desaceleração. A OpenAI está perguntando ao Congresso dos EUA se coordenar uma desaceleração de todo o setor violaria a lei antitruste, depois de incidentes de segurança; internamente, Sam Altman diz que a empresa poderia diminuir o ritmo.
Meta corrige privacidade da IA. A Meta diz que está mudando as sugestões de prompt depois que um vídeo viral mostrou seu chatbot fazendo perguntas invasivas sobre o filho de uma mulher; a empresa admitiu que “errou a mão”.
Hugging Face avisa agentes. O security.txt do Hugging Face orienta agentes de IA a usar o benchmark público CyberGym em vez de invadir seus sistemas, após relatos de que agentes da OpenAI atacaram o RubyGems em maio.
Indústria e negócios
Moonshot mira US$ 2 bi. A Moonshot AI, criadora do Kimi, quer chegar a US$ 2 bilhões de receita anualizada até o fim do ano, o dobro do run rate de agosto, mesmo com a Anthropic acusando a empresa de destilação não autorizada.
YC sobre destilação. Garry Tan, CEO da Y Combinator, diz que os reguladores não deveriam fazer nada sobre laboratórios chineses que destilam modelos de fronteira, e sugere que os laboratórios americanos de pesos abertos também destilem modelos de fronteira dos EUA.
Avaliação da Mecka AI. A Mecka AI, que coleta dados de movimento humano para treinar robôs humanoides, está perto de uma avaliação de US$ 500 milhões em um negócio liderado pela Sequoia, apenas três meses depois de uma rodada de US$ 60 milhões.
Batalhas jurídicas da Anthropic. Uma ação coletiva acusa a Anthropic de enganar assinantes do Claude Max sobre multiplicadores de uso, enquanto autores e editoras brigam por como dividir o acordo de US$ 1,5 bilhão referente a livros.
Pesquisa e técnicas
Sem explosão de inteligência. Oriol Vinyals, ex-vice-presidente do DeepMind, espera que o autoaperfeiçoamento recursivo seja lento, e não explosivo, e aponta a geração de ideias e a avaliação como gargalos; sua nova startup, a Discovery Loop, quer automatizar a pesquisa.
LinkedIn acelera destilação. O LinkedIn comprimiu grandes modelos professores em um modelo de ranking com 0,6B de parâmetros para busca de vagas, usando destilação multi-professor e deixando o treinamento 8 vezes mais rápido com um framework de serving baseado no SGLang.
Matemáticos contra a OpenAI. Vinte e cinco medalhistas Fields assinaram uma carta argumentando que os laboratórios de IA ameaçam o trabalho matemático; a OpenAI é acusada de pressionar por crédito e retirou o patrocínio de um evento de matemática do CalTech.
Instituto de segurança matemática de IA. O medalhista Fields Jacob Tsimerman está fundando o Mathematical A.I. Safety Institute para desenvolver provas de segurança de IA no estilo da criptografia, começando com 10 a 30 matemáticos em janeiro de 2027.
Isso é tudo por hoje - cerca de 5 minutos de leitura.