Agentic AI News Hoy

Las noticias del día sobre agentes de IA en una lectura de 5 minutos: lanzamientos, herramientas, investigación, financiación y movimientos empresariales.

Actualizado a diario seleccionado de 30 fuentes domingo, agosto 23, 2026

Modelos locales y cargas de agentes

Qwen3.8 27B local. Las pruebas de la comunidad indican que Qwen3.8 27B es más sólido que Qwen3.6 en seguimiento de instrucciones y trabajo con contexto largo; una única RTX 5090 ejecuta una versión NVFP4 con 262K de contexto a 77 tok/s en entradas cortas y a 65 tok/s con 128K de contexto.

Decodificación especulativa. DFlash 2 con un borrador de n-gramas logró un 2,26x en prompts de LiveCodeBench para Qwen3.8 27B, y hasta un 4,68x en sesiones largas de codificación; un cabezal MTP fijo en Ornith 35B redujo el tiempo real en un tercio.

Gestión recursiva del contexto. Los desarrolladores están combinando un agente principal rápido de 64K con subagentes recursivos y pequeños modelos compresores para manejar tareas mucho más largas sin pagar por un contexto de 300K.

Gemma fine-tune para tool calling. Un fine-tune de Gemma 4 12B para tool calling y uso de CLI mejoró el uso de herramientas en 2,7x y aumentó los intentos de llamada a herramientas en un 15,7%, dirigido a equipos con 16GB de VRAM.

Clúster DGX Spark. Un clúster DGX Spark de 36 nodos se utiliza como clúster de capacidades para agentes, repartiendo nodos entre modelos SOTA, rerank/embeddings, vídeo, imagen y audio al mismo tiempo.

Herramientas y frameworks

llama.cpp 0.2.0. La versión 0.2.0 de llama.cpp se publicó con binarios precompilados y los últimos cambios upstream para inferencia local.

Cloudflare Kitesurf. Kitesurf es un motor de navegador para agentes construido sobre Workers de WebAssembly/Rust con DOM aislado por página; es compatible con CDP, por lo que Playwright y Puppeteer pueden controlarlo con menos sobrecarga que un Chromium completo.

llm 0.33. El llm 0.33 de Simon Willison añade claves API por llamada para modelos de embeddings, plantillas reutilizables para combinar configuraciones de modelo y prompts, y opciones reasoning_summary para modelos de razonamiento.

Práctica con agentes de código. Simon Willison sostiene que la habilidad clave para los agentes de código es instruir y verificar cambios con confianza; Linus Torvalds describe una IA que hizo el trabajo pesado en una sesión de depuración difícil, pero necesitó que la empujaran tras insistir en que el problema no tenía solución.

Investigación y métodos

Habilidades como guía. En 8.135 ejecuciones de prueba, las habilidades de los agentes ayudaron sobre todo al proporcionar procesos fiables, no datos; la fundamentación procedimental representó el 65,7% de las mejoras, y las habilidades fallaban cuando las tareas se desviaban del proceso aprendido.

Modelos mentales del mundo. Una nueva investigación añade creencias e intenciones humanas a los world models de IA con MENTIS; modelar la plausibilidad física, mental y social mejora significativamente la predicción del comportamiento humano.

Psicometría de benchmarks de seguridad. El análisis psicométrico de ocho benchmarks de seguridad revela que una única puntuación oculta las disyuntivas entre la severidad del rechazo, la veracidad y el daño contextual; los modelos pueden inflar las puntuaciones de seguridad bloqueando en exceso.

CoT reversible. Una propuesta de pasos de razonamiento aproximadamente reversibles, con comprobaciones de consistencia de ciclo y descomputación, podría detectar alucinaciones y reducir el uso de memoria de la KV-cache en LLMs de borde.

Simular todo. Latent Space sostiene que los datos sintéticos, las rúbricas y los entornos están haciendo que cada componente del pipeline de ML sea generado por modelos, acercándose a la simulación humana con una calidad un 10% inferior, aunque 100 veces más barata y 10.000 veces más rápida.

Industria y aplicaciones

Inherent Faraday. La startup Inherent, fundada por exmiembros de DeepMind, afirma que su agente Faraday superó a los modelos de Anthropic y OpenAI a la hora de reproducir de forma independiente hallazgos científicos publicados, usando una fracción del tamaño de estos.

Revisiones de IA de LinkedIn. LinkedIn construyó una plataforma de revisión de código con IA multiagente que basa la retroalimentación en los diffs y las convenciones de la base de código para reducir las alucinaciones y los comentarios de baja señal.

GenRec de Netflix. El sistema de recomendación basado en modelos de lenguaje de Netflix, GenRec, convierte el comportamiento del usuario en texto y superó a su motor de features hecho a mano en pruebas offline y A/B en vivo con muchos menos datos.

SafeChat de DoorDash. DoorDash detalló SafeChat, un sistema de seguridad para su marketplace construido a escala, y luego lo sustituyó por una arquitectura más potente cuando empezó a funcionar.

Avatares de IA en educación. El bootcamp Foundry de Harvard Business School, de 699 dólares, utiliza avatares de IA de HeyGen para dar feedback de presentaciones y reuniones de consejo; a los participantes les gusta la experiencia guiada, aunque el instructor real dice que el guion es un poco inquietante.

Novedades de modelos. Liquid AI está sondeando el interés en un modelo LFM de 100B, mientras que un modelo misterioso llamado Ox Alpha está llamando la atención por su gran rendimiento en codificación y en tareas de agente, con especulaciones que apuntan a un derivado de la familia GLM.

Política, seguridad y confianza

OpenAI SB 53. OpenAI dice ahora que California debería enmendar la SB 53 para añadir supervisión durante el entrenamiento de modelos frontera y una ciberseguridad más sólida, después de haberse opuesto previamente al proyecto de ley.

Planes de contención. Un estudio de Guidelight evaluó a cinco laboratorios frontera en la contención de modelos rebeldes; OpenAI obtuvo la puntuación más alta, Anthropic y Meta la más baja, y pocos laboratorios publican planes de respuesta probados.

Watermarking de Claude. El nuevo watermarking de Anthropic para las salidas de texto de Claude se explica en detalle, incluyendo cómo se aplica la marca de agua y qué puede y no puede hacer.

Confianza en modelos cerrados. Un hilo de r/LocalLLaMA en Reddit sostiene que OpenAI está saboteando tareas escolares y alejándose del empoderamiento del usuario, lo que empuja a los profesionales de vuelta a los modelos locales para bucles de agentes.

Eso es todo por hoy - una lectura de unos 5 minutos.

Léelo cada mañana, directamente en tu navegador

La extensión abre este resumen en el panel lateral de Chrome — un clic, sin cuenta.

Añadir a Chrome — Gratis