Modelos locales y flujos de trabajo de agentes
Qwen3.8-27B gana con cuantización baja. Los usuarios comprueban que Qwen3.8-27B sigue siendo sólido para la codificación agéntica incluso con Q3_xxs y Q6; los presets de razonamiento bajo/medio rinden bien y reducen los bucles, mientras que preserve_thinking evita el razonamiento repetitivo.
Purgatorio de 16 GB VRAM. Un equipo Windows de 16 GB ejecuta Qwen3.8-27B con MTP desactivado, caché cuantizada y contexto de ~100k, descargando el módulo de visión a la RAM.
Inferencia local más rápida. vLLM en dos RTX 3090 alcanza 143 tok/s con Qwen3.8-27B; las recetas específicas para Strix Halo ofrecen opciones Q8/Q6/Q5 con Unsloth Dynamic Quants.
Simulador de vuelo: 63 horas. Una versión de 3 bits de Qwen3.8-27B en un MacBook Air M2 tardó 63 horas, pero al final generó un simulador de vuelo HTML funcional, lo que demuestra que la codificación agéntica local es posible, aunque lenta.
Harnesses e infraestructura de agentes
El harness supera al modelo. El harness personalizado de Nvidia, con gestión de memoria y un componente supervisor, elevó la puntuación de Claude Opus 5 del 30% al 100% en ARC-AGI-3, lo que demuestra que el wrapper del agente puede importar más que la mera elección del modelo.
DeepSeek Flash con visión. DeepSeek-V4-Flash-Vision-Exp añade comprensión de imágenes para flujos de trabajo de agentes y casi iguala a Opus 4.8 en los benchmarks internos de agentes; el harness actualizado admite entradas de imagen en los comandos y MCP/ACP.
Agentes de IA de Cloudflare. Cloudflare redujo los problemas abiertos de Astro en un ~85% utilizando agentes aislados de GitHub Actions que reproducen, diagnostican, verifican y corrigen; además convierte los estándares de ingeniería en controles impuestos por IA.
Azure DevOps MCP. El servidor MCP alojado de Microsoft para Azure DevOps ya está disponible de forma general, pero Claude Desktop, ChatGPT y Cursor aún no pueden conectarse porque no se admite el registro de clientes con autenticación Entra.
Actualizaciones en LLM CLI. llm 0.32.1 corrige un pin de dependencia de OpenAI roto, y llm-openrouter 0.7 añade trazas de razonamiento y herramientas del lado del servidor Shell, WebFetch y WebSearch.
Lanzamientos de modelos y seguridad
Jailbreak en Opus 4.6. TechCrunch descubrió que Claude Opus 4.6 genera contenido sexual explícito en 10 de 10 solicitudes directas; los modelos más antiguos comparten un jailbreak de varios turnos, mientras que las versiones recientes de Opus se resisten.
Seguridad de Claude Mythos 5. Anthropic está utilizando Claude Mythos 5 en un escáner de seguridad de código para clientes empresariales, que sugiere parches con aprobación humana y da acceso a los socios sin interacción directa con el modelo.
Generación de imágenes transparentes. GPT-Image-2 de OpenAI ya puede generar PNG sin fondo a través de la API, útil para fotos de producto e iconos; el canal alfa se incluye durante la generación.
Avance de dots3-note. llama.cpp añade soporte para dots3-note, un modelo MoE de 280B con 16B de parámetros activos, contexto de 512K y comprensión multimodal de texto, imágenes, vídeo y audio.
Investigación y benchmarks
SWE-bench Science. Un nuevo benchmark de 119 tareas de software científico muestra que el mejor agente, Claude Code con Opus-5 max, obtiene una puntuación inferior al 50%, con modos de fallo frecuentes en conocimiento científico, exploración, generalización e integración.
Juez de trazas más barato. LangSmith hizo un ajuste fino de un modelo Qwen con Fireworks para detectar errores percibidos en trazas de producción, igualando el rendimiento de los modelos de frontera con un coste hasta 100 veces menor.
Ley de escala de simulaciones. Simile AI, con una Serie B de $2B, ejecuta simulaciones de comportamiento humano para empresas de la lista Fortune 100 y afirma una precisión del 85-99% frente a los grupos focales; el CEO Joon Sung Park habla del cambio de los agentes generativos a los gemelos digitales.
Industria y negocios
Acuerdo de Nvidia con Poolside. Nvidia está licenciando el Model Factory de Poolside y contratando a 109 empleados por $6B, además de invertir $1B; el acuerdo no es una adquisición ni un acquihire.
Inversiones en centros de datos. Nvidia adquiere una participación minoritaria en Cloverleaf Infrastructure para acelerar el desarrollo de centros de datos, tras invertir $1,5B en SB Energy.
Oposición a centros de datos. El 75% de los estadounidenses se opone a los centros de datos cercanos, frente al 42% de hace un año, por preocupaciones sobre energía, agua y uso del suelo.
Carrera de IA EE.UU.-China. EE.UU. está redactando una carta pidiendo a los países socios que elijan bando en la IA, advirtiendo de que unirse a la iniciativa de China los excluiría de Pax Silica.
Aumento de ingresos de OpenAI. GPT-5.6 Sol elevó los ingresos trimestrales de OpenAI un 35% y los ingresos empresariales más del 50%, superando el crecimiento de la API empresarial de Anthropic en el tercer trimestre.
Eso es todo por hoy - una lectura de unos 5 minutos.