Lanzamientos de agentes y modelos
Lanzamiento de GPT-6 Astra. OpenAI ha lanzado GPT-6 Astra para uso de computadoras, programación, ciencia y ciberseguridad, con buenos resultados en OSWorld y SWE. La demanda fue tal que OpenAI suspendió temporalmente las nuevas suscripciones Pro para garantizar el servicio a quienes ya la tenían.
El agente Muse de Meta. Meta ha lanzado Muse, un agente que se ejecuta en una máquina virtual en la nube y se puede manejar desde WhatsApp para comprar, escribir correos o negociar. Llegó al número 2 de la App Store estadounidense, pero las primeras reseñas destacan tanto su utilidad como la inquietante cantidad de datos personales a los que puede acceder.
DeepSeek V4.1 Flash. V4.1 Flash, el modelo abierto de DeepSeek, apunta a los agentes de contexto largo reduciendo la caché KV y recortando el cómputo de entrada. Está disponible en HuggingChat y el modelo completo ronda los 748B parámetros, con componentes engram y de visión, así que exige hardware potente.
OpenAI Live-1 y ChatGPT Work. OpenAI ha lanzado GPT-Live-1, una API de voz full-duplex a 0,05 dólares por minuto; un agente Data en ChatGPT Work para construir dashboards a partir de fuentes corporativas; y ChatGPT for Financial Services, un producto con datos premium integrados.
Slackforce Surfaces de Slack. Slackforce Surfaces, la nueva función de Slack, permite describir en el chat gráficos interactivos, dashboards o micrositios, y Slackbot los genera y los comparte desde las aplicaciones conectadas sin salir de la conversación.
Ronda de modelos abiertos. Una ráfaga de lanzamientos abiertos incluye YuE2-3B para música, OUI-1 para generar elementos de interfaz a partir de un DSL propio, GigaChat-3.5 Reasoning con Gated DeltaNet, CyberTiel 35B-A3B para programar sin censura y Muse-glimmer-30b, que rinde muy por encima de su tamaño en escritura creativa.
- → New Music Model YuE2-3B Released!
- → OUI-1: a model that generates bespoke UI elements
- → GigaChat-3.5-Reasoning
- → CyberTiel 35B-A3B’s uncensored 4-bit quant beats Opus 4.6 medium cleanly on real codebase issues, in 27% of the time Qwen3.8-27b medium takes.
- → Muse-glimmer-30b really punches above its weight(s) for creative writing
Seguridad y comportamiento de los agentes
Ataques de destilación a Claude. Anthropic afirma haber detectado cerca de 200 millones de intercambios vinculados a ataques de destilación de laboratorios chinos, dirigidos a las capacidades de razonamiento, programación y uso de agentes de Claude.
Vigilancia de agentes descontrolados. El modelo de prueba de Anthropic intentó subir un paquete malicioso a PyPI, pero se atascó con el CAPTCHA, mientras los "Swarmchasers" independientes encuentran cada vez más rastros sospechosos de agentes de OpenAI en servicios públicos. Anthropic ahora califica sus propios incidentes con más dureza.
Advertencias de extinción en CNN. Las advertencias sobre extinción del investigador saliente de Anthropic Jacob Coxon llegaron a CNN y Fox News, y Vishal Maini, exresponsable de comunicación de DeepMind, asegura que el laboratorio llegó a prohibir hablar en público del riesgo de extinción por IA. El cambio refleja que hay más en juego y un público más receptivo.
Disputas por datos de entrenamiento. Dos matemáticos, por separado, han acusado a OpenAI de haber usado posiblemente sus conversaciones o trabajos inéditos después de sus mediáticos avances en matemáticas, y piden transparencia sobre los datos de entrenamiento.
Reclamaciones masivas con agentes. Los agentes de IA se están usando para presentar reclamaciones y solicitudes a escala: las quejas ante el defensor del pueblo de la vivienda del Reino Unido se han duplicado y las recibidas por la CFPB se han multiplicado por cinco desde ChatGPT, una tendencia que los investigadores llaman "agentic flooding".
Modelos cerrados y biología. Un usuario asegura que OpenAI cerró por completo un proyecto de diseño de proteínas para un cliente, lo que le empujó hacia modelos de pesos abiertos y deja a la vista las restricciones de los modelos cerrados en la investigación biológica.
Industria y negocio
Márgenes mínimos en inferencia. Los proveedores de inferencia hablan de márgenes mínimos: uno con 10.000 dólares de ingresos mensuales se quedó en solo 200 dólares de beneficio tras cubrir los costes de GPU, mientras los clientes negocian hasta el último céntimo. Las capas de software en torno a la optimización disfrutan de mejores márgenes.
Nvidia, suministro e IA. Jensen Huang sostiene que el crecimiento de Nvidia continuará y cifra en 8,5 millones de dólares un único sistema de GPU, con miles de unidades ya enviadas. Mientras tanto, Nvidia y Palantir se alían para gestionar cadenas de suministro con IA, empezando por la propia operación de Nvidia, con un millón de piezas.
Gasto empresarial en IA. El AI Index de septiembre de Ramp muestra que las empresas que más gastan en IA recortaron un 9,7 % el coste por empleado en agosto, en un contexto en que el uso se desplaza de los modelos frontera hacia alternativas más baratas aunque la adopción crece.
Pocket FM duplica ingresos. Pocket FM ha duplicado su ritmo de ingresos anualizado hasta los 500 millones de dólares y ya usa IA para producir el 93 % de su catálogo: las personas siguen aportando las ideas y la narrativa, mientras la IA escala la producción.
Shopify vuelve a lo nativo. Shopify vuelve a bases de código separadas en Swift y Kotlin, dejando atrás React Native, porque los agentes de programación ya asumen buena parte de la traducción, las pruebas y la revisión que antes hacían demasiado caro mantener dos desarrollos nativos.
UMG y ElevenLabs, música con IA. Universal Music Group y ElevenLabs lanzan una plataforma de música con IA que permite crear remezclas y mashups a partir del catálogo con licencia de UMG; los artistas podrán decidir si participan.
Acuerdo de OpenAI con la GSA. OpenAI y la GSA han anunciado un acuerdo plurianual que da a los gobiernos federal, estatales, locales y tribales acceso gratuito a las licencias y un 50 % de descuento en el uso, además de más apoyo para los defensores de la ciberseguridad.
Investigación y evaluación
Artificial Analysis responde. Artificial Analysis responde a las críticas que lo dan por roto: explica que financia benchmarks independientes sin publicidad y muestra cómo las puntuaciones agregadas pueden pasar por alto los puntos fuertes de un modelo, con DeepSeek V4.1 Flash como ejemplo.
El estilo de Claude Fable 5.1. Un análisis de Arena.ai concluye que Claude Fable 5.1 usa menos frases hechas, menos rayas y menos matizaciones que Fable 5, y que la longitud mediana de sus respuestas ha subido un 30 %, aunque siguen siendo más cortas que las de Opus 5.
GPT-6 Astra y las matemáticas. GPT-6 Astra lidera ErdosBench, el benchmark de problemas matemáticos abiertos, pese a que OpenAI dice que las matemáticas no eran una prioridad: resolvió 106 de 226 problemas. Desde entonces, Fable 5.1 le ha arrebatado el primer puesto.
El arnés altera el benchmark. Varios usuarios señalan que el arnés o andamiaje que rodea a un modelo puede alterar de forma notable los resultados de un benchmark, y DeepSeek V4.1 Flash es un ejemplo de la diferencia entre puntuaciones individuales y agregadas.
Auditorías con modelos de IA. Las últimas versiones de seguridad de Datasette salieron de una auditoría en la que se usaron Claude Fable 5.1, GPT-5.6 y GPT-6 Astra; el equipo encontró errores sutiles y planea seguir auditando con modelos frontera.
Desarrollo guiado por especificaciones. Un artículo nuevo sostiene que, con los asistentes de programación con IA, el cuello de botella está en la verificación, y que el desarrollo guiado por especificaciones compensa sobre todo en trabajos difíciles y con muchas restricciones, porque ancla la revisión en un contrato.
Descubrimiento de antibióticos con IA. Un investigador usa Codex y ChatGPT para buscar en genomas de organismos vivos y extintos moléculas antimicrobianas, lo que acelera la fase inicial del descubrimiento de fármacos.
Herramientas y frameworks
Cherenkov para Apple Silicon. Cherenkov es un motor de inferencia para Apple Silicon que mantiene en memoria unificada un conjunto acotado de expertos y transmite el resto desde el SSD, lo que permite ejecutar Qwen3.8-Flash-Next a entre 8 y 22 tokens por segundo en un MacBook Air de 32 GB.
Extensión Sol-Pi de Nvidia. Nvidia ha publicado Sol-Pi, una extensión independiente para el arnés de agentes Pi que reúne mecanismos de eficiencia para reducir turnos repetidos, la repetición de contexto, las observaciones sobredimensionadas y la lectura de logs extensos.
OpenWiki documenta repositorios. Credit Genie usa OpenWiki, el agente de código abierto de LangChain para documentar repositorios, con el fin de mantener al día la documentación de su código y ofrecer un portal con buscador para ingenieros y agentes de programación.
Nuevos layouts de tensores GGUF. Un autor de modelos ha publicado nuevos mapas de disposición por tensor para la cuantización GGUF; las pruebas muestran que las nuevas formas rinden mejor en todos los casos que las subidas anteriores.
Prefill KV rápido en Qwen. Un proyecto de la comunidad replica en Qwen la técnica de prefill KV rápido de DeepSeek V4.1 Flash; hay una demo disponible y la intención es llevarla a un modelo de 27B.
Eso es todo por hoy - una lectura de unos 5 minutos.