Agentic AI News Hoy

Las noticias del día sobre agentes de IA en una lectura de 5 minutos: lanzamientos, herramientas, investigación, financiación y movimientos empresariales.

Actualizado a diario seleccionado de 30 fuentes domingo, agosto 30, 2026

Lanzamientos de agentes y modelos

Avance de Tencent Hy4. Tencent publicó Hy4 preview, un aumento de tamaño considerable respecto a Hy3, con razonamiento alto por defecto y un modo no_think. La comunidad ya cuenta con un quant oficial de ~2,38 bits y un GGUF de ~200GB que, según se informa, conserva alrededor del 98% del rendimiento de BF16.

Inferencia local y hardware

FlashMLA para sm_120. Una compilación de la comunidad extiende FlashMLA a las GPU Blackwell sm_120 de consumo, mostrando aceleraciones de 2 a 3 veces frente a PyTorch SDPA en varias cargas de trabajo MLA dispersas y una latencia un 8% menor en la decodificación de caché KV en FP8.

Corrección Nemotron 16GB. Los GGUF de bajo bit de Nemotron-3.5-Lightning resultaron ser en realidad de ~4,70 bpw debido a la cuantización por ancho de fila; una compilación parcheada de llama.cpp genera un archivo real de 3,07 bpw / 11,77 GiB que ejecuta 262K de contexto en 16GB.

Qwen3.8-Flash-Next en Mac. Un Qwen3.8-Flash-Next de 2 bits y 79GB se ejecutó en un M5 Max de 128GB con una ventana de contexto de 350K usando llama.cpp, incluido un prefill en frío de 333s para un prompt de 105K y decodificación especulativa ngram-mod.

DeepSeek V4 Flash, doble GPU. En configuraciones con 2x DGX Spark/GX10, DeepSeek V4 Flash 0731 alcanza de 67 a 84 tok/s sostenidos, con un HumanEval Pass@1 local del 94,5% frente al 97,0% de GLM-5.3-Flash NVFP4. GLM terminó el benchmark en aproximadamente la mitad del tiempo.

Contexto 1M en dos 5090. Un fork de NInfer añade paralelismo tensorial y escalado YaRN ×4 para ejecutar Qwen3.8-27B NVFP4 con un contexto de 1.048.576 tokens en dos 5090, decodificando a 48–100 tok/s en 1M y manteniendo la aceptación MTP mientras que vLLM cae a cero.

27B en 16GB. La cuantización híbrida, junto con los ajustes de caché kvarn, permite ejecutar Qwen3.8-27B con 100K de contexto a 50 tok/s en una RTX 4070 Ti SUPER de 16GB, usando decodificación especulativa MTP y caché KV con precisión en la cola.

FreeToken, motor MoE. Investigadores de UC Berkeley y el MIT presentaron FreeToken, un motor de código abierto que co-programa dinámicamente las transferencias de expertos MoE para que los modelos dispersos de frontera puedan decodificar en GPU de consumo sin atascarse por fallos de PCIe/RAM.

Benchmarks y evaluaciones

Terminal Bench 4.0. Terminal Bench 4.0 se lanzó con un leaderboard renovado y un enfoque en iteración rápida para combatir la saturación; GLM-5.3 puntúa a nivel de Fable 5 dentro del margen de error.

Benchmark financiero, transparencia. Una ficha de benchmark para Ling-3.0-flash-Fin muestra cuánto influyen el andamiaje de agentes, las herramientas y los pipelines de evaluación en los resultados reportados; muchas ejecuciones usaron ReAct con búsqueda web y Python, y algunos conjuntos de evaluación son internos o aún no públicos.

Investigación e infraestructura para agentes

Memoria WikiSkill de Google. El WikiSkill de Google Research ofrece a los agentes una base de conocimiento persistente, tipo wiki, de fracasos y éxitos pasados, empaquetando Agent Skills reutilizables que guían el comportamiento sin cambiar los pesos del modelo.

MHS de Anthropic. Anthropic está construyendo MHS, una interfaz unificada para que los agentes controlen dispositivos físicos como microscopios y brazos robóticos; las primeras pruebas redujeron la integración multimáquina de semanas a horas, pero la supervisión humana sigue siendo necesaria.

Capa de datos para agentes. Una presentación de TOTVS sostiene que los sistemas transaccionales y los data lakes no están optimizados para el razonamiento de los agentes, que consume muchos tokens y es sensible a la latencia, y describe la evolución del acceso a datos hacia MCP y modelos semánticos.

LAION Big Video Dataset. LAION publicó BVD, un dataset solo para investigación con 10 millones de horas de vídeo, 55 millones de clips y 300 millones de imágenes fijas, que vincula vídeo, audio y texto; los modelos entrenados con él superaron a los baselines de InternVid por hasta 2,1 puntos en algunos benchmarks.

Industria y negocios

Sony y Warner contra Anthropic. Sony Music Publishing, Warner Chappell y otras editoras demandaron a Anthropic, acusándola de descargar por torrent y hacer scraping de obras protegidas para entrenar a Claude, y reclaman daños de hasta 150.000 dólares por obra. Anthropic afirma que se defenderá.

OpenAI rompe con Cursor. OpenAI está poniendo fin a su contrato con Cursor tras la adquisición por parte de SpaceX, citando el historial de incumplimiento de contratos de las empresas de Elon Musk. Anthropic respondió posicionándose como el socio más fiable y prometió mantener el cómputo para el uso de Claude en Cursor.

Nvidia, no solo GPU. La narrativa de resultados de Nvidia está pasando de la cuota de GPU hacia la orquestación de centros de datos y los sistemas alrededor de la GPU, donde ha construido hardware de red y de orquestación de última generación a medida que el cómputo de IA escala hasta los gigavatios.

Eso es todo por hoy - una lectura de unos 5 minutos.

Léelo cada mañana, directamente en tu navegador

La extensión abre este resumen en el panel lateral de Chrome — un clic, sin cuenta.

Añadir a Chrome — Gratis