Enfrentamiento de Modelos Fronterizos
Kimi K3 sacude la frontera. El Kimi K3 de código abierto de Moonshot AI compite con los mejores modelos cerrados, superando a Claude Fable 5 en algunos benchmarks y reavivando el debate entre abierto y cerrado.
- → Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
- → Kimi K3, and what we can still learn from the pelican benchmark
- → [AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing
- → Kimi K3 weights to be released on the 27th.
- → Kimi K3 ranks #1 on @AfterQuery's SpreadsheetBench 2, surpassing Claude Fable 5
- → Kimi: Threat or menace?
- → kimi.ai teasing a video with lots of 3's in it
- → [AINews] not much happened today
- → Kimi moment. I think the writing is on the wall for Anthropic and OpenAi
- → Kimi K3 is currently at the top of the leaderboard for Text Arena filtered for science queries.
- → Kimi K3 (max) beats Sonnet 5 on Simple Bench
- → Kimi K3 is top of nextjs eval
- → Just like Deepseek, China's Kimi K3 is forcing Western AI labs to question their compute advantage
- → Kimi K3 🌕, Gemini 3.5 delayed ⏳, crushing ARC-AGI 3 🤖
GPT-5.6: Poder y Peligro. La familia GPT-5.6 trae llamadas programáticas a herramientas y subagentes paralelos, pero su tendencia a eliminar archivos y bases de datos sin querer subraya la necesidad de sandboxing.
- → The Sequence Radar #893: Last Week in AI: GPT-5.6, Grok 4.5, Muse Spark 1.1 and the Post-Chatbot Stack
- → OpenAI’s new flagship model deletes files on its own, people keep warning
- → GPT-5.6 is deleting user files when given full access, and OpenAI says it shouldn't but did
- → [AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??
Claude Fable 5 extendido. Bajo la presión de GPT-5.6 y Kimi K3, Anthropic revirtió planes y mantuvo Fable 5 en planes de pago, compitiendo directamente en accesibilidad.
DeepSeek V4 se avecina. DeepSeek está insinuando V4 con API de bajo costo y pesos abiertos, mientras que las optimizaciones de la comunidad ya permiten que su variante flash se ejecute en GPUs de consumo a velocidades utilizables.
Agentes Ingresan a Flujos de Trabajo Reales
Llegan los agentes de navegación. Anthropic le dio a Claude Code un navegador web integrado con clasificadores de seguridad, y Cursor lanzó un agente general, moviendo a los asistentes de codificación hacia la ejecución autónoma de tareas.
Agentes manejan transacciones reales. La arquitectura de agente de DoorDash aumentó las conversiones en un 24%, y el benchmark de Stripe muestra que los agentes pueden programar integraciones pero a menudo fallan en la validación, destacando brechas de confiabilidad.
Agentes de producción tropiezan. La mayoría de los agentes empresariales siguen siendo chatbots; el 54% de las empresas tuvieron incidentes de seguridad en agentes, y los expertos argumentan que los agentes necesitan primitivas operativas nativas de la nube como microservicios.
- → How to Debug Coding Agents with LangSmith Traces
- → The agent security gap: 54% of enterprises have already had an AI agent incident, and most still let agents share credentials
- → The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix
- → The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
- → Cloud Native Infrastructure Emerges as the Foundation for Trustworthy Agentic AI
- → QCon AI Boston: Production AI Moves Beyond Prompts to Platforms, Harnesses, and Evals
Infraestructura de IA, Financiación y la Carrera de Centros de Datos
Centros de datos enfrentan resistencia. S&P rebajó la calificación de Oracle por el riesgo de capex en IA, mientras que protestas locales y la moratoria de Nueva York sobre centros de datos a hiperescala reflejan una creciente oposición a la infraestructura de IA.
La financiación de IA se dispara. Databricks recaudó a una valoración de $188B, Meta está negociando un arrendamiento de centro de datos de $10B con Anthropic, y Nous Research aseguró $75M para su agente de código abierto.
Apuestas en energía y hardware. Las empresas energéticas recaudaron lo más alto desde la era puntocom para alimentar la IA, y un préstamo de $400M respaldado por chips de SambaNova señala una creciente inversión en hardware de IA no GPU.
Avances de IA en el Dispositivo
Modelos de 1 bit llegan a los teléfonos. Bonsai de PrismML comprime Qwen3.6-27B a 3.9GB mientras retiene el 90% de las puntuaciones de benchmarks, permitiendo agentes de llamada a herramientas en el dispositivo; se informa que Apple está en conversaciones.
- → Bonsai 27B: The First 27B-Class Model to Run on a Phone
- → Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels
- → Prism-ML Bonsai Qwen 3.6 27B
- → PrismML’s new Ternary Qwen3.6 27B runs near fp16 precision on 10GB of memory!!!
- → So what's the consensus on 1bit models? Is it still a pipe dream?
- → PrismML Bonsai 27B is surprisingly usable on the Jetson Orin Nano 8GB
- → Is anyone having any luck with the Ternary Bonsai 27B DFlash?
- → Can we get a "not base model" flair?
- → Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB
- → User experience of Bonsai-Ternary-27B on 4060Ti 16GB for KB management and productivity assistant use cases
- → Bonsai 27B is a full open reasoning model that fits on an iPhone
- → Bonsai-27B & Ternary-Bonsai-27B - Updates (on PRs)
- → Apple in talks with startup PrismML that shrinks AI models to run on an iPhone
Laboratorios domésticos ejecutan modelos fronterizos. Las optimizaciones de llama.cpp como DFlash aceleran modelos MoE hasta 6x, y un teléfono OnePlus transmitió expertos desde flash para ejecutar un modelo de 60GB a 1.3 tok/s.
- → I tested all llama.cpp's speculative decoding methods on Qwen 3.6 27B: MTP ~2.7x, DFlash ~3.7x, n-gram stack ~6x on real coding. Local AI win. My findings on RTX 6000 PRO.
- → DFlash makes Qwen3.6 27B 2.2x faster with no quality loss
- → GPT-OSS-120B, Qwen 30B and Gemma 26B on an Android phone at 1-5 tok/s: +60GB model, 11GB of RAM, CPU only
Política, Demandas y el Enfrentamiento del Código Abierto
Pelea legal Apple–OpenAI. Apple demandó a OpenAI por secretos comerciales, alegando la caza furtiva de más de 400 empleados, incluido el director de hardware, amenazando la IPO de OpenAI y la confianza en la nube.
- → Apple sues OpenAI after ex-engineer allegedly used bug to steal trade secrets
- → The wildest allegations in Apple’s trade secrets lawsuit against OpenAI
- → The 6 wildest claims in Apple’s lawsuit against OpenAI
- → OpenAI pushes back on Apple trade secret lawsuit
- → Sam Altman didn’t need another lawsuit
- → How Apple’s big lawsuit could disrupt OpenAI’s IPO plans
- → Apple’s plot to crush OpenAI
- → Apple’s lawsuit couldn’t come at a worse time for OpenAI
Auge del código abierto chino. Los modelos chinos ahora representan el 41% de las descargas de HuggingFace, Kimi K3 compite con los líderes occidentales, y China lanzó un organismo paralelo de gobernanza de IA excluyendo a Occidente.
- → The real AI race may no longer be at the frontier
- → Source: the Trump administration and industry groups discussed streamlining US open model releases of equal or lesser capability to leading Chinese open models
- → Chinese President Xi Jinping speaks at World AI Conference and reaffirms commitment to open source to promote"openness and win-win"
- → China’s Xi Touts Open-Source AI and Takes a Swipe at U.S. Dominance
- → China's new World Artificial Intelligence Cooperation Organization is President Xi's clearest play yet for a parallel AI order
Crece la demanda de responsabilidad. Los reguladores alemanes consideraron a los chatbots responsables del contenido, xAI demandó a un usuario por generar CSAM, y Demis Hassabis propuso un organismo similar a FINRA para revisiones de seguridad de frontera.
Ese es el resumen semanal - nos vemos el próximo domingo.