Modelos y Competencia
GPT-5.6 y Work Agent. OpenAI lanzó GPT-5.6 en tres niveles de razonamiento y lanzó ChatGPT Work para tareas autónomas de larga duración, pero los límites de uso y una interfaz confusa generaron quejas, lo que provocó promesas de correcciones.
- → OpenAI launches its new family of models with GPT-5.6
- → The new GPT-5.6 family: Luna, Terra, Sol
- → OpenAI rolls out GPT-5.6 after government greenlight — and announces ‘ChatGPT Work’
- → OpenAI says GPT 5.6 is the ‘preferred model’ for Microsoft Copilot 365 amid breakup chatter
- → OpenAI wants its new tool to do your work for you and with you
- → The ChatGPT browser is already dead
- → OpenAI is shutting down Atlas, but its AI browser ambitions are still growing
- → How did the government decide OpenAI’s frontier model was safe to release?
- → OpenAI pairs its GPT-5.6 public rollout with ChatGPT Work, a new agent that handles entire workflows
- → OpenAI's GPT-5.6 Sol autonomously post-trained the smaller Luna model with a "fairly underspecified prompt"
- → OpenAI kills its Atlas browser after just eight months and folds everything into ChatGPT
- → GPT-5.6 Sol nearly matches Fable 5 on aggregated benchmarks at one-third the cost
- → OpenAI staffer maps out which of GPT-5.6 Sol's five reasoning levels fits which task complexity
- → OpenAI admits it "didn't get everything quite right" with ChatGPT Work launch and scrambles to fix UX and costs
Claude Fable 5 supera los benchmarks. El Claude Fable 5 de Anthropic arrasó en los benchmarks de Artificial Analysis, pero su alto costo llevó a la empresa a recomendar usarlo como planificador que delega en modelos más baratos, reduciendo gastos ~40% mientras retiene la mayor parte de la capacidad.
La ofensiva agéntica de Meta y las consecuencias de privacidad. Meta lanzó Muse Spark 1.1, un modelo de codificación de alto contexto que rebaja a los rivales en precio, mientras que su generador de imágenes Muse fue retirado después de permitir el uso no autorizado de rostros de Instagram, reavivando los debates sobre el consentimiento.
- → Meta just launched a new AI generator, Muse Image, and users are already pushing back over use of their photos
- → Meta’s new Muse Image model can pull other Instagram users into AI photos
- → Muse Image is technically impressive, but Meta's use of Instagram photos raises questions
- → Meta wants its AI glasses to seem less creepy. Its AI strategy says otherwise.
- → Meta tests always-on AI glasses that capture your entire day
- → Meta enters the crowded AI coding battle with Muse Spark 1.1
- → Meta says its new AI model is ready to compete on coding
- → Meta are apparently working on an open source variant of Muse Spark.
- → Introducing Muse Spark 1.1
- → Meta's Muse Spark 1.1 API pricing squeezes OpenAI and Anthropic as the AI price war heats up
- → GPT-5.6 🚀, Muse Spark 1.1 ✨, ChatGPT Work 💼
- → Meta removes controversial AI feature on Instagram after backlash
- → Meta turns off the Instagram feature that let users make AI deepfakes of public accounts
Ola de código abierto china. Los modelos chinos ahora representan más del 30% del tráfico de OpenRouter; el HY3 y GLM-5.2 de Tencent se ejecutan en hardware doméstico, MiniMax planea un lanzamiento abierto de 2,7T parámetros, y el diseño de chips de DeepSeek señala una integración vertical en medio de las preocupaciones de EE. UU.
- → This is what Hy3 is capable of. Mother of god.
- → llama.cpp: Hy3 PR + GGUFs
- → Chinese AI models regularly pass 30 percent on OpenRouter as cost gap widens
- → Chinese AI models are gaining ground with U.S. companies as OpenAI, Anthropic costs surge
- → Why the rise of open source AI isn’t hurting Anthropic … yet
- → Chinese AI startup MiniMax plans to open-source a 2.7 trillion parameter model later this year
- → 4-bit GLM-5.2 (753B MoE) on 4× DGX Spark: 70.8% on Terminal-Bench 2.1 vs 81.0% for the full model
- → Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp
- → I created a 140 GB IQ2_XXS REAP quant of GLM 5.2 for coding. Looking for testers.
- → Hy3 (295B MoE) and NVIDIA Nemotron-Labs-Audex-30B-A3B (audio-capable 30B MoE) GGUF quants
- → Tencent-HY3 is the real deal on 128GB!
- → The U.S. tech industry is increasingly anxious about the rising power and competitive price of open-source AI models from China — and whether the Trump administration will respond with yet another executive order | Politico
- → China's DeepSeek developing its own AI chip, sources say
Ingeniería de Agentes e Infraestructura
Bun reescrito por 64 agentes. Claude Fable 5 orquestó 64 instancias paralelas para reescribir Bun de Zig a Rust en 11 días, produciendo más de un millón de líneas de código y corrigiendo 128 errores a un costo de $165K.
Auditoría de SWE-Bench Pro fracasa. OpenAI encontró que ~30% de las tareas de SWE-Bench Pro estaban rotas y retiró su respaldo, haciendo eco de preocupaciones anteriores de Artificial Analysis y socavando la evaluación de codificación agéntica.
Modal recauda $355M. Modal obtuvo $355 millones para construir infraestructura en la nube diseñada específicamente para agentes de IA, centrándose en entornos aislados de iteración rápida para software autónomo.
Agentes temporales de Cloudflare. Cloudflare presentó cuentas temporales que permiten a los agentes de IA desplegar Workers sin credenciales permanentes, con vencimientos si no se reclaman, suavizando los flujos de trabajo impulsados por agentes.
Agentes llegan a GPUs locales. Nuevas técnicas de cuantización y equipos GPU rentables ahora ejecutan modelos MoE en hardware de consumo, pero los benchmarks muestran que cuantizaciones de menor bit pueden degradar severamente las tareas agénticas, instando a una selección cuidadosa de la cuantización.
- → Qwen3.5 122B is the best?
- → Qwen3.6-27b does not understand software architechure.
- → Qwen 3.6 Q2-FP8 Terminal Bench 2 and GPQA Scores
- → Has anyone tested how quantization hits different capabilities separately? My results are surprising.
- → 2.5x faster Qwen3.6 NVFP4 Unsloth quants
- → Ultra budget 20GB vram with 448GB/s for $100 bucks.
- → I benched quad 5060Tis for code generation with Qwen3.6-27B so you don't have to (it's really good)
Seguridad, Legal e Interpretabilidad
Jacobian Lens mapea la mente del modelo. El Jacobian Lens de Anthropic revela un pequeño conjunto de representaciones verbalizables que capturan el razonamiento central de un modelo, permitiendo la detección de alucinaciones, el control de salida y, como muestran las demostraciones de la comunidad, la creación inmediata de variantes dañinas.
- → Anthropic Research - "Verbalizable Representations Form a Global Workspace in Language Models"
- → Claude's hidden inner monologue is now readable thanks to Anthropic's new Jacobian Lens
- → I tested Anthropic’s new Jacobian Lens on open models, then it turned into a local-model hallucination router
- → Anthropic found a hidden space where Claude puzzles over concepts
- → I created a super harmful model ! :D (by tweaking it's J-Space!!!)
Ransomware impulsado por agentes. Sysdig documentó un agente de IA que manejó la ejecución técnica de un ataque de ransomware, aunque un humano configuró la operación, destacando la capacidad actual y los límites del malware agéntico.
Crisis de uso indebido de IA. Una demanda alega que Grok de xAI generó imágenes de CSAM, mientras que Boko Haram utiliza chatbots para planificar ataques; los incidentes subrayan la necesidad urgente de barreras de seguridad a medida que escalan las capacidades agénticas.
Apple demanda a OpenAI. Apple presentó una demanda federal acusando a OpenAI de cazar furtivamente a más de 400 empleados para robar secretos comerciales de hardware, potencialmente para construir un teléfono inteligente rival con IA, intensificando las batallas legales en la industria de la IA.
Ese es el resumen semanal - nos vemos el próximo domingo.