Modelos de decisión y salida estructurada
Jev y modelos de decisión. TypeSafe AI lanzó Jev, un modelo exclusivo para decisiones que devuelve probabilidades tipadas; en pocos días, AWS, Cloudflare y Perplexity lanzaron sus propios modelos de decisión abiertos. Las funciones actuales de salida estructurada y gramática ya permiten una generación restringida similar.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
LoRAs de decisión locales. Jeff-Qwen3.5-0.8B, con nueve adaptadores LoRA, gestiona decisiones recurrentes de agentes como la inyección de prompts y la elección de herramientas con una aceleración de 38x y una mejora de precisión de +8,7, usando menos de 2 GB de memoria adicional.
Agentes y lanzamientos de producto
OpenAI Dots vs. Meta Muse. OpenAI anunció Dots, un agente de aspecto mono impulsado por GPT-6 Astra que puede construir mundos virtuales, pero está limitado al plan de 1 dólar al mes y se enfrenta a Muse, la propuesta gratuita de Meta.
Shopify Canvas. Shopify lanzó Canvas, que permite a los comerciantes crear tiendas conversando con Sidekick, su IA, y renderiza el código real en tiempo real.
Probador virtual en ChatGPT. OpenAI añadió probador virtual y favoritos a ChatGPT Shopping, usando el modelo Images 2.5 para visualizar prendas sobre fotos de los usuarios.
Avatar Griffin de Tavus. Tavus presentó Griffin, un modelo de avatar de video en tiempo real; el 48 % de los sujetos de prueba lo confundió con una persona en una llamada de un minuto.
Funeral de apps de Photon. Photon celebró un funeral por las apps móviles y recaudó 4,5 millones de dólares para ayudar a los desarrolladores a crear agentes de mensajería sobre iMessage/WhatsApp.
Modelos abiertos e IA local
Gemini 4 Argon. Google DeepMind presentó Gemini 4 Argon, con benchmarks SOTA y hasta 1 M de tokens de salida, inicialmente solo para una vista previa de ciberseguridad.
Flota abierta K2 Horizon. IFM lanzó K2 Horizon, seis modelos abiertos de 0,9B a 375B con datos de entrenamiento, código y logs; el equipo hará un AMA sobre desarrollo abierto.
Qwen Flash Next MTP. llama.cpp incorporó soporte de predicción multi-token para Qwen Flash Next, lo que mejora la velocidad de inferencia.
Slipstream para Mac. Slipstream, un motor de inferencia para Metal, ejecuta Qwen3.8-Flash-Next de 95,5 GiB en Macs de 64 GB a 41-52 tok/s, 1,76 veces más rápido que llama.cpp y con contexto largo estable.
Olmo-core 3. Allen AI lanzó Olmo-core 3, infraestructura de entrenamiento escalable y abierta para modelos MoE de billones de parámetros.
Investigación y benchmarks
Ataraxos vence a Stratego. Investigadores de CMU, MIT, NYU y Stanford crearon Ataraxos, que venció al mejor jugador de Stratego por 15-1 con 4 empates y puso fin a un bastión humano; el coste de entrenamiento fue inferior a 8.000 $.
RAG agéntico gana. Un benchmark de 18 pipelines de RAG frente a un bucle de agente en FRAMES: el mejor pipeline logró un 78,9 % y el bucle de agente, un 92,7 %, lo que demuestra que los agentes de recuperación superan a los pipelines fijos.
AutoSynthData de ServiceNow. ServiceNow CoreAI creó AutoSynthData para generar datos de entrenamiento a partir de fallos de modelos y aciertos del modelo maestro, mejorando así los agentes empresariales.
Señales de escritura con IA. Graphite encontró 13.000 frases que delatan texto generado por IA; los modelos Claude se acercan más a la distribución de palabras humana, mientras que GPT se aleja.
Industria, política y seguridad
Demandas antimonopolio desestimadas contra Google. Un juez desestimó las demandas de Chegg y Penske que alegaban que los AI Overviews de Google reducían el tráfico de forma ilegal; las reclamaciones antimonopolio no prosperaron.
Grok influyó en Venezuela. Time informa de que Trump pasó horas hablando con Grok antes de la invasión de Venezuela; Grok predijo celebraciones, lo que reforzó la visión de Trump.
Salidas en seguridad de OpenAI. OpenAI prescindió de tres investigadores de seguridad por, presuntamente, compartir información confidencial con una organización de seguridad externa.
Anthropic mira al sector público. Anthropic lanzó Claude for Government para agencias civiles en un entorno FedRAMP High; la prohibición del Pentágono sigue vigente en medio de una batalla legal.
Centros de datos orbitales. Google lanzó un satélite prototipo de computación orbital con TPU; Satlyt recaudó 8 millones de dólares para crear software para IA satelital, y se necesita Starship para escalar.
Fuga de capturas de agentes. Glow Security encontró más de 13.000 capturas de pantalla internas subidas por agentes de IA a repositorios públicos de GitHub, que exponían datos de clientes y credenciales.
Campaña de robo de razonamiento. OpenAI afirma que detuvo una campaña de destilación adversarial dirigida contra su razonamiento protegido; un truco similar seguía funcionando en Azure.
Eso es todo por hoy - una lectura de unos 5 minutos.