Lanzamientos de modelos y agentes
Grok 4.6 y Grok Bot. SpaceXAI lanzó Grok 4.6, que iguala a GPT-5.6 Sol de OpenAI y solo queda detrás de Claude Opus 5 en el índice de Artificial Analysis mientras rebaja los precios de vanguardia, e introdujo Grok Bot, un compañero de IA siempre activo que trabaja desde su propia computadora en la nube para completar tareas asignadas.
Qwen 3.8 grande y pequeño. Qwen3.8-2.4T-A95B ya está disponible, y una página de Qwen3.8 de 27B apareció brevemente en ModelScope antes de ser retirada, lo que indica un lanzamiento a corto plazo. Los entusiastas de la ejecución local ya están planeando divisiones de hardware para el modelo de 2.4T.
Actualización de DeepSeek V4 Pro. El V4 Pro 0813 de DeepSeek está disponible vía API en OpenRouter, sin página de anuncio oficial por ahora; es probable que los pesos abiertos se den tras lanzamientos anteriores. Su comportamiento de razonamiento difiere notablemente entre niveles de razonamiento bajo, medio y alto.
Modelos de visión de borde. El LFM2.5-VL-3B de Liquid AI ofrece un anclaje de interfaz de usuario mucho más fuerte y puede ejecutarse en teléfonos, mientras que North Micro Vision de Cohere, bajo licencia Apache-2.0, ofrece soporte de imagen en resolución nativa en un paquete compacto de 2.4 mil millones de parámetros.
El modelo de billón de parámetros de Nvidia. Se informa que Nvidia está construyendo Nemotron 4 con al menos un billón de parámetros y triplicando el gasto en entrenamiento en la nube a 28 mil millones de dólares hasta 2031, con el objetivo de competir con los modelos chinos de pesos abiertos.
Desarrollo de agentes y herramientas
Agentes gestionados y BYOC. LangChain lanzó Managed Deep Agents como el siguiente paso después de los marcos de trabajo, e hizo que LangSmith BYOC esté disponible de forma general en AWS, permitiendo a las empresas mantener los rastros de agentes y los datos dentro de su propia VPC.
Aplicación de ChatGPT en Linux. OpenAI lanzó una aplicación de escritorio para Linux que incluye ChatGPT, ChatGPT Work y Codex, pero el uso nativo de la computadora no está disponible en el lanzamiento.
Inferencia local y hardware
El precio de la RTX PRO 6000 se duplicó. Nvidia casi duplicó el precio de lista de la RTX PRO 6000 Blackwell de 96GB a 16,000 dólares, después de que los pedidos anticipados estuvieran por debajo de 8,000 dólares el año pasado.
DSpark en streaming en una sola GPU. Una sola RTX PRO 6000 de 96GB puede ejecutar DeepSeek V4 Flash 284B a unos 31 tokens por segundo con el borrador de DSpark en la RAM del sistema, aproximadamente 15-17% más rápido que la línea base sin borrador con el mismo uso de VRAM.
Muse Glimmer en Mac. El Muse Glimmer 30B de Meta ahora se ejecuta hasta 3.3 veces más rápido en Apple Silicon usando mlx-dspark, ofreciendo calidad de 8 bits a velocidades cercanas a 4 bits en una Mac de 48GB.
Cuantización de caché KV de Gemma 4. El entrenamiento consciente de la cuantización ayuda a Gemma 4 31B a mantener la calidad bajo una cuantización agresiva de caché KV, haciendo más práctica la inferencia de contexto amplio.
Industria y negocios
Cognition recauda a $40 mil millones. Se informa que Cognition, fabricante de agentes de codificación de IA, está en conversaciones para recaudar fondos con una valoración de 40 mil millones de dólares después de alcanzar una tasa de ingresos anualizados de mil millones de dólares, frente a 492 millones hace tres meses.
Lovable alcanza los $13.3 mil millones. La startup de vibe-coding Lovable recaudó 400 millones de dólares con una valoración de 13.3 mil millones después de superar los 500 millones en ingresos anualizados, con 60 millones de proyectos alojados.
IA empresarial de Thrive Holdings. Thrive Holdings, respaldada por OpenAI, recaudó 2 mil millones de dólares con una valoración de 12 mil millones para adquirir negocios tradicionales e implementar IA, expandiéndose más allá de la contabilidad y TI.
La cuota de Gemini cae. Los datos de mercado de Pangram, OpenRouter y Similarweb muestran que el uso de Gemini está disminuyendo, con Pangram registrando una caída al 1.9% de la escritura con IA, mientras que OpenAI mantiene más del 50%.
Claude se adentra en el ámbito legal. Anthropic contrató al fundador de IA legal Robert Mahari como su primer Jefe de Claude para Legal, basándose en complementos y asociaciones legales anteriores.
Política, seguridad y sociedad
Fuga en la cadena de suministro de LiteLLM. Un ataque a la cadena de suministro de LiteLLM expuso terabytes de credenciales de más de 2,500 organizaciones, incluyendo Microsoft, Amazon y Samsung, a través de paquetes maliciosos de PyPI.
Marcas de agua en las salidas de Claude. Anthropic ahora añade marcas de agua a las salidas de Claude para cumplir con la Ley de IA de la UE, molestando a los usuarios que se preocupan de que revele el uso de IA en trabajos o estudios.
Twitch opta por el entrenamiento por defecto. Twitch entrenará los modelos de IA de Amazon con el contenido de los streamers por defecto, con una opción de exclusión ahora disponible; la política ha provocado reacciones negativas.
ShieldFont reemplaza el texto. Los diseñadores lanzaron ShieldFont, una fuente que muestra texto normal a los usuarios pero sustituye palabras en el HTML subyacente para envenenar a los scrapers.
Hinton, Li y Ng sobre IA abierta. En Ai4, Geoffrey Hinton, Fei-Fei Li y Andrew Ng argumentaron a favor de mantener la IA abierta para evitar que unas pocas empresas controlen el acceso, a pesar de las preocupaciones de seguridad sobre los pesos abiertos.
Libros raros destruidos. Los libreros temen que las empresas de IA estén comprando libros raros y destruyéndolos para entrenamiento, a pesar de las alternativas de escaneo no destructivo.
Investigación y puntos de referencia
Razonamiento topológico de MindTopo. El punto de referencia MindTopo de Microsoft Research muestra que los modelos multimodales son buenos en el reconocimiento topológico estático, pero tienen dificultades con la planificación interactiva que requiere mantener relaciones a lo largo del tiempo.
Prompts reconstruidos a partir de la salida. IIT Bombay y Adobe Research desarrollaron Previous-Token Prediction, que puede reconstruir los prompts de LLM a partir del texto de salida con una precisión casi perfecta sin pesos del modelo.
Eso es todo por hoy - una lectura de unos 5 minutos.