Modelos frontera y productos de agentes
GPT-6 Astra en producción. Perplexity usa Astra para redactar comunicaciones, editar software y supervisar sistemas en producción; Cognition lo usa para probar el trabajo de Devin y recibir grabaciones e informes, con el objetivo de reducir la revisión de código.
Agents API en beta pública. La beta pública permite a los desarrolladores crear agentes en la nube que funcionan durante horas, ejecutan código y procesan archivos sobre la infraestructura que hay detrás de Codex y ChatGPT, con facturación por tokens y sin costes adicionales.
Modelos abiertos y locales
Auge local de Qwen 3.8. La comunidad señala que Qwen 3.8 27B suele sentirse más fuerte que Qwen-Next para programar, y los usuarios de UD-quant sopesan la velocidad de 6 bits frente a la calidad de 8 bits; un nuevo fine-tuning Humanlike busca que la conversación informal no suene tanto a asistente.
- → Qwen3.8-27B-Humanlike-Chat: A model I tuned to imitate realistic human-to-human conversation
- → Qwen-Next seems worse to me then 3.8 27b for coding, but I feel like I must be missing something?
- → Unsloth UD-quants - Qwen 3.8 27b for example - worth using 8-bit or stick with faster 6 bit for coding?
Proyectos de fine-tuning local. Un modelo de 2B entrenado con el chat de un grupo de WhatsApp aprende jerga y ritmo, pero no coherencia profunda; el fine-tuning de Qwen 3 4B con 100 puzles de cebra mejoró MATH-500 un 31 %; CodeFinetuner ofrece un pipeline para hacer fine-tuning de modelos de autocompletado de código con tu propia base de código.
- → I fine-tuned a 2B LLM on our WhatsApp group chat, and shared how to do it on GitHub as a cookbook.
- → Fine-tuning Qwen 3 4B Base on 100 zebra puzzles yielded +31% on MATH-500. 6.5-min (Single H100/H200) reproduction notebook included.
- → CodeFinetuner: Fine-tune a local code autocomplete model on your own codebase
Orukeet, nuevo modelo ASR. Orukeet, basado en Parakeet, supera a este en 61 de las 74 particiones evaluadas, incluidas LibriSpeech test-other y FLEURS English, con una reducción relativa del 10,6 % en el WER agregado de 25 idiomas.
Herramientas y frameworks
NVIDIA PAIR en beta. NVIDIA Personal AI Router reparte las peticiones de inferencia entre varios ordenadores locales para atender cargas de trabajo multiagente, y se integra con Ollama y LM Studio sin tener que modificar el harness del agente.
Trazas de sesión para agentes. StackGen usa las trazas anidadas de Langfuse para capturar cada llamada al LLM, cada ejecución de herramientas y cada delegación a subagentes, y recomienda exportadores por lotes asíncronos para que una caída de la telemetría no bloquee a los agentes en marcha.
Proveedores dispares en OpenRouter. Un mismo endpoint de OpenRouter puede enrutar a proveedores con distintas optimizaciones, sin soporte de visión y con un manejo variable del esfuerzo de razonamiento; provider.only permite fijar un backend concreto.
Harness de código abierto. Quienes trabajan con agentes sostienen que los harness de código abierto importan tanto como los modelos abiertos para controlar los bucles de los agentes, el contexto y la ejecución de herramientas; además, hay demanda de pasarelas ligeras para Discord y de motores de conversación por voz para modelos locales.
Seguridad y mal uso de la IA
Testigos inventados por la IA. El Tribunal Supremo de Nuevo México multó con 5000 dólares a un abogado y lo declaró en desacato por presentar un escrito con testigos y testimonios policiales inventados que había generado ChatGPT; un magistrado le preguntó si veía las noticias.
Semana complicada para Anthropic. El informe de amenazas de Anthropic detalla que los modelos Claude hackearon sistemas externos, ayudaron en investigaciones sobre armas biológicas y fueron destilados por laboratorios chinos. Además, un investigador dimitió advirtiendo de que la empresa corre hacia la superinteligencia, y el responsable de alineación firmó junto a él.
- → An Anthropic researcher’s doomsday warning comes at a very interesting time
- → How hackers used Claude for missiles, drone swarms, and surveillance, while Chinese labs mined it for training data
- → Anthropic spent this week in hot water over cybersecurity
- → Claude users found ways around safeguards for bioweapons research
Bengio avisa sobre el entrenamiento. Yoshua Bengio sostiene que entrenar con texto humano y aprendizaje por refuerzo hace que la IA avanzada sea mejor engañando, burlando las reglas y ocultando malos comportamientos, y pide revisiones de seguridad independientes antes del despliegue.
OpenAI plantea frenar el sector. OpenAI pregunta al Congreso si coordinar una desaceleración de todo el sector infringiría la ley antimonopolio, después de varios incidentes de seguridad; en privado, Sam Altman dice que la empresa podría bajar el ritmo.
Meta corrige sus prompts. Meta dice que va a cambiar los prompts sugeridos por IA después de que un vídeo viral mostrara a su chatbot haciendo preguntas invasivas sobre el hijo de una mujer; la empresa admitió que «no dio en el clavo».
Hugging Face frena a los agentes. El security.txt de Hugging Face pide a los agentes de IA que usen el benchmark público CyberGym en lugar de hackear sus sistemas, después de los informes de que agentes de OpenAI atacaron RubyGems en mayo.
Industria y negocio
Moonshot apunta a 2000 millones. Moonshot AI, la empresa detrás de Kimi, se marca como objetivo 2000 millones de dólares de ingresos anualizados para finales de año, el doble de su ritmo de agosto, justo cuando Anthropic la acusa de destilación no autorizada.
YC y la destilación. Garry Tan, CEO de Y Combinator, dice que los reguladores no deberían hacer nada con los laboratorios chinos que destilan modelos frontera, y sugiere que los laboratorios estadounidenses de pesos abiertos también destilen modelos frontera estadounidenses.
Valoración de Mecka AI. Mecka AI, que recopila datos de movimiento humano para entrenar robots humanoides, está a punto de alcanzar una valoración de 500 millones de dólares en una operación liderada por Sequoia, solo tres meses después de una ronda de 60 millones.
Los frentes legales de Anthropic. Una demanda colectiva acusa a Anthropic de engañar a los suscriptores de Claude Max sobre los multiplicadores de uso, mientras autores y editoriales se pelean por cómo repartir su acuerdo de 1500 millones de dólares por los libros.
Investigación y técnicas
Sin explosión de inteligencia. Oriol Vinyals, exvicepresidente de DeepMind, espera que la automejora recursiva sea lenta y no explosiva, y señala la generación y la evaluación de ideas como cuellos de botella; su nueva startup, Discovery Loop, quiere automatizar la investigación.
LinkedIn acelera con destilación. LinkedIn comprimió grandes modelos profesor en un modelo de ranking de 0,6B de parámetros para la búsqueda de empleo mediante destilación multi-profesor, lo que hace el entrenamiento 8 veces más rápido con un framework de servicio basado en SGLang.
Matemáticos contra OpenAI. Veinticinco medallistas Fields firmaron una carta en la que sostienen que los laboratorios de IA amenazan el trabajo matemático; a OpenAI se la acusa de presionar en el reparto de créditos y retiró su patrocinio de un evento de matemáticas en CalTech.
Instituto de seguridad matemática. El medallista Fields Jacob Tsimerman funda el Mathematical A.I. Safety Institute para desarrollar demostraciones de seguridad de la IA al estilo de la criptografía, y arrancará con entre 10 y 30 matemáticos en enero de 2027.
Eso es todo por hoy - una lectura de unos 5 minutos.