Frontera y grandes laboratorios
OpenAI impulsa la RSI. OpenAI afirma que ya ha logrado su objetivo de contar con un «becario de investigación automatizado»: sus agentes internos de codificación aceleran la investigación y algunos planes se han adelantado seis meses. En su ensayo, el director científico Jakub Pachocki presenta la automejora recursiva como central en la AGI. La compañía vincula el aumento de julio en el gasto en IA por investigador con el modelo que después lanzaría como GPT-6 Astra.
Agentes de seguridad de Figma. Figma ha construido agentes de IA sobre Panther SIEM para investigar alertas en AWS, Okta, GitHub, GCP y osquery, reduciendo en un 70 % el tiempo de resolución de las alertas complejas y en un 20 % los avisos de guardia, manteniendo la revisión humana.
Google libera Mantis. Google ha liberado Mantis, un framework de análisis de vulnerabilidades basado en agentes que combina agentes críticos/revisores y reproducción en sandbox para reducir los falsos positivos y las vulnerabilidades imaginarias en el análisis de código.
Inferencia local y hardware
Streaming de expertos en LayerStoRm. LayerStoRm, un motor experimental con licencia MIT, transmite de forma continua los expertos MoE desde la RAM del host a las GPU: ejecuta una versión cuantizada de GLM-5.3-Flash de 186 GiB a 24,5 tok/s en 96 GB de VRAM, con caché de prefijos para codificación con agentes.
Configuraciones con Radeon Pro R9700. La comunidad está madurando los montajes con la Radeon AI Pro R9700 de AMD: un sistema con dos R9700 y 64 GB de DDR5 ejecuta Qwen 3.8 27B en FP8/MXFP4 y Flash Next bajo vLLM, mientras los usuarios ya exploran 4xR9700 para el offloading de DeepSeek V4 Flash y Qwen 3.8 Flash.
Optimización de caché local. Una nueva herramienta de código abierto valida la retención anunciada de la caché KV bajo presión y muestra que los parches dedupe y boundfix pueden retener hasta el 146 % de la capacidad. Los usuarios también informan de que la caché f16 mejora la aceptación de MTP frente a Q8 en GPU antiguas.
Benchmarks y evaluación
Struggle Bench: autonomía y supervivencia. Un nuevo «Struggle Bench» le da a un modelo un servidor, un apartamento y una cuenta bancaria, y después puntúa cuántos meses puede pagar el alquiler y seguir funcionando sin recurrir a la ciberdelincuencia. Es una prueba de autonomía y supervivencia reales.
lm-eval-ledger: evaluación trazable. lm-eval-ledger ejecuta los benchmarks y guarda todo en SQLite; su aplicación web permite inspeccionar y comparar cómo respondieron los modelos a cada pregunta, en lugar de ver solo las cifras globales.
Benchmarks de código exigentes. Program-Bench, SRE-Bench y Code Migration desafían a los agentes a reconstruir binarios a partir de documentación, entender binarios reales sin código fuente y reimplementar programas en otro lenguaje; en conjunto, indagan en la capacidad de ingeniería de software en profundidad.
Legal y derechos de autor
Seattle Times y Newsday demandan. The Seattle Times y Newsday han demandado a OpenAI y Microsoft por infracción de derechos de autor. Piden la destrucción de los modelos de IA construidos a partir de sus obras y se suman a casi 400 periódicos locales que han presentado reclamaciones similares.
Disputa por acuerdo de Anthropic. Los autores denuncian que editoriales y agentes reclaman más de lo que les corresponde del acuerdo de derechos de autor de 1.500 millones de dólares alcanzado por Anthropic; también hay disputas por los derechos revertidos, en los que los autores deberían recibir el pago íntegro.
Seguridad y salvaguardas
Abliteration como servicio. La startup estadounidense Abliteration.ai vende acceso por API a modelos de pesos abiertos sin filtros de seguridad, como GLM-5.3, para red teaming y análisis de malware, y reduce así la barrera para el mal uso al eliminar los rechazos.
Variantes de Qwen sin censura. Una comparativa de ocho variantes de Qwen 3.8 27B sin censura situó a orcarouter como la de mayor ASR en HarmBench y a apostate como la más cercana a las capacidades base; eso sí, con rarezas de empaquetado, como la ausencia de visión y MTP en algunas versiones.
Debate sobre psicosis por IA. Los investigadores sostienen que los chatbots aduladores pueden reforzar delirios en una «cámara de eco de uno» y piden que se reconozca la «psicosis asociada a la IA», aunque sigue siendo discutible si merece un diagnóstico propio.
Lanzamientos de modelos e investigación
Spark-X2.5: modelos compactos. XHToken ha publicado Spark-X2.5-4B y Spark-X2.5-1.7B, unos modelos eficientes con contexto nativo de 1M tokens y compatibilidad con más de 200 idiomas; una PR en llama.cpp añade soporte para ellos.
WeatherNext 3 aprende de satélites. WeatherNext 3, de Google y DeepMind, prescinde de las simulaciones físicas y aprende directamente de los datos de satélite en tiempo real: genera pronósticos horarios con resolución de 5 km y mejora la precisión en la predicción de precipitaciones hasta en un 50 %.
Muse Voice Transcribe de Meta. Meta ha lanzado Muse Voice Transcribe, un modelo en tiempo real que divide el audio en fragmentos de 80 ms, transcribe el habla y distingue hasta 20 hablantes. Cuesta 0,18 dólares por hora y está disponible en más de 70 idiomas.
Lyria 3.5: música generativa. Google ha integrado Lyria 3.5 en Gemini y en sus API para generar música con voces expresivas, entrenado únicamente con datos con licencia.
Eso es todo por hoy - una lectura de unos 5 minutos.