Investigadores académicos han revelado un ataque Rowhammer que afecta a GPU de estación de trabajo NVIDIA con memoria GDDR6 y que supera los códigos de corrección de errores (ECC), la mitigación que NVIDIA recomienda contra Rowhammer en GPU. El ataque, denominado GPUThor, permite ataques de denegación de servicio y escalada de privilegios hasta obtener una shell root en el host.

El ataque fue desarrollado por investigadores de la Universidad de Toronto, quienes martillaron cuatro bancos de memoria DRAM durante 24 horas cada uno en cuatro tarjetas de la clase Ampere, induciendo bit flips en cada una. Las GPU probadas y consideradas vulnerables incluyen RTX A6000 (48 GB GDDR6), RTX A5000 (24 GB GDDR6), RTX A4500 (20 GB GDDR6) y RTX A4000 (16 GB GDDR6).

Para montar el ataque se requiere la capacidad de lanzar un kernel CUDA sin privilegios en la GPU objetivo, ya sea como co-inquilino en una tarjeta compartida o como código no confiable en una máquina de un solo inquilino. Los investigadores aconsejan evitar el uso compartido de GPU entre inquilinos, monitorear los contadores de errores ECC y restringir las cargas de trabajo CUDA no confiables.

En un aviso de seguridad de julio de 2026, NVIDIA señaló que los investigadores de la Universidad de Toronto demostraron una explotación exitosa de Rowhammer en una GPU NVIDIA A6000 con memoria GDDR6 cuando el ECC a nivel de sistema no estaba habilitado. En el mismo documento, mostraron que habilitar el ECC a nivel de sistema mitiga el problema. Este aviso siguió a GPUHammer, el trabajo anterior del mismo equipo y el primer ataque Rowhammer en GPU demostrado en hardware NVIDIA, que produjo 16 bit flips por gigabyte en una RTX A6000 y fue neutralizado una vez que se habilitó el ECC.

Lo que añade GPUThor es el martilleo no uniforme, donde la fila agresora adyacente a la víctima se activa con mucha más frecuencia que las filas señuelo utilizadas para saturar la defensa de Refresco de Filas Objetivo (TRR). Los ataques anteriores a GPU activaban filas agresoras y señuelo aproximadamente a la misma velocidad.

Los investigadores descubrieron que los accesos repetidos emitidos dentro de un solo warp (el grupo de 32 hilos que una GPU ejecuta en sincronía) se fusionan en el controlador de memoria en una sola activación de DRAM. Sin embargo, los accesos emitidos desde diferentes warps a diferentes líneas de caché dentro de la misma fila sobreviven como activaciones separadas, y los kernels de martilleo los distribuyen en consecuencia. También informaron que el TRR en estas memorias GDDR6 probablemente se aplica aproximadamente una vez cada 72 intervalos de refresco en lugar de una vez por intervalo, y construyeron un patrón de seis intervalos basado en ese horario.

En las cuatro tarjetas, las campañas produjeron de 72,000 a 377,000 bit flips por gigabyte con ECC deshabilitado. La RTX A5000 fue la más susceptible, con 377,552 flips por gigabyte, lo que representa 23,597 veces los 16 flips por gigabyte de GPUHammer y aproximadamente 500 veces los 758 flips por gigabyte reportados para GDDRHammer, el ataque Rowhammer en GPU más fuerte anterior. El documento sitúa la tasa de la A5000 cerca de los aproximadamente 550,000 flips por gigabyte alcanzados por Blacksmith, que estableció el martilleo no uniforme en DDR4 como una ruta para superar las defensas dentro de la DRAM.

Con una granularidad de 16 bytes, las campañas produjeron 387 flips de doble bit y dos flips de triple bit en las cuatro tarjetas con ECC deshabilitado, siendo la A5000 responsable de 306 de los flips de doble bit y ambos flips de triple bit. El ECC de un solo error corregido y doble error detectado (SECDED) en estas GPU corrige un bit volteado en un bloque protegido y detecta dos, pero los investigadores encontraron que corrige erróneamente tres, lo que resulta en corrupción silenciosa de datos (SDC).

Con ECC habilitado en una RTX A6000 de propiedad local, un banco de martilleo produjo 11 errores detectables e incorregibles (DUE) y un SDC durante un día, un promedio de un DUE cada dos horas. Cada DUE aborta todos los kernels que se ejecutan en la tarjeta, dejándola inutilizable hasta un reinicio.

Para la escalada de privilegios, los investigadores reutilizaron el código de explotación de GPUBreach, su investigación anterior sobre escalada de privilegios mediante tablas de páginas en GPU. Primero preparan las tablas de páginas para que queden en una fila vulnerable, luego martillan las filas vecinas para corromper el número de marco de página de una entrada. Un segundo kernel accede a memoria fuera del proceso a través de la entrada manipulada.

Usando el SDC de triple bit, los investigadores obtuvieron acceso root en el host con IOMMU habilitado. Usando un DUE de doble bit, lograron escalada de privilegios en el host en sistemas donde IOMMU está deshabilitado. Una entrada de tabla de páginas se redirige a memoria de la CPU y luego se sobrescribe la estructura de credenciales del proceso.

"Además, descubrimos que incluso los DUE de doble bit son explotables, ya que los DUE se manejan de manera perezosa en las GPU NVIDIA, dejando una ventana de tiempo de aproximadamente 10 ms entre la detección del DUE y la eliminación de la GPU, durante la cual el kernel del atacante consume los datos corruptos", dijeron los investigadores.

Localizar errores de múltiples bits explotables sin activar un DUE tomó unos cuatro días en la A6000. Una escalada de privilegios de extremo a extremo que tomó 21.9 horas en esa tarjeta se completó en 1.1 minutos con los patrones de GPUThor. Los mismos patrones no produjeron bit flips en otras GPU NVIDIA probadas, incluyendo A10, L4 y L40 con GDDR6, RTX 4090 con GDDR6X y A30 con HBM2e.

Los investigadores también probaron otros tipos de memoria, como HBM, GDDR6X y GDDR6 de generación más nueva en GPU NVIDIA, y no observaron bit flips en ellas. Esto probablemente se deba a implementaciones de TRR diferentes en estas memorias en comparación con las GPU A4000-A6000. Las GPU A100 y H100 quedaron fuera del conjunto probado.

Las GPU Ampere de clase servidor y las más nuevas incluyen Contención de Errores y Desconexión Dinámica de Páginas, que confinan una falla a la aplicación que la desencadena, pero aún dependen del ECC a nivel SECDED, y los investigadores dijeron que una escalada basada en SDC podría funcionar contra ellas. La Reparación RAS en algunas GPU Blackwell hace que la ruta basada en DUE consuma más tiempo sin prevenirla.

GPUThor fue reportado a NVIDIA el 29 de abril de 2026 y a Google, Microsoft y AWS. Los hallazgos estuvieron sujetos a un embargo que duró hasta el 25 de agosto de 2026. NVIDIA publicó un aviso de seguridad con orientación. GPUThor no tiene identificador CVE y no se ha reportado explotación en la naturaleza hasta el 27 de agosto de 2026. No hay parche que aborde el ataque, y los investigadores dijeron que una solución completa requeriría corrección de errores de múltiples bits más fuerte y defensas dentro de la DRAM, como Gestión de Refresco o Conteo de Activación por Fila, en futuras GPU.

El código del ataque se publicará el 15 de noviembre de 2026, día de apertura de la Conferencia ACM sobre Seguridad Informática y Comunicaciones (ACM CCS), donde se presentará el documento. The Hacker News contactó a NVIDIA para comentar si el ECC sigue siendo una mitigación suficiente y a los investigadores de la Universidad de Toronto para obtener más detalles; ninguno había respondido al momento de la publicación.

"Usamos estos métodos para bloquear GPU y escalar privilegios con ECC habilitado. El ECC sigue elevando el listón y vale la pena habilitarlo, pero ya no puede considerarse una defensa suficiente", dijeron los investigadores en el sitio del proyecto GPUThor.
Cybersecurity
Cybersecurity
Cybersecurity
Cybersecurity