CVE-2026-24271: TensorRT-LLM: sin límite de asignación GPU permite DoS
MEDIUMTensorRT-LLM, el motor de inferencia LLM de NVIDIA, expone su API compatible con OpenAI sin límites ni throttling sobre la cantidad de recursos GPU que un cliente puede solicitar, permitiendo agotar VRAM y cómputo del servidor hasta provocar denegación de servicio para el resto de usuarios. El vector es local con complejidad baja y sin privilegios ni interacción de usuario (CVSS 6.2, AC:L/PR:N/UI:N), lo que la hace trivial de disparar para cualquier cliente que ya tenga acceso al endpoint; no hay EPSS calculado, no está en CISA KEV, y no existe exploit público ni plantilla Nuclei conocida, así que no hay evidencia de explotación activa hoy. El impacto real para un CISO es de disponibilidad, no de confidencialidad o integridad (C:N/I:N/A:H): en despliegues multi-tenant o de cara a clientes que sirven modelos vía TensorRT-LLM, un solo usuario (malicioso o simplemente un cliente mal implementado) puede degradar o tumbar el servicio de inferencia para todos los demás. Acción: revisar el changelog de NVIDIA TensorRT-LLM para identificar la versión con fix, y mientras tanto aplicar rate limiting y cuotas de memoria/cómputo por request o por usuario en el proxy/gateway delante del endpoint OpenAI-compatible, además de monitorizar picos de uso de VRAM u OOM en los logs del servidor de inferencia como señal temprana de abuso.
What is the risk?
Severidad media (CVSS 6.2) con impacto exclusivo en disponibilidad. La explotabilidad técnica es alta — AC:L, PR:N, UI:N — pero el vector de ataque local limita la exposición a atacantes que ya tienen acceso a la API de inferencia (clientes autenticados, servicios internos con acceso de red, o multi-tenant compartiendo el mismo despliegue). No hay indicios de explotación activa (sin KEV, sin EPSS, sin exploit público ni scanner Nuclei), por lo que el riesgo inmediato es bajo pero la facilidad de explotación una vez hay acceso es alta — cualquier cliente puede convertirse en fuente de DoS sin necesidad de conocimiento especializado en IA/ML.
How does the attack unfold?
How severe is it?
What is the attack surface?
What should I do?
1 step-
1) Comprobar el changelog/security advisory de NVIDIA TensorRT-LLM y actualizar a la versión parcheada en cuanto esté disponible. 2) Como mitigación temporal, colocar un proxy o API gateway delante del endpoint OpenAI-compatible que imponga rate limiting, cuotas de tokens/memoria por cliente y timeouts agresivos. 3) Configurar límites de recursos a nivel de contenedor/orquestador (cgroups, límites de memoria GPU en Kubernetes/nvidia-docker) para acotar el blast radius de un proceso de inferencia individual. 4) Monitorizar métricas de utilización de VRAM, colas de requests y eventos OOM del servidor de inferencia para detectar patrones de abuso. 5) Si el servicio es multi-tenant, aislar cargas de trabajo por cliente (namespaces, réplicas dedicadas) para que un abuso no afecte a otros tenants.
How is it classified?
Which compliance frameworks are affected?
This CVE is relevant to:
Frequently Asked Questions
What is CVE-2026-24271?
TensorRT-LLM, el motor de inferencia LLM de NVIDIA, expone su API compatible con OpenAI sin límites ni throttling sobre la cantidad de recursos GPU que un cliente puede solicitar, permitiendo agotar VRAM y cómputo del servidor hasta provocar denegación de servicio para el resto de usuarios. El vector es local con complejidad baja y sin privilegios ni interacción de usuario (CVSS 6.2, AC:L/PR:N/UI:N), lo que la hace trivial de disparar para cualquier cliente que ya tenga acceso al endpoint; no hay EPSS calculado, no está en CISA KEV, y no existe exploit público ni plantilla Nuclei conocida, así que no hay evidencia de explotación activa hoy. El impacto real para un CISO es de disponibilidad, no de confidencialidad o integridad (C:N/I:N/A:H): en despliegues multi-tenant o de cara a clientes que sirven modelos vía TensorRT-LLM, un solo usuario (malicioso o simplemente un cliente mal implementado) puede degradar o tumbar el servicio de inferencia para todos los demás. Acción: revisar el changelog de NVIDIA TensorRT-LLM para identificar la versión con fix, y mientras tanto aplicar rate limiting y cuotas de memoria/cómputo por request o por usuario en el proxy/gateway delante del endpoint OpenAI-compatible, además de monitorizar picos de uso de VRAM u OOM en los logs del servidor de inferencia como señal temprana de abuso.
Is CVE-2026-24271 actively exploited?
No confirmed active exploitation of CVE-2026-24271 has been reported, but organizations should still patch proactively.
How to fix CVE-2026-24271?
1) Comprobar el changelog/security advisory de NVIDIA TensorRT-LLM y actualizar a la versión parcheada en cuanto esté disponible. 2) Como mitigación temporal, colocar un proxy o API gateway delante del endpoint OpenAI-compatible que imponga rate limiting, cuotas de tokens/memoria por cliente y timeouts agresivos. 3) Configurar límites de recursos a nivel de contenedor/orquestador (cgroups, límites de memoria GPU en Kubernetes/nvidia-docker) para acotar el blast radius de un proceso de inferencia individual. 4) Monitorizar métricas de utilización de VRAM, colas de requests y eventos OOM del servidor de inferencia para detectar patrones de abuso. 5) Si el servicio es multi-tenant, aislar cargas de trabajo por cliente (namespaces, réplicas dedicadas) para que un abuso no afecte a otros tenants.
What systems are affected by CVE-2026-24271?
This vulnerability affects the following AI/ML architecture patterns: model serving, inference APIs.
What is the CVSS score for CVE-2026-24271?
CVE-2026-24271 has a CVSS v3.1 base score of 6.2 (MEDIUM). The EPSS exploitation probability is 0.16%.
What is the AI security impact?
Affected AI Architectures
MITRE ATLAS Techniques
AML.T0029 Denial of AI Service AML.T0034 Cost Harvesting AML.T0034.001 Resource-Intensive Queries Compliance Controls Affected
What are the technical details?
Original Advisory
NVIDIA TensorRT-LLM contains a vulnerability in the OpenAI-compatible inference API, where an attacker could cause allocation of GPU resources without limits or throttling. A successful exploit of this vulnerability might lead to denial of service.
Exploitation Scenario
Un atacante con acceso legítimo o robado a la API de inferencia OpenAI-compatible (una API key de un cliente interno, o acceso a un servicio multi-tenant) envía una o varias requests diseñadas para maximizar el consumo de recursos GPU — por ejemplo, solicitando contextos extremadamente largos, batch sizes elevados o generaciones de salida muy extensas — sin que TensorRT-LLM imponga ningún límite ni throttling. El servidor asigna memoria y cómputo GPU sin control hasta agotar los recursos disponibles, provocando que las requests legítimas de otros usuarios fallen o se degraden severamente, efectivamente tumbando el servicio de inferencia compartido.
Weaknesses (CWE)
CWE-770 Allocation of Resources Without Limits or Throttling
Primary
CWE-770 Allocation of Resources Without Limits or Throttling CWE-770 — Allocation of Resources Without Limits or Throttling: The product allocates a reusable resource or group of resources on behalf of an actor without imposing any intended restrictions on the size or number of resources that can be allocated.
- [Requirements] Clearly specify the minimum and maximum expectations for capabilities, and dictate which behaviors are acceptable when resource allocation reaches limits.
- [Architecture and Design] Limit the amount of resources that are accessible to unprivileged users. Set per-user limits for resources. Allow the system administrator to define these limits. Be careful to avoid CWE-410.
Source: MITRE CWE corpus.
CVSS Vector
CVSS:3.1/AV:L/AC:L/PR:N/UI:N/S:U/C:N/I:N/A:H Timeline
Related Vulnerabilities
CVE-2026-33660 10.0 TensorFlow: type confusion NPD in tensor conversion
Same attack type: DoS CVE-2022-35939 9.8 TensorFlow: ScatterNd OOB write enables RCE/crash
Same attack type: DoS CVE-2022-41900 9.8 TensorFlow: heap OOB RCE in FractionalMaxPool op
Same attack type: DoS CVE-2022-23587 9.8 TensorFlow: integer overflow in Grappler enables RCE
Same attack type: DoS CVE-2023-25668 9.8 TensorFlow: unauthenticated RCE via heap buffer overflow
Same attack type: DoS