CVE-2026-24271: TensorRT-LLM: sin límite de asignación GPU permite DoS

MEDIUM
Published July 14, 2026
CISO Take

TensorRT-LLM, el motor de inferencia LLM de NVIDIA, expone su API compatible con OpenAI sin límites ni throttling sobre la cantidad de recursos GPU que un cliente puede solicitar, permitiendo agotar VRAM y cómputo del servidor hasta provocar denegación de servicio para el resto de usuarios. El vector es local con complejidad baja y sin privilegios ni interacción de usuario (CVSS 6.2, AC:L/PR:N/UI:N), lo que la hace trivial de disparar para cualquier cliente que ya tenga acceso al endpoint; no hay EPSS calculado, no está en CISA KEV, y no existe exploit público ni plantilla Nuclei conocida, así que no hay evidencia de explotación activa hoy. El impacto real para un CISO es de disponibilidad, no de confidencialidad o integridad (C:N/I:N/A:H): en despliegues multi-tenant o de cara a clientes que sirven modelos vía TensorRT-LLM, un solo usuario (malicioso o simplemente un cliente mal implementado) puede degradar o tumbar el servicio de inferencia para todos los demás. Acción: revisar el changelog de NVIDIA TensorRT-LLM para identificar la versión con fix, y mientras tanto aplicar rate limiting y cuotas de memoria/cómputo por request o por usuario en el proxy/gateway delante del endpoint OpenAI-compatible, además de monitorizar picos de uso de VRAM u OOM en los logs del servidor de inferencia como señal temprana de abuso.

Sources: NVD ATLAS

What is the risk?

Severidad media (CVSS 6.2) con impacto exclusivo en disponibilidad. La explotabilidad técnica es alta — AC:L, PR:N, UI:N — pero el vector de ataque local limita la exposición a atacantes que ya tienen acceso a la API de inferencia (clientes autenticados, servicios internos con acceso de red, o multi-tenant compartiendo el mismo despliegue). No hay indicios de explotación activa (sin KEV, sin EPSS, sin exploit público ni scanner Nuclei), por lo que el riesgo inmediato es bajo pero la facilidad de explotación una vez hay acceso es alta — cualquier cliente puede convertirse en fuente de DoS sin necesidad de conocimiento especializado en IA/ML.

How does the attack unfold?

Acceso al endpoint
El atacante obtiene o ya posee acceso legítimo a la API de inferencia OpenAI-compatible de TensorRT-LLM (cliente interno, servicio multi-tenant o API key comprometida).
AML.T0040
Request de consumo intensivo
Envía una o varias requests diseñadas para maximizar el uso de GPU/memoria (contexto largo, batch elevado, generación extensa) sin que el servidor imponga límites.
AML.T0034.001
Agotamiento de recursos
TensorRT-LLM asigna recursos GPU sin throttling hasta saturar la capacidad disponible del servidor de inferencia.
AML.T0034
Denegación de servicio
El servicio de inferencia queda no disponible o severamente degradado para el resto de usuarios/tenants que comparten el despliegue.
AML.T0029

How severe is it?

CVSS 3.1
6.2 / 10
EPSS
0.2%
chance of exploitation in 30 days
Higher than 6% of all CVEs
Exploitation Status
No known exploitation
Sophistication
Trivial

What is the attack surface?

AV AC PR UI S C I A
AV Local
AC Low
PR None
UI None
S Unchanged
C None
I None
A High

What should I do?

1 step
  1. 1) Comprobar el changelog/security advisory de NVIDIA TensorRT-LLM y actualizar a la versión parcheada en cuanto esté disponible. 2) Como mitigación temporal, colocar un proxy o API gateway delante del endpoint OpenAI-compatible que imponga rate limiting, cuotas de tokens/memoria por cliente y timeouts agresivos. 3) Configurar límites de recursos a nivel de contenedor/orquestador (cgroups, límites de memoria GPU en Kubernetes/nvidia-docker) para acotar el blast radius de un proceso de inferencia individual. 4) Monitorizar métricas de utilización de VRAM, colas de requests y eventos OOM del servidor de inferencia para detectar patrones de abuso. 5) Si el servicio es multi-tenant, aislar cargas de trabajo por cliente (namespaces, réplicas dedicadas) para que un abuso no afecte a otros tenants.

How is it classified?

Which compliance frameworks are affected?

This CVE is relevant to:

ISO 42001
A.6.2.2 - Resource allocation for AI system operations
NIST AI RMF
MANAGE-4.1 - AI system availability and resilience monitoring
OWASP LLM Top 10
LLM10 - Unbounded Consumption

Frequently Asked Questions

What is CVE-2026-24271?

TensorRT-LLM, el motor de inferencia LLM de NVIDIA, expone su API compatible con OpenAI sin límites ni throttling sobre la cantidad de recursos GPU que un cliente puede solicitar, permitiendo agotar VRAM y cómputo del servidor hasta provocar denegación de servicio para el resto de usuarios. El vector es local con complejidad baja y sin privilegios ni interacción de usuario (CVSS 6.2, AC:L/PR:N/UI:N), lo que la hace trivial de disparar para cualquier cliente que ya tenga acceso al endpoint; no hay EPSS calculado, no está en CISA KEV, y no existe exploit público ni plantilla Nuclei conocida, así que no hay evidencia de explotación activa hoy. El impacto real para un CISO es de disponibilidad, no de confidencialidad o integridad (C:N/I:N/A:H): en despliegues multi-tenant o de cara a clientes que sirven modelos vía TensorRT-LLM, un solo usuario (malicioso o simplemente un cliente mal implementado) puede degradar o tumbar el servicio de inferencia para todos los demás. Acción: revisar el changelog de NVIDIA TensorRT-LLM para identificar la versión con fix, y mientras tanto aplicar rate limiting y cuotas de memoria/cómputo por request o por usuario en el proxy/gateway delante del endpoint OpenAI-compatible, además de monitorizar picos de uso de VRAM u OOM en los logs del servidor de inferencia como señal temprana de abuso.

Is CVE-2026-24271 actively exploited?

No confirmed active exploitation of CVE-2026-24271 has been reported, but organizations should still patch proactively.

How to fix CVE-2026-24271?

1) Comprobar el changelog/security advisory de NVIDIA TensorRT-LLM y actualizar a la versión parcheada en cuanto esté disponible. 2) Como mitigación temporal, colocar un proxy o API gateway delante del endpoint OpenAI-compatible que imponga rate limiting, cuotas de tokens/memoria por cliente y timeouts agresivos. 3) Configurar límites de recursos a nivel de contenedor/orquestador (cgroups, límites de memoria GPU en Kubernetes/nvidia-docker) para acotar el blast radius de un proceso de inferencia individual. 4) Monitorizar métricas de utilización de VRAM, colas de requests y eventos OOM del servidor de inferencia para detectar patrones de abuso. 5) Si el servicio es multi-tenant, aislar cargas de trabajo por cliente (namespaces, réplicas dedicadas) para que un abuso no afecte a otros tenants.

What systems are affected by CVE-2026-24271?

This vulnerability affects the following AI/ML architecture patterns: model serving, inference APIs.

What is the CVSS score for CVE-2026-24271?

CVE-2026-24271 has a CVSS v3.1 base score of 6.2 (MEDIUM). The EPSS exploitation probability is 0.16%.

What is the AI security impact?

Affected AI Architectures

model servinginference APIs

MITRE ATLAS Techniques

AML.T0029 Denial of AI Service
AML.T0034 Cost Harvesting
AML.T0034.001 Resource-Intensive Queries

Compliance Controls Affected

ISO 42001: A.6.2.2
NIST AI RMF: MANAGE-4.1
OWASP LLM Top 10: LLM10

What are the technical details?

Original Advisory

NVIDIA TensorRT-LLM contains a vulnerability in the OpenAI-compatible inference API, where an attacker could cause allocation of GPU resources without limits or throttling. A successful exploit of this vulnerability might lead to denial of service.

Exploitation Scenario

Un atacante con acceso legítimo o robado a la API de inferencia OpenAI-compatible (una API key de un cliente interno, o acceso a un servicio multi-tenant) envía una o varias requests diseñadas para maximizar el consumo de recursos GPU — por ejemplo, solicitando contextos extremadamente largos, batch sizes elevados o generaciones de salida muy extensas — sin que TensorRT-LLM imponga ningún límite ni throttling. El servidor asigna memoria y cómputo GPU sin control hasta agotar los recursos disponibles, provocando que las requests legítimas de otros usuarios fallen o se degraden severamente, efectivamente tumbando el servicio de inferencia compartido.

Weaknesses (CWE)

CWE-770 — Allocation of Resources Without Limits or Throttling: The product allocates a reusable resource or group of resources on behalf of an actor without imposing any intended restrictions on the size or number of resources that can be allocated.

  • [Requirements] Clearly specify the minimum and maximum expectations for capabilities, and dictate which behaviors are acceptable when resource allocation reaches limits.
  • [Architecture and Design] Limit the amount of resources that are accessible to unprivileged users. Set per-user limits for resources. Allow the system administrator to define these limits. Be careful to avoid CWE-410.

Source: MITRE CWE corpus.

CVSS Vector

CVSS:3.1/AV:L/AC:L/PR:N/UI:N/S:U/C:N/I:N/A:H

Timeline

Published
July 14, 2026
Last Modified
July 15, 2026
First Seen
July 14, 2026

Related Vulnerabilities