apache-tvm-ffi!=0.1.8,!=0.1.8.post0,<0.2,>=0.1.6
click
cuda-python>=12.0
cuda-tile>=1.4.0
einops
nccl4py>=0.3.1
ninja
numpy
nvidia-cudnn-frontend>=1.25.0
nvidia-cutlass-dsl>=4.6.2a0
nvidia-ml-py
packaging>=24.2
requests
tabulate
torch
tqdm

[cu12]
nvidia-cutlass-dsl>=4.6.2a0

[cu13]
nvidia-cutlass-dsl[cu13]>=4.6.2a0

[nvep]
