LICENSE
README.md
__init__.py
batch.py
cli.py
fused_engine.py
pyproject.toml
quantized_engine.py
server.py
setup.py
streaming.py
./__init__.py
./batch.py
./cli.py
./fused_engine.py
./quantized_engine.py
./server.py
./setup.py
./streaming.py
./backends/metal/kernels.metal
./csrc/cuda_kernels.cu
./csrc/cuda_wrapper.cpp
./csrc/dequant_cpu.cpp
./csrc/dequantize.cu
./csrc/fast_kernels.cpp
./csrc/fused_quantized.cpp
./csrc/fused_transformer.cpp
./csrc/ggml_kernels.cpp
./csrc/kernels.h
./csrc/llamacpp_kernels.cpp
./csrc/quantized_matmul.cu
./csrc/torch_bindings.cpp
backends/__init__.py
backends/base.py
backends/ops.py
backends/cann/__init__.py
backends/cann/backend.py
backends/cann/setup_cann.py
backends/cpu/__init__.py
backends/cpu/backend.py
backends/cpu/kernels.py
backends/cuda/__init__.py
backends/cuda/backend.py
backends/metal/__init__.py
backends/metal/backend.py
backends/metal/compile_shaders.py
backends/metal/kernels.metal
backends/metal/metal_ops.py
core/__init__.py
core/parser.py
core/quantization.py
core/tensor.py
csrc/cuda_kernels.cu
csrc/cuda_wrapper.cpp
csrc/dequant_cpu.cpp
csrc/dequantize.cu
csrc/fast_kernels.cpp
csrc/fused_quantized.cpp
csrc/fused_transformer.cpp
csrc/ggml_kernels.cpp
csrc/kernels.h
csrc/llamacpp_kernels.cpp
csrc/quantized_matmul.cu
csrc/setup_cpu.py
csrc/setup_cuda.py
csrc/setup_fast.py
csrc/setup_fused.py
csrc/setup_ggml.py
csrc/setup_llamacpp.py
csrc/setup_quantized.py
csrc/torch_bindings.cpp
examples/usage_example.py
model/__init__.py
model/architectures.py
model/attention.py
model/engine.py
model/ffn.py
model/layers.py
model/transformer.py
quicksilver_inference.egg-info/PKG-INFO
quicksilver_inference.egg-info/SOURCES.txt
quicksilver_inference.egg-info/dependency_links.txt
quicksilver_inference.egg-info/entry_points.txt
quicksilver_inference.egg-info/requires.txt
quicksilver_inference.egg-info/top_level.txt
scheduler/__init__.py
scheduler/batch.py
scheduler/kv_cache.py
tests/test_engine.py
tests/test_parser.py