m-accuracy-size-latency-table-across-modes
m-amx-expected-but-ref-fallback-root-cause
m-analytically-compare-prune-then-quantize-vs-quantize
m-artifact-matrix-size
m-classify-a-deserialization-error
m-classify-a-kernel-as-compute-bound-or-memory-bound-f
m-classify-a-kernel-as-compute-memory-bound-from-ai-an
m-classify-compute-memory-occupancy-bound-kernels-from
m-classify-slo-violations-into-queueing-long-prefill-l
m-compare-cprofile-instrumentation-overhead-vs-py-spy-
m-column-row-parallel-matmul-from-scratch
m-compare-export-s-flat-latency-vs-torch-compile-s-rec
m-compare-fused-vs-unfused-wall-time-from-a-recorded-d
m-compare-gpu-utilization-between-two-real-nsys-captur
m-compare-float64-forced-cpu-vs-float32-on-mps-for-the
m-compare-hidden-state-mse-vs-cosine-loss-training-sta
m-compare-ollama-side-requantization-against-llama-qua
m-compare-real-memory-of-eager-vs-sdpa-attention-on-th
m-compare-relay-ir-node-count-vs-relax-ir-node-count-f
m-compare-sparsegpt-style-vs-wanda-vs-magnitude-prunin
m-compare-throughput-of-256-single-calls-versus-one-ba
m-compare-tvm-compiled-cpu-latency-vs-pytorch-eager-cp
m-compare-torch-compile-graph-break-vs-torch-export-ha
m-compute-per-slot-context-from-np-and-c
m-compute-per-token-kv-cache-bytes-from-config-json-gq
m-compute-prefill-flops-per-token-attention-mlp-from-c
m-count-eqns-and-list-unique-primitives-in-a-grad-jit-
m-count-aten-ops-and-identify-decompositions-in-an-exp
m-derive-expected-accepted-tokens-per-target-forward
m-derive-per-layer-activation-memory-formula-for-given
m-derive-per-rank-parameter-shard-size-under-full-shar
m-derive-the-fp16-cancellation-error-of-e-x-2-e-x-2-vs
m-derive-the-minimum-world-size-needed-to-fit-a-model-
m-derive-zero-3-s-per-step-communication-volume-vs-zer
m-design-a-custom-mix-hitting-a-target-size
m-diagnose-a-data-loader-i-o-bottleneck-from-a-real-os
m-diagnose-a-masking-bug-s-real-cost-from-a-before-aft
m-diagnose-a-negative-duration-nvtx-range-from-a-wrong
m-diagnose-a-zeroed-router-row
m-drive-a-real-server-past-capacity-and-correlate-pree
m-e2m1-value-set-enumeration
m-e4m3-encode-decode-with-subnormals
m-e4m3-encode-decode
m-emit-a-gguf-with-ggufwriter-matching-a-reference
m-engine-cache-cold-vs-warm-init
m-extract-a-subgraph-between-two-tensors
m-find-the-draft-size-below-which-int8-quantization-st
m-fix-cudagraph-capture-sizes-for-a-given-max-batch-nu
m-gptq-int32-pack-unpack-for-2-3-4-8-bits
m-group-wise-int4-quantization-reconstruction-error
m-hand-capture-and-replay-a-training-step
m-hpa-simulation-tune-target-value-and-stabilization-w
m-hybrid-shard-traffic-pattern-on-a-2x2-mesh
m-imagetype-scale-bias-from-a-torchvision-normalize
m-mmap-vs-heap-load-comparison
m-model-eviction-under-ollama-max-loaded-models
m-model-zoo-conversion-success-rate
m-mse-observer-vs-minmax-observer
m-n-bit-k-means-palettization-in-numpy
m-nf4-quantize-dequantize-from-scratch
m-nested-autocast-and-enabled-false-regions
m-one-quantizer-four-granularities
m-onednn-verbose-row-parser-on-this-mac
m-same-family-vs-cross-family-acceptance-rate-measured
m-simulate-q4-0-block-quantization-of-a-k-tensor
m-sse-framing-validator-detect-malformed-interleaved-s
m-structurally-prune-a-real-cnn-with-torch-pruning
p-fsdp-checkpoint-wont-load
p-int8-engine-loses-accuracy
p-kv-offload-to-cpu-tiering
p-layer-sensitivity-mixed-recipe
p-long-context-eval-that-catches-failure
p-lora-merge-changes-outputs
m-symmetric-vs-affine-scale-zero-point-derivation
