SPARK LAB
SHEET 04

spark-2634 · GB10 · aarch64
gpt-oss-120b · MXFP4 · llama-server
74 of 121 GB in use · 8 containers

Concurrency ramp

AGGREGATE PER REQUEST
070140210280 KNEE · c=32 3.8 t/s each 1248163264 CONCURRENT AGENTS → AGG T/S ↑ · PER-REQ T/S ↓
258.0
PEAK AGG T/S · c=32
8.1
PER REQUEST T/S THERE
0.92 s
P95 TTFC
1 240
PROMPT TOKENS, MEASURED
01 · EXPOSING

Concurrency ramp

258.0AGG T/S
two curves, opposite directions
02 · DEVELOPED

Context depth

57.9DECODE T/S
0 64K ± WIDENS WITH DEPTH
04 · KEEPER

Sustained hour

0.250J / TOKEN
100 % THROTTLE 0 MIN 61 MIN
06 · DEVELOPED

Determinism

64OF 64 IDENTICAL
64 PROMPTS · TEMP 0 · SEED 1337 ALL 64 IDENTICAL
03 · NOT EXPOSED

KV budget

WHY IT CANNOT RUN llama-server already running -c 65536 set at launch NOT OURS TO RESTART
05 · NOT EXPOSED

Memory spill

WHY IT CANNOT RUN HERE THIS MACHINE 16 GB 70B bf16 141 GB SPILLS TO NVMe — AND STILL RUNS
POWERGPU RAIL
88.5W
UTILISATIONGPU DEVICE
96%
TEMPERATURE
no unprivileged sensor here
MEMORYUNIFIED
77.2/ 121.7 GB
■ keeper · — unmeasured, with its reason · never a zero driver 580.159.03 · sparklab 0.1.0