SPARK LAB
SHEET 04
spark-2634
· GB10 · aarch64
gpt-oss-120b · MXFP4 · llama-server
74 of 121 GB in use · 8 containers
Concurrency ramp
AGGREGATE
PER REQUEST
0
70
140
210
280
KNEE · c=32
3.8 t/s each
1
2
4
8
16
32
64
CONCURRENT AGENTS →
AGG T/S ↑ · PER-REQ T/S ↓
258.0
PEAK AGG T/S · c=32
8.1
PER REQUEST T/S THERE
0.92
s
P95 TTFC
1 240
PROMPT TOKENS, MEASURED
01 · EXPOSING
Concurrency ramp
258.0
AGG T/S
two curves, opposite directions
02 · DEVELOPED
Context depth
57.9
DECODE T/S
0
64K
± WIDENS WITH DEPTH
04 · KEEPER
Sustained hour
0.250
J / TOKEN
100 %
THROTTLE
0 MIN
61 MIN
06 · DEVELOPED
Determinism
64
OF 64 IDENTICAL
64 PROMPTS · TEMP 0 · SEED 1337
ALL 64 IDENTICAL
03 · NOT EXPOSED
KV budget
—
WHY IT CANNOT RUN
llama-server
already running
-c 65536
set at launch
NOT OURS TO RESTART
05 · NOT EXPOSED
Memory spill
—
WHY IT CANNOT RUN HERE
THIS MACHINE
16 GB
70B bf16
141 GB
SPILLS TO NVMe — AND STILL RUNS
POWER
GPU RAIL
88.5
W
UTILISATION
GPU DEVICE
96
%
TEMPERATURE
—
—
no unprivileged sensor here
MEMORY
UNIFIED
77.2
/ 121.7 GB
■ keeper · — unmeasured, with its reason · never a zero
driver 580.159.03 · sparklab 0.1.0