Release decision: {{ r.verdict }}

{{ r.reason }} {{ blurb }}

Suite {{ r.suite_name }} (hash {{ r.suite_hash }}) — baseline {{ r.baseline_run_id[:12] }} vs candidate {{ r.candidate_run_id[:12] }}.

{% macro casetable(cases) -%} {% if cases %} {% for c in cases %} {% endfor %}
CaseCat/LangBeforeAfterFailing assertion
{{ c.id }}{% if c.critical %} critical{% endif %} {{ c.category }}/{{ c.language }} {{ c.before or '—' }} {{ c.after or '—' }} {{ '; '.join(c.failing) if c.failing else '—' }}
{% else %}

None.

{% endif %} {%- endmacro %}

Critical regressions

{{ casetable(r.critical_regressions) }}

Improvements

{{ casetable(r.improvements) }}

Other regressions

{{ casetable(r.other_regressions) }}

Added cases

{{ casetable(r.added) }}

Removed cases

{{ casetable(r.removed) }}

Disputes, errors & coverage

BaselineCandidate
Judge disputes{{ r.disputes.baseline }}{{ r.disputes.candidate }}
Errors{{ r.errors.baseline }}{{ r.errors.candidate }}
{% for cov in r.coverage %} {% endfor %}
CategoryEvaluable / total
{{ cov.category }}{{ cov.evaluable }} / {{ cov.total }}

Latency (ms)

BaselineCandidate
p50{{ '%.0f'|format(r.latency.baseline_p50) }}{{ '%.0f'|format(r.latency.candidate_p50) }}
p95{{ '%.0f'|format(r.latency.baseline_p95) }}{{ '%.0f'|format(r.latency.candidate_p95) }}

Cost per successful task

{{ r.cost_per_successful_task }}

Acceptance policy applied

Reproduce

{% if r.rerun_command %}
{{ r.rerun_command }}
{% endif %}