{% extends "ui/base_ui.html" %} {% block title %}Eval Run — {{ agent_name }} / {{ suite_name }} - ATP Platform{% endblock %} {% block content %}

Eval Run: {{ agent_name }} / {{ suite_name }}

← back to leaderboard

{% if run %}

Latest run {{ run.run_uuid }} · critical_pass_rate {{ "%.3f"|format(run.critical_pass_rate) if run.critical_pass_rate is not none else "—" }} · breakpoint {{ run.breakpoint_axis_level or "—" }}

{% endif %} {% if run is none %}

No completed run found for {{ agent_name }} on {{ suite_name }} yet.

{% elif not cases %}

No per-case detail for this run (aggregate-only import — re-run the sweep with the current harness to capture case_details).

{% else %}

Axis sweep

{% for a in axis_sweep %} {% endfor %}
axis_levelcasescritical_passpass_rate
{{ a.axis_level }}{{ a.n }}{{ a.critical_pass }} {{ "%.3f"|format(a.pass_rate) }}

Per-case ({{ cases|length }})

{% for c in cases %} {% endfor %}
case_idaxis_levelcritical_passmalformed recallprecisionfp_count
{{ c.case_id }}{{ c.axis_level or "—" }} {{ "✓" if c.critical_pass else "✗" }} {{ "✓" if c.malformed else "" }} {{ "%.3f"|format(c.recall) if c.recall is not none else "—" }} {{ "%.3f"|format(c.precision) if c.precision is not none else "—" }} {{ c.fp_count if c.fp_count is not none else "—" }}
{% endif %} {% endblock %}