EvalGrid

Overview

AI evaluation reliability at a glance

Reliability Score

…

Pass Rate

…

Total Runs

…

Flaky Scenarios

…

Failed Runs

…

Scenarios Executed

…

Reliability Over Time

Pass rate per completed run

No runs yet to chart.

Failure Breakdown

Across recent runs

Not enough run history to compute regressions.

Recent Runs

Latest evaluation results

No runs yet. Trigger an evaluation to see results here.

Flaky Scenarios

Last 10-run window

No flaky scenarios detected yet.

Failed Scenarios

From most-recent failing runs

No failures in recent runs.