Agent Evals

Agent quality is more than the final answer: did it take sensible steps, call the right tools, waste nothing? Trajectory evaluation and the agent regression suite.

▶ Watch this reel

What you'll learn

  1. Task success rate
  2. Trajectory & tool-call evaluation
  3. Simulated environments
  4. Cost, latency & regression suites

Remember this

Task success rate

Trajectory evaluation

Simulated environments

Cost, latency & regression

Code: The agent regression gate, as CI config

agent_regression:
  dataset: agent_tasks/v4            # golden + adversarial + incidents
  gates:
    success_rate:   { min: 0.90, by_difficulty: { easy: 0.98, hard: 0.60 } }
    trajectory:     { tool_selection: 0.85, arg_accuracy: 0.95,
                      step_sense: 0.80, efficiency: 0.70 }
    resources:      { cost_per_task_max: 1.4x_baseline,
                      calls_per_task_max: 1.3x_baseline }
    safety:         { adversarial_pass: 1.0 }   # refusals where required
  cadence:
    pr:      smoke_20_tasks
    nightly: full_suite → trend_report
    release: full_suite + simulation_replay

# Red gate → no promotion → last-known-good keeps serving.