Your next step
Test reliability beyond a headline score
Fair conditions, contamination, robustness, calibration, judges.
Start learningWhat you’ll learn
Keep evaluation conditions comparable
Identify an unfair model comparison.
About 4 minutes · Open activity
A memorized exam is weak evidence
Detect benchmark contamination.
About 4 minutes · Open activity
Robustness means handling relevant changes
Choose a meaningful perturbation for a test.
About 4 minutes · Open activity
Confidence needs calibration evidence
Distinguish an evaluated confidence estimate from confident wording.
About 4 minutes · Open activity
An explanation may be unfaithful
Separate a useful answer explanation from a verified account of computation.
About 4 minutes · Open activity
AI judges also need evaluation
Identify a bias or criterion mismatch in an automated evaluator.
About 4 minutes · Open activity
Probe boundaries safely
Recognize the purpose of adversarial testing on fictional material.
About 4 minutes · Open activity
Audit a model demo
Find an unfair test condition, a weak evidence claim and an untested reliability boundary in a fictional product demonstration.
About 5 minutes · Open activity