All Studio artifacts
Eval Harness
Testing & regression
Prompt Version Under Test
vs v3 baseline
Test Categories
225 casesFactual Accuracy47/50
Output Format (JSON)50/50
Safety & Refusals49/50
Edge Cases33/40
Tone & Brand Voice30/35
Hit Run suite to score v4 across 225 cases.
What we buildEval datasetsRegression CILLM-as-judgePrompt versioningRelease gating
Get an eval suite built →