# Classification evaluation evidence

Build-time release reference. Runtime readiness, deployment, payment settlement and external indexing are not evaluated here. Prices are proposed; this file cannot authorize execution or payment.

Evaluate up to 1,000 caller-supplied single-label expected/predicted pairs: confusion matrix, per-label precision/recall/F1/support, macro/weighted/micro summaries, balanced accuracy and mismatch evidence. Undefined per-label values use zero with explicit flags; labels are not verified ground truth.

Release: 0.29.0. Built: 2026-10-06T15:38:00Z.

## Choose for
- calculate confusion matrix precision recall f1 from evaluation labels
- score agent routing classification predictions against supplied labels
- inspect macro micro weighted metrics and error samples

## Outside this profile
- Train or execute a model or infer factual ground truth
- Multilabel classification probability calibration or deployment certification

Proposed nominal USD 0.01 per successful call; payer fees excluded. No verified runtime availability.

- [Exact release contract](/reference/services/classification-evaluate.json)
- [Input schema](/reference/schemas/classification-evaluate.input.json)
- [Output schema](/reference/schemas/classification-evaluate.output.json)
- [Fixed example](/reference/examples/classification-evaluate.json)
- [Complete HTML reference](/discover/tools/classification-evaluate)
