
Evals is Pydantic's code-first evaluation framework that uses assertions to continuously assess AI agent output quality. It's used by QA engineers and AI product managers ensuring agent outputs meet quality standards, sitting as a continuous evaluation layer that runs alongside production monitoring.