Description
Processes ensuring AI training and operational data meet quality standards for accuracy, completeness, consistency, and relevance.
Implementation Guidance
Quality Dimensions
Define measurable quality criteria for AI data: accuracy (correctness of labels and values), completeness (missing data thresholds), consistency (cross-source agreement), timeliness (data currency requirements), and relevance (fitness for the AI task). Set quantitative thresholds per dimension.
Automated Quality Pipelines
Implement automated data quality checks in ML pipelines: schema validation, statistical distribution monitoring (detecting drift from baseline), outlier detection, duplicate identification, and label quality assessment. Gate model training on quality threshold passing.
Quality Remediation
Establish processes for remediating quality issues: data cleaning procedures, re-labeling workflows, source replacement criteria, and documentation of quality decisions and their impact on model performance.
Evidence Requirements
- Data quality criteria and thresholds per AI system
- Automated quality check configurations and results
- Data quality assessment reports
- Remediation records and quality trend reports