More Training Data vs Higher Data Quality
Implement automated data governance and quality filtering to meet EU AI Act training-data quality mandates without sacrificing dataset breadth.
CyberTRIZ analysis · AIRobotics contradiction AI021 · one of 8,235 worked contradictions published by CyberTRIZ.AI
Regulations
Business Context
Organizations continuously collect larger datasets to improve AI performance across increasingly diverse business scenarios. However, expanding data volume frequently introduces duplicated records, inconsistent labeling, outdated information, and noisy observations that reduce overall dataset quality. Without effective governance, larger datasets may actually decrease model reliability instead of improving it. Organizations must therefore maximize useful information while maintaining high standards of data quality.
AI & Robotics TRIZ Resolution
Rather than assuming that larger datasets automatically produce better models, organizations should implement automated data governance, intelligent filtering, continuous quality validation, and lifecycle monitoring. By removing low-value information while preserving representative data, AI systems can achieve higher predictive performance with cleaner, more reliable datasets.
Applicable TRIZ Principles
Principle 2 – Taking Out eliminates duplicated, inconsistent, and low-value data that reduces overall dataset quality.
Principle 10 – Preliminary Action validates and prepares datasets before they enter model training pipelines.
Principle 23 – Feedback continuously monitors data quality and identifies issues that require corrective action.
Expected Outcome
Higher-quality datasets
Better prediction accuracy
Reduced data management effort
More reliable model performance
Decision Indicators
Early indicators that growing datasets are reducing data quality include:
Duplicate records increase significantly.
Label inconsistencies become more frequent.
Data preparation requires extensive manual effort.
Model performance declines despite larger datasets.
Engineers spend more time cleaning data than developing models.
Monitoring these indicators helps maintain data quality as datasets expand.