1. 质量
许多数据科学家希望利用外部来源的数据。然而,通常没有质量控制或保证如何捕获原始数据。我们需要了解数据的质量以及如何准备数据。在这种情况下,分析浮标数据的科学家可以使用平均值、均值、最小值、最大值来可视化原始数据,捕获这些数据库错误并相应地对其进行清理。
2. 稀疏性
在这种情况下,稀疏适用于元数据。通常,元数据字段不完整,有些字段已填写,有些字段留空。如果数据是从单一来源生成的,则可能是由于人类缺乏规范或知识所致。但是,如果数据来自各种来源,而没有元数据的标准定义,则每个数据集可能具有完全不同的字段。因此,将它们组合在一起时,完成的字段可能不对应。
3. 完整性
数据完整性是数据准确性和一致性的保证。数据保管链对于证明数据在流水线和位置中移动时不会受到损害至关重要。当数据的捕获和摄取受到控制时,您可以相对轻松地验证其完整性。但是,与他人合作时,很难进行验证。生成数据时,没有用于外部数据的安全证书。
关于机器学习面临的三个关键数据挑战,青藤小编就和您分享到这里了。如果您对大数据工程有浓厚的兴趣,希望这篇文章可以为您提供帮助。如果您还想了解更多关于数据分析师、大数据工程师的技巧及素材等内容,可以点击本站的其他文章进行学习。