为你的数据科学项目提供有力支撑--3个寻找数据集的最佳网站

本文主要是介绍为你的数据科学项目提供有力支撑--3个寻找数据集的最佳网站，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

作者：Angelia Toh，Self Learn Data Science联合创始人翻译：李海明校对：冯羽

本文约1000字，建议阅读5分钟

本文为你介绍3个寻找数据集的最佳网站。

初学数据科学时，你不可避免地需要寻找更多数据来进行练习。这里我们推荐3个最好的找寻数据集的网站，来激发你下一个数据科学项目。

在学习数据科学的旅途中，你一定会需要数据集。特别是当我们在《How to Become a Data Scientist in 2020》中提倡从事数据科学项目时所言，你应当总是关注那些你可以用来试验的有趣的数据集。这里我们列出了在数据科学项目中获取数据集的3个最好的网站。

1.Kaggle

现在你应该对Kaggle非常熟悉了。为了能够利用社区力量并解决实际问题，各个公司已经在Kaggle上发布了他们数据。这使得Kaggle成为了找寻那些尚待解决的实际问题的数据集的最佳场所。如果你想要在不需要生成或标记数据的情况下练习机器学习建模，那么Kaggle也会是你的不二之选。另外，Kaggle的笔记本部分允许用户分享他们的代码和模型，这是非常好的学习资源。我强烈推荐初学者在Kaggle上寻找他们第一个数据科学项目。

2.Google Dataset Search

Google Dataset Search，即谷歌数据集搜索，是目前可用的最全面的数据集搜索引擎（该引擎2020年刚刚发布beta版本）。据称，Google Dataset Search目前可以检索到超过2500万个线上数据集，而且自2018年9月该引擎启动以来，已经帮助众多科学家和学者们更好地定位了所需的数据集。Google Dataset Search具有根据数据类型、更新日期等指标过滤数据集的功能，如今已成为我们大多数人的最爱。

只要数据集是线上的，那么你一定能够用Google Dataset Search找到它。

3.Data.gov

在寻找数据集时，你可能会想看看政府公开了哪些数据。如果这些公开数据能够得到了很好的使用的话，那么得到的解决方案可能会对整个行业都大有裨益。Data.gov是美国政府建立的开放数据湖，政府部门的数据在这里发布，促进学术界的研究与发展。在Data.gov上，数据分为健康、能源或教育等主题，人们能够非常容易地通过导航找到所需要的数据。

如果你不是美国居民怎么办？试着在你最喜欢的搜索引擎中搜一下“本国数据”看看。通常情况下，你会找到当地政府发布数据的网站。比如，印度政府发布数据的网站（data.gov.in）和英国政府发布数据的网站（data.gov.uk）。

使用这些网站，你可以找到任何你感兴趣的数据集。记住，学习数据科学的最好方法就是练习。那么，记住这些方便的网站吧，因为你一定会用到它的。

作者小传：

Angelia Toh，“这不可能”是为了提醒你：“我有可能”。切勿停下学习的脚步|自学成才的数据科学家，Self Learn Data Science的联合创始人。

原文标题：

3 Best Sites to Find Datasets for your Data Science Projects

原文地址：

https://www.kdnuggets.com/2020/04/best-sites-datasets-data-science.html

END

转自：数据派THU 公众号；

合作请加QQ：365242293

数据分析（ID : ecshujufenxi ）互联网科技与数据圈自己的微信，也是WeMedia自媒体联盟成员之一，WeMedia联盟覆盖5000万人群。