雅虎公开13.5TB用户数据 参与人工智能
北京时间1月15日上午消息,雅虎周四公布了关于用户如何使用该公司服务,例如雅虎新闻和雅虎财经的大量数据。此举是为了给学术界的机器学习研究者提供素材。
这并不是雅虎首次公布这样的数据。在雅虎实验室的Webscope项目中,雅虎曾56次发布这样的数据,其中涉及广告、图片、社交媒体和评级等。此次公布的数据来自2015年的4个月时间,覆盖了2000万人,其中包括用户访问雅虎网站所使用的设备类型、文章的阅读情况,以及文章的主题。其他数据还包括用户的位置、年龄和性别,但这些数据都经过了匿名化处理。
不过值得指出的是,雅虎此次提供的数据集规模庞大,多达13.5TB。而雅虎此前提供的数据集通常只有1TB。
加州大学圣迭戈分校电气和计算机工程教授格特·兰克利特(Gert Lanckriet)表示:“我对此感到兴奋。这是因为,学术界和工业界的这类合作对于更强大人工智能和机器学习技术的研究、设计和开发,现实世界中的大数据处理至关重要。”
近期,雅虎正在采取措施吸引开发者。例如,雅虎开源了一些算法。这些算法用于对流数据的计算和网页爬虫,处理网站上的结构化数据。雅虎此次公布的数据将帮助学术界进一步了解用户的阅读习惯,进而对自己的算法进行优化。
雅虎提供了100行的数据范例,其中包含多种类型的数据,例如股票、学校、政治、体育和明星等。
雅虎实际上还有更多数据可以分享。雅虎实验室个性化科学研究总监苏吉·拉简(Suju Rajan)表示,她常常需要与PB(1PB=1000TB)级别的数据量打交道,而对雅虎这样的互联网公司来说并不少见。不过,PB级别的数据对单一研究者来说很难处理,即使是13TB的数据都已显得十分庞大。
雅虎实验室研究副总裁里卡多·贝扎-耶茨(Ricardo Baeza-Yates)表示:“许多人都没有能力使用这一数据,但我们认为,通过这种方式我们可以推进相关研究。”(张帆)
图文推荐
- 今年搭载鸿蒙操作系统的物联网设备有望达到3亿台,手机将超过2亿台
数码家电2021-03-03
- 大尺寸柔性屏或将成今年彩电市场爆点
数码家电2020-05-14
- 2020年相机行业展望:微单vs单反 决战东京奥运会
数码家电2020-01-03
- 市场规模或将达500亿元 电动牙刷是个好生意吗?
数码家电2019-06-10
- 索尼98寸8K电视售价公布:售价不菲
数码家电2019-04-23
- 荣耀手表Vivienne Tam联合设计版来啦!16点限量预约
数码家电2019-04-17