人人可懂的数据科学

[英] 约翰·D·巴罗

出版时间

2019-09-30

ISBN

9787111637264

评分

★★★★★
书籍介绍

数据科学的主要目标就是通过数据分析来改进决策,它与数据挖掘、机器学习等领域紧密相关,但范围更广。本书简要介绍了该领域的发展、基础知识,并阐释了数据科学项目的各个阶段。书中既考虑数据基础架构和集成多个数据源数据所面临的挑战,又介绍机器学习基础并探讨如何应用机器学习专业技术解决现实问题。还综述了伦理和法律问题、数据法规的发展以及保护隐私的计算方法。最后探讨了数据科学的未来影响,并给出数据科学项目成功的原则。

约翰· D.凯莱赫(John D. Kelleher) 布伦丹·蒂尔尼(Brendan Tierney) 著:约翰· D.凯莱赫(John D. Kelleher) 是都柏林理工学院计算机科学学院的教授以及信息、通信和娱乐研究所的学术负责人。他的研究得到了ADAPT中心的支持,该中心由爱尔兰科学基金会(Grant 13 / RC / 2106)资助,同时也接受欧洲区域发展基金的资助。 他还是《Fundamentals of Machine Learning for Predictive Data Analytics》的作者之一。

布伦丹·蒂尔尼(Brendan Tierney)是都柏林理工学院计算机科学学院的讲师,同时也是Oracle ACE 主任,还著有多本基于Oracle技术的数据挖掘类著作。

精彩摘录
  • "The key to success is getting the right data and finding the right attributes."
  • "The distinctive feature of GPUS is that they cancarry out fast matrix multiplications. However, matrix multiplications are useful not only for graphics rendering but also for ML. In recent years, GPUS have been adapted and optimized for ML use, which has contributed to large speedups in data process"
  • "A frequent mistake that many inexperienced data scientists make is to focus their efforts on the modeling stageof the CRISP-DM and to rush through the other stagesThey may think that the really important deliverable froma project is the model, so the data scientist should devotemost of his time to b"
  • "A neural network consists of a set of neurons that are con nected together. A neuron takes a set of numeric values asinput and maps them to a single output value. At its core, aneuron is simply a multi-input linear-regression functionThe only significant difference between the two is that ina neuron"
  • "如何选择正确的属性是所有数据科学项目面临的挑战,有时会反复试验过程,在每次迭代中检查使用不同属性子集获得的结果的质量。"
  • "《点球成金》这个故事印证了古老的计算机科学格言 “garbage in,garbage out'”,这对数据科学来说是无比正确的:如果计算过程的输入不正确,那么其输出也将不正确。的确,数据科学的两个特点无论怎样强调都不为过:(1)为了让数据科学获得成功,需要非常注意数据是如何创建的(就数据抽象设计及其数据质量校验而言);(2)我们还需要检查数据科学过程的输出结果,也就是说,如果计算机在数据中识别出一种模式,并不意味着它在尝试的过程中真正获得了某种洞察力;模式可能仅仅反馈了我们在数据设计和捕获中的偏差。"
  • "每个机器学习算法被设计成在搜索期间优先评估某些类型的函数。这种偏好称为算法的学习偏见(learning bias)。机器学习应用的真正挑战是找到学习偏见中与特定数据集最匹配的算法。此任务通常涉及算法实验,从多个算法中找到最适合该数据集的算法。"
  • "无监督的聚类算法尝试找出蕴涵在数据集中的一组簇,簇内实例相似而簇间实例相异。一个簇定义了一组相似的实例。 例如,算法可以通过查找在簇内出现相对频繁的属性值来识别诱发疾病或并发症(同时出现的一些疾病)的原因。聚类的想法看起来简单,但实际上威力强大,可以应用于生活的许多领域。聚类的另一个应用是向客户推荐产品。如果顾客喜欢某本书、某首歌曲或某部电影,那么他很可能也喜欢类似的书、歌曲或电影。"
作者简介
约翰· D.凯莱赫(John D. Kelleher) 布伦丹·蒂尔尼(Brendan Tierney) 著:约翰· D.凯莱赫(John D. Kelleher) 是都柏林理工学院计算机科学学院的教授以及信息、通信和娱乐研究所的学术负责人。他的研究得到了ADAPT中心的支持,该中心由爱尔兰科学基金会(Grant 13 / RC / 2106)资助,同时也接受欧洲区域发展基金的资助。 他还是《Fundamentals of Machine Learning for Predictive Data Analytics》的作者之一。 布伦丹·蒂尔尼(Brendan Tierney)是都柏林理工学院计算机科学学院的讲师,同时也是Oracle ACE 主任,还著有多本基于Oracle技术的数据挖掘类著作。
目录
译者序
前言
致谢
作者简介
第1章 什么是数据科学 …… 1

显示全部
用户评论
小白看不懂,专家不用看。。。。翻译的一塌糊涂,里面各种错误为不勘误。 但是也获得了一些新的想法,比如那个金字塔模型。有一定的思考逻辑在里面。
CRISP-DM框架
整个书写得吧……你说不深入吧,名词概念一大堆;你说深入吧,又啥都没写。既没有有趣的实例,又没有深刻的思考。感觉从作者到责任编辑都没想好这本书的定位。当然了,按照作者不断强调的,模型靠蒙、数据看数量和质量、算了半天还可能过时,数据科学本身可能就是个没啥理论的玄学吧。再吐槽一下翻译,机翻的痕迹太重了,为了赚钱也是挺拼的。
启迪人思考,可以反复读。
数据科学非常好的小白入门书!值得二刷!
这个翻译太差了,和机翻没什么区别
也不管书的价值怎么样了,至少我读完了,对于数据科学有了初步的理解。之后再去找深入的读物精进吧
记录:1 The Visual Display of Quantitative Information 2 Show Me the Numbers
面面俱到,只是太簡練,不過癮
下载
收藏