精通特征工程

[美] 爱丽丝 • 郑

出版时间

2019-03-31

ISBN

9787115509680

评分

★★★★★
书籍介绍

特征工程是机器学习流程中至关重要的一个环节,然而专门讨论这个话题的著作却寥寥无几。本书旨在填补这一空白,着重阐明特征工程的基本原则,介绍大量特征工程技术,教你从原始数据中提取出正确的特征并将其转换为适合机器学习模型的格式,从而轻松构建模型,增强机器学习算法的效果。

然而,本书并非单纯地讲述特征工程的基本原则,而是通过大量示例和练习将重点放在了实际应用上。每一章都集中研究一个数据问题:如何表示文本数据或图像数据,如何为自动生成的特征降低维度,何时以及如何对特征进行标准化,等等。最后一章通过一个完整的例子演示了多种特征工程技术的实际应用。书中所有代码示例均是用Python编写的,涉及NumPy、Pandas、scikit-learn和Matplotlib等程序包。

- 数值型数据的特征工程:过滤、分箱、缩放、对数变换和指数变换

- 自然文本技术:词袋、n元词与短语检测

- 基于频率的过滤和特征缩放

- 分类变量编码技术:特征散列化与分箱计数

- 使用主成分分析的基于模型的特征工程

- 模型堆叠与k-均值特征化

- 图像特征提取:人工提取与深度学习

爱丽丝·郑(Alice Zheng)

亚马逊广告平台建模和优化团队负责人,应用机器学习、生成算法和平台开发领域的技术领导者,前微软研究院机器学习研究员。

阿曼达·卡萨丽(Amanda Casari)

谷歌云开发者关系工程经理,曾是Concur Labs的产品经理和数据科学家,在数据科学、机器学习、复杂系统和机器人等多个领域都有丰富经验。

目录
前言  ix
第1章 机器学习流程  1
1.1 数据  1
1.2 任务  1
1.3 模型  2

显示全部
用户评论
错误太多了
看一下开源版本
不值得购买,很浅。数据挖掘、文本处理、计算机视觉三方面都涉及了,我就看了数据挖掘部分,这部分如果多看几篇特征学习的综述也可涵盖。文本处理讲得很浅,主要基于tf-idf
调研用,中文版[https://github.com/apachecn/fe4ml-zh]/特征工程,可以大体划分出特征预处理,特征构建,特征选择,特征评估几个步骤。如何选择各种特征化方法和模型本身有较大关系。即使目前深度学习技术一定程度减少了特征工程的繁琐操作,强相关因子的构建,还是离不开算法知识和领域知识,离不开对数据和业务本身的洞察,离不开人工操作。/在工程上如何开发一些工具链,让算法工程师能更快地分析好数据的一些特征,从而开展特征工程,是一个问题。
要吃透这本书的内容的前提是对线性代数的熟练掌握,因为这里面涉及到大量术语,虽然有讲解但还是很粗略。给出的代码很简洁实用,内容安排也比较合理。
侧重理论,代码较少,基于领域讲解feature engineering,如果哪个领域不熟悉的话可以略过不看(因为看了也看不懂——NLP接触较少,这部分feature engineering内容我没看懂)
解惑好书
代码都有,但是不太会详解,只会讲最关键的特征部分,这样也好也不好,需要有一定的基础吧。从书里学到了hashFeature,box-cox,polynomial Feature和l2归一化,其他基本都会。
收藏