无名图书
收藏
数据挖掘导论
Pang-Ning Tan
,
Michael Steinbach
出版社
人民邮电出版社
出版时间
2006-01-01
ISBN
9787115146984
评分
★★★★★
标签
程序
编程
书籍介绍
本书全面介绍了数据挖掘的理论和方法,旨在为读者提供将数据挖掘应用于实际问题所必需的知识。本书涵盖五个主题:数据、分类、关联分析、聚类和异常检测。除异常检测外,每个主题都包含两章:前面一章讲述基本概念、代表性算法和评估技术,后面一章较深入地讨论高级概念和算法。目的是使读者在透彻地理解数据挖掘基础的同时,还能了解更多重要的高级主题。此外,书中还提供了大量示例、图表和习题。 本书适合作为相关专业高年级本科生和研究生数据挖掘课程的教材,同时也可作为数据挖掘研究和应用开发人员的参考书。
AI导读
核心看点
本书系统涵盖数据挖掘五大核心领域:数据预处理、分类、关联分析、聚类及异常检测。除异常检测外,其余主题均严格遵循“基础概念与算法”加“高级主题深入探讨”的双章结构,旨在帮助读者在掌握基础的同时,进一步理解复杂场景下的算法变体与评估技术,构建完整的技术知识体系。
书中提供大量实际案例、图表及习题,强调算法的伪代码实现与应用流程,而非繁琐的数学定理证明。这种以实例为导向的编写方式,降低了理论门槛,使读者能够直观理解分类、聚类等算法的具体运作机制,适合希望快速上手并应用于实际工程问题的开发者学习。
作为经典教材,本书内容全面且结构严谨,但需注意其翻译版本存在严重质量问题。多位读者反馈中文版译文生硬、逻辑不通,甚至出现严重误译,严重影响阅读体验。强烈建议具备一定英语基础的读者直接阅读英文原版,以确保准确理解数据挖掘的专业术语与算法细节,避免被劣质翻译误导。
读者共识
读者普遍认可本书作为数据挖掘入门教材的结构合理性与内容全面性。其双章结构设计(基础+高级)被评价为有助于循序渐进地掌握知识,且省略数学证明、侧重实例与伪代码的做法,被认为对数学基础一般的初学者友好。许多读者表示,尽管内容有一定难度,但作为第一本系统了解数据挖掘流程与算法的书籍,其价值依然得到肯定,适合用于期末复习或基础扫盲。
中文版翻译质量遭到广泛批评,被视为本书最大的减分项。大量读者指出译文生硬、错误百出,严重影响了阅读体验和理解准确性。因此,社区共识强烈建议放弃中文版,转而阅读英文原版。对于无法阅读英文原版的读者,建议寻找其他更优质的中文译本或参考资料,切勿因本书的知名度而忍受低劣的翻译,以免误导学习方向。
部分读者反映本书内容较为陈旧,且部分章节跳跃性大,难以连续阅读。随着人工智能技术的快速发展,书中未涵盖最新的深度学习与大模型技术,对于追求前沿技术的读者而言,其参考价值有限。此外,有读者指出书中某些高级内容晦涩难懂,若数学基础薄弱,阅读过程会非常痛苦。建议读者明确学习目标,仅将其作为传统数据挖掘算法的参考手册,而非唯一学习资源。
精彩摘录
"
data mining is an integral part of knowledge discovery in databases(KDD), which is the overall process of converting raw data into useful information
"
"
精度通常用值集合的标准差度量
"
"
例27 澳大利亚降水量
"
"
设x和y是两个点,其中y是原来的点,而x是它的某个失真或近似,例如,x可能是由于添加了一些随机噪声到y上而产生的。损失函数的目的是度量用x近似y导致的失真或损失。当然,x和y越类似,失真或损失就越小,因而Bregman散度可以用作相异性函数。
"
"
是一个函数与该函数线性近似之差
"
"
像最近邻这样的消极学习方法不需要建立模型,然而,分类测试样例的开销很大,因为需要逐个计算测试样例和训练样例之间的相似度。 最近邻分类器基于局部信息进行预测,而决策树和基于规则的分类器试图找到一个拟合整个输入空间的全局模型。正式因为这样的局部分类决策,最近邻分类器(k很小时)对噪声非常敏感。 最近邻分类器可以生成任意形状的决策边界,这样的决策边界与决策树和基于规则的分类器通常所局限的直线决策边界相比,能提供更灵活的模型表示。 除非采用适当的临近性度量和数据预处理,否则最近邻分类器可能做出错误的决策。
"
"
数据挖掘是在大型数据存储库中,自动地发现有用信息的过程。 并非所有的信息发现任务都被视为数据挖掘。
"
"
数据挖掘任务分为预测任务和描述任务两大类。预测任务的目标是根据其他属性的值,预测特定属性的值。描述任务的目标是导出概述数据中潜在联系的模式(相关、趋势、聚类、轨迹和异常)。
"
目录
第1章 绪论 1
1.1 什么是数据挖掘 2
1.2 引发数据挖掘的挑战 2
1.3 数据挖掘的起源 3
1.4 数据挖掘任务 4
显示全部
用户评论
期末刷书。这本书也就是考试用用
超级通俗易懂!可以快速了解数据挖掘,适合入门
大一时候读的。(当做综述
本书涵盖五个主题:数据、分类、关联分析、聚类和异常检测。除异常检测外,每个主题都包含两章:前面一章讲述基本概念、代表性算法和评估技术,后面一章较深入地讨论高级概念和算法。对于一个数学基础不是很好但又想快速有效地学习数据挖掘的学生来讲。这本书无疑是个不错的选择
8.4 DBSCAN 327 8.4.1 传统的密度:基于中心的方法 327 8.4.2 DBSCAN算法 328 8.4.3 优点与缺点 329 8.5 簇评估 330
入门数据挖掘的经典书籍,讲解了数据挖掘的基础知识,章节的连贯性很强,逻辑性很强!
跟机器学习和人工智能有很多重叠,建议直接读人工智能领域经典教材
数据挖掘
内容有点老了。翻了一半。最近做翻译来看看别人术语怎么翻的。可惜似乎参考性不大。
非常适合入门
你可能会关注的书籍
数据挖掘导论 (英文版)
[美] Pang-Ning Tan
数据挖掘导论(原书第2版)
[美] 陈封能
数据挖掘导论(英文版·原书第2版)
陈封能(Pang-Ning Tan)
人民邮电出版社的其他书籍
查看全部
历史上最美的10个实验
George Johnson
Linux程序设计
Neil Matthew
勾股定理
Eli Maor
随机过程
伊藤 清(Kiyoshi Ito)
斯图尔特微积分(第九版·下)
[加] 詹姆斯·斯图尔特(James Stewart)
一定要不停记录自己
晴叙
下载
收藏