内容简介:
大数据时代的到来,使我们的生活在政治、经济、社会、文化各个领域都产生了很大改变。“数据科学”一词应运而生。如何更好地对海量数据进行分析、得出结论并做出智能决策是统计工作者面临的机遇与挑战。本书介绍数据挖掘与统计机器学习领域最常用的模型和算法,包括最基础的线性回归和线性分类方法,以及模型选择和模型评价的概念和方法,进而介绍非线性的回归和分类方法(包括决策树与组合方法、支持向量机、神经网络以及在此基础上发展的深度学习方法)。最后介绍无监督的学习中的聚类方法和业界广泛使用的推荐系统方法。除了方法的理论讲解之外,我们给出了每种方法的R语言实现,以及应用Python语言实现深度学习和支持向量机两种方法。本书的一个亮点是最后一章给出的两个大数据案例,数据量均在10G左右。我们同时给出了单机版(Python、数据库、R)和分布式(Hadoop、Hive、Spark)两种实现方案。原始数据和程序代码均可在出版社提供的网址下载。本书面向的主要读者是应用统计专业硕士,希望能够拓展到统计专业高年级的本科生以及其他各个领域有数据分析需求的学生和从业人员。
下载地址:
[ARFormslite id=100]