数据快速流动问题 50
用Excel进行回归分析 195
本书有3个组成部分:一是多层次地讨论
数据科学是什么,以及数据科学涉及哪些其他学科;二是数据科学的技术应用层面,包括教程和案例研究;三是给正在从业和有抱负的数据
科学家介绍一些职业资源。本书中有很多职业和培训相关资源(如数据集、网络爬虫源代码、数据视频和如何编写API),所以借助本书,你现在就可以开始数据科学实践,并快速地提升你的职业水平。
结论:何时使用MapReduce 69
?提交勘误:您对书中内容的修改意见可在 提交勘误 处提交,若被采纳,将获赠博文视点社区积分(在您购买电子书时,积分可用来抵扣相应金额)。
前言
至于文本的样式标记如下。
数据
科学家人群特征 90
其他主题 204
勾连检测和僵尸网络的关联规则检测 254
数据集 318
免费培训项目 96
统计学将会复兴 34
?MapReduce和Hadoop,以及Hadoop进行计算时的数值稳定性。
这本书是写给谁的
源代码生成数据集 137
大数据的统计聚类 141
解决问题的4个办法 181
数据科学:统计学的终结 72
总结 118
统计面临的挑战 246
Hadoop、数值的和统计的稳定性 210
实时产品 126
这些读者将在本书中找到有价值的信息,特别是在以下几章中。
最终意见 215
阅读本书你需要什么知识
业余数据科学家 87
谁应该给数据科学家教统计学 298
测量 Twitter 哈希标签(hashtag)的收益 263
优化统计交易策略 220
本书由三大主题构成。
软件工程师的蒙特卡洛模拟法 182
应用 177
问题 67
第7章 踏上你的数据科学职业之路 283
电子邮件营销:提高300%的性能 257
平移不变性的度量标准 214
?数据科学和大数据是什么和不是什么,以及与其他学科的区别(第1、2、3章)。
?创建快速算法所需的计算机科学要素。
第2章 大数据的独特性 45
股票市场 217
招聘数据科学家的公司 328
一般性问题 286
更好的医疗欺诈检测 275
历史与开拓者 36
建立数据字典 169
这本书涵盖了什么
归因模型 276
计算机科学家的大数据方法 183
轻松注册成为博文视点社区用户(),扫码直达本书页面。
安全通信:数据加密 163
现代的趋势 38
加密 232
本书虽然专业度高,但也因为案例翔实、讲求实际,适合其他行业或领域的人士阅读。特别建议业务跟数据息息相关的企业负责人或高管,或者对数据相关项目感兴趣的投资者品读。毕竟数据科学家这一高层职位,跟企业负责人及高管的对接较多。虽说好的数据科学家,应具备与非技术人士沟通的能力,但作为数据科学家的领导,一旦多懂一些数据科学的思考模式及流程,便会对数据科学家有更多理解,也会对数据化的决策有更深的认识。
二阶近似 193
MapReduce不能做什么 67
数据科学方面的培训 91
本书也传递出对行业热词的审慎态度。比如本书就对“大数据”的缘起、演变、更替、历史、迷思和幻象,着墨不少。就像书中所说,大数据领域许多看似新的方法,可以追溯到二三十年前,如今的不少创新,实乃新瓶旧酒。想必读者从Gartner的成熟度曲线里,可以看到大数据一词已渡过巅峰、渐趋理性,与之相随的,是跟数据科学息息相关的人工智能(AI)重新崛起。若理解本书的立场和价值取向,就知道人工智能60多年来几起几落,不少如今大放异彩的方法,也可找到前身。透过现象看本质,人工智能多少因为数据体量更大、数据分析更细、计算能力更强,才成为行业焦点。忽视基础理论盲目追随人工智能热点无异于舍本逐末,认真和刻意学习数据科学及人工智能的基础理论和实践,方是正途。
连续点击评分与二进制欺诈/非欺诈 242
关于工作经验的问题 283
使用颠簸系数 141
新趋势 231
点击欺诈 241
情景5:分析与诱导在提升销量上有何不同价值 22
自动新闻提要优化 260
数据字典 168
什么是数据字典 168
当数据库改变时,保存好数值 204
股票市场模拟 226
与模型无关的置信区间 175
数据科学家与数据工程师 10
第8章 数据科学资源 318
实验设计 196
persistence.properties
雇佣问题 298
预测陨石撞击 277
?第2、4、5、6章对数据科学工作者特别有价值,因为它们包含大数据技术内容(如聚类和分类技术),以及前沿数据科学技术,如组合特征选择、隐性决策树、分析类API、判断MapReduce何时有用等。这些章节里很多案例研究(如欺诈检测、数字分析、股票市场策略和其他更多)的说明非常详细,详细到可以让读者在实际工作中面临类似数据时,能沿用这些案例的分析方法。然而,它们的文字描述都很简单,高层管理人员不用花太多时间在细节、代码或公式上,也能阅读下来。
创建自己的薪酬调查表 316
综合指标 209
数据科学家的职能 80
多层次讨论数据科学是什么,包含丰富的教程和案例研究,提供大量职业资源,是数据科学家的求职与准备必备指南
然而,本书也包含一些高度概括性的进阶材料。本书中的一些技术讲义,是针对那些对数学更有倾向和有兴趣深入挖掘的读者。有两年大学微积分、统计学和矩阵理论知识的读者,将能更好地理解这些技术细节。本书提供了一些源代码(R、Perl)和数据集,但本书的重点不是编码。
?对于想要创建一个数据科学创业公司或顾问公司的企业家,在第3章中会找到商业计划书样板、创业公司点子和针对顾问职位的薪酬调查。同时,在本书中,数据顾问会了解如何提高数据科学工作沟通效率,掌握数据科学项目的生命周期,并得到相关书籍、会议参考和许多其他资源。
正因为这本书内容如此之好,能满足读者所需,于是我痛快答应电子工业出版社付睿编辑的邀约来翻译本书。但这个小想法变成最终成品,却耗费不少人的时间和精力,对他们的感谢和亏欠不能尽录。我最要鸣谢翻译合作者光启研究院的副院长季春霖博士,还有在哈工大深圳研究生院任教的张晓峰博士,两位的研究和管理任务都很繁重,面对译书这种流程漫长、成效滞后的工作,他们展现了学界出身的坚韧素养,而在翻译校对本书的过程中,又处处体现出手不凡的专业功力。同时,也要感谢配合翻译校对本书的助手和出版社工作人员,他们对我有莫大的包容和支持。本书准备期间,也正是我的一对小孩——泰学和雅学——从孕育到出生的过程,所以要感谢我的太太熊瑛,容许我为本书挤出不少本来可以陪伴家人的时间。
谁应该参与战略思考 299
理论上的解决方案 155
一个新的大数据定理 213
一阶近似 191
第5章 数据科学的技术(II) 167
创业者 105
译者序
数学模型与基准 244
在线广告:到达率和频率的计算公式 256
在7天内优化关键词广告宣传活动 258
第4章 数据科学的技术(I) 119
?交流互动:在页面下方 读者评论 处留下您的疑问或观点,与我们和其他读者一同学习交流。
大数据的相关性和拟合度 143
隐性决策树 169
8种最差的预测建模技术 72
数据科学项目的生命周期 186
股票交易的API:具体实现 225
把患者分成不同的人群进行治疗 196
情景9:NLP的7个棘手句子 27
方法 157
两种类型的统计学家 300
新大学的面貌 7
13个真实世界情景中的数据科学应用 14
优化数字营销活动的指标 121
本书的技术部分包括数据科学的核心内容,比如:
情景4:异常空间的回归 21
欺诈检测 240
源代码 178
真伪数据科学对比 2
注意 本书中的注意、提示、交叉参考,以及对当前讨论的辅助说明,将像这个注意的方式显示。
统计学家的统计建模方法 183
计算复杂度 152
些许数学知识 229
数据科学家 10
改进相关性的算法 270
选择合适的分析工具 124
为了帮助你从本书中学到最多的东西,而不是一头雾水,我们将在本书中使用惯例标记。
方法 175
极限数据科学家 89
?我们在书中显示文件名、链接和代码的格式如下。
分析桥第一定理 176
新型指标 120
沟通问题 70
?一种统计科学上新颖、简化、对数据科学友好的方法,重点在于它是一种健壮的无模型方法。
目录
会议与组织 322
第3章 成为一名数据科学家 80
情景11:用较好的相关性增加亚马逊的销售量 30
因果关系和相关性 183
技术问题 285
确定簇的数量 157
数据科学招聘广告的样本 329
数据科学的历史、开拓者和现代趋势 33
本书为潜在的和现有的数据科学家和相关专业人员(以及他们的管理者和老板)提供了宝贵的职业资源。宽泛而言,本书适用于所有处理更大、更复杂、更新、频率更快的数据的专业人士。本书还提供一些数据科学的秘诀、技巧、概念(其中许多是原创和首次公开的)、带实施方法和技术的案例研究,以及已经在不同领域,不论是手动还是自动,能成功分析现代数据的技术。
大数据问题是数据科学所面临挑战的缩影 56
数据科学家与数据架构师密切合作 299
可视化 128
点击评分优化关键词出价 247
工作原理 199
?顶尖的机器学习方法(隐性决策树和组合特征选择)。
数据科学家的主要特征 80
面试问题 283
模式检测的极值理论 255
本书有3个组成部分:一是多层次地讨论数据科学是什么,以及数据科学涉及哪些其他学科;二是数据科学的技术应用层面,包括教程和案例研究;三是给正在从业和有抱负的数据科学家介绍一些职业资源。本书中有很多职业和培训相关资源(如数据集、网络爬虫源代码、数据视频和如何编写 API),所以借助本书,你现在就可以开始数据科学实践,并快速地提升你的职业水平。如果你是一位决策者,你会在本书中找到一些信息,来帮助你建立更好的分析团队,以及决定是否需要及何时需要专业的解决方案,以及哪些方案最为恰当。
?求职者将会在第3章中找到有关数据科学的培训和课程资源。第7、8章为求职者提供了大量的资源,包括面试问题、简历模板、招聘广告样板,经常招聘数据科学家的公司的清单,以及薪资调查等。
方差的抽象概念 211
根据技能和位置的薪酬分类 312
页面入口:
读者服务
除了技术,本书还提供了有用的工作资源,包括工作面试的相关问题、简历模板和招聘广告样板。本书的另一个重要组成部分是案例研究。本书的案例研究,有些带有统计或机器学习的意味,有些则跟商业或决策科学或运筹学有关,有些则关乎数据工程。大多数时候,我喜欢Data Science Central(这是个数据科学家的领先社区)上最新发表和非常热门的主题,而不是我特别重视的话题。
简历样本 329
大学课程 91
最后,我还要代表季春霖博士感谢广东省自然科学杰出青年基金项目(No.S20120011253)和深圳市数据科学与建模技术重点实验室的资助。也要感谢我所在的宜远智能团队,他们在将本书中许多数据科学方法实践到医疗健康领域时,提出了诸多宝贵的翻译修正补充建议。当然,对专业内容的翻译,难在对作者见识的理解和原意的把握,所以总有力有不逮、不甚精确之处,请各位读者和专家对此海涵,提出宝贵的建议。
可视化工具 125
无模型的统计建模 134
三类指标:中心性、波动性、颠簸性 137
示例:互联网流量打分 173
网络拓扑映射 159
?当我们介绍术语和重要的词时,我们会用楷体突出它们。
计算q(n) 152
数字分析 256
总结 282
如果你有一两年大学基本定量课程的知识基础,就足以理解书中大多数内容。本书不需要微积分或高等数学的相关知识——事实上,它几乎不包含任何数学公式或符号。
误导性的时间序列和随机游走 295
组合优化自动快速的特征选择 249
这本书是写给数据科学家和相关专业人士的(如业务分析师、计算机科学家、软件工程师、数据工程师和统计学家),以及有兴趣转投大数据科学事业的人。本书也是为学习定量课程、想成为数据科学家的大学生所准备的。最后,本书也可供数据科学家的上级领导、想创建数据科学初创公司开展业务或提供数据科学咨询的人阅读。
预测模型的错误 189
私人定制的治疗 197
情景7:汽油中的铅会导致高犯罪率。真的吗 25
数据科学家与业务分析师 13
职业建设资源 327
数据科学家的分类 302
总结 215
结论 175
惯例标记
情景3:数据故障将数据变成乱码 19
1亿行的Excel 63
专业资源 318
这本书包含了少量的R或Perl示例代码。你可以在 activestate.com/activeperl/downloads下载Perl,在 r-project.org/bin/windows/base/下载 R。如果你使用Windows 计算机,首先需要安装一个Linux式环境:Cygwin。你可以在 com/install.html上下载Cygwin软件。Python也是开源的,且有一个有用的、被称为Pandas的库。
一些误解 246
用R生成数据视频 129
中心性、波动性和颠簸性之间的关系 138
在路口停车场收集数据 281
数据科学家的类型 86
伪数据科学的两个例子 5
关于数据科学项目的问题 288
在Excel中计算颠簸性 139
情景12:检测Facebook上的假档案或假“喜欢”数 32
最近的问答讨论 40
大数据生态系统 78
总结 317
总结 44
实施案例 199
结构系数 156
分析即服务和应用程序接口 198
渐近分布与归一化 148
本书最适合有志于在大数据与数据科学领域从业的人学习。格拉德威尔在《异类》一书中强调,“若要成为行业专家,离不开十万小时的刻意学习(deliberate learning)”,这跟中国俗语里“板凳要坐十年冷”有些类似。但要实现刻意学习,就不能一味依赖通识科普书籍。在大数据与数据科学领域,市面上已不缺通识性的科普书籍,唯缺这类烧脑、有专业性、适合进行刻意学习的数据科学书籍。
数据科学家职业道路 98
?用作教程的技术材料(第4章和第5章,以及第2章中关于大规模数据集聚类和分类的内容,第8章中关于Hadoop 的新变化和大数据的内容),以及案例研究(第6章和第7章)。
杂项 273
识别偏差 294
定义颠簸性 138
LinkedIn上的顶级数据科学家 306
验证码破解 239
我要感谢来自Wiley的Chris Haviland和Carol Long,他们对本书的出版有很大的贡献,承担了不少风险,他们把我很多有价值、分散未经组织的在线文章,整合成一本连贯、全面和有用的书。从许多方面来看,这个复杂的过程类似于将非结构化数据转化为结构化数据,这是许多数据科学家经常面对的常规挑战,而这本书也正好提供了将非结构化数据转化为结构化数据的解决方案。同时,我要感谢我的商业伙伴和共同创始人 Tim Matteson,他帮助Data Science Central这个网站成为数据科学社区的领导者,还变成了一个现代的、专注于产生价值的创业项目。最后,我要感谢我们社区的所有成员,感谢他们的评论和支持。如果没有他们的帮忙,本书也无法出版。
欺诈检测的指标 122
数据科学的其他应用 282
把计算机科学、统计学和行业专业知识结合在一起 74
无模型的统计建模是什么 135
大数据与取样 301
自学成才的数据科学家 86
实现:通信和计算成本 214
对于大多数代码, 我们使用Courier New字体,不加粗。
重点还是最新的技术。在本书中你不会找到关于旧技术的资料介绍,如线性回归(除非在引文里涉及),因为这些在经典书籍里已经讨论了很多。在本书中,对逻辑回归类的知识讨论不多。我们只是将逻辑回归与其他分类器混合,提出一种数值稳定的近似算法(近似的解决方案往往和精确模型一样有效,毕竟没有任何数据完全符合理论模型)。
简单模型会获得更好的销售预测 273
虚假转化产生的偏差 245
免责声明:凡本网注明 “来源:XXX(非中国房产新闻网)” 的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。