Coursera课程《数据科学家的工具箱》 约翰霍普金斯大学

Week3 Conceptual Issues

Types of Questions

Types of Data Science Questions

  • 描述性分析(Descriptive)

在没有额外的统计建模的基础上,这些描述通常没什么普遍性。

美国的人口普查就是一个描述性分析的例子。

  • 探索性分析(Exploratory)

在该分析类型中,我们试着去观察数据并发现之前未知的关系,因此这种分析有利于发现新的关联,同时也有助于确定今后的数据科学项目。

  • 推断分析(Inferential)

推断分析的目标是在少量观察的基础上,根据一小部分数据,将得到的信息进行归纳、外推到更大的群体。

例子:美国的空气污染控制对平均寿命的影响。

  • 预测分析(Predictive)

预测分析是利用某些对象收集到的数据,去预测下次观察很可能碰到的另一个对象的值。

有一点需要注意,即使通过x预测到了y,也不能说是x导致了y。

  • 因果分析(Causal)

这一分析类型就旨在了解,如果改变了一个变量的值会发生什么?这会对另一个变量的值造成怎样的改变?

实施因果分析的权威标准是,利用随机研究或随机对照试验来确认因果关系。

  • 机理分析(Mechanistic)

机理分析是要去理解变量的精确变化,和导致了其它变量精确变化的变量的过程。

机理分析最常见的应用范围,可能是在物理或工程学领域,利用一些比较简单的模型,就可以描述许多操作。

What is Data?

维基百科的定义

Data are values of qualitative or quantitative variables, belonging to a set of items.

定性变量是诸如原产国、性别或治疗方法之类的东西。它们不一定是有序的,也不一定是测量值。

定量变量是诸如身高、体重和血压等的数据。它们的测量值通常是连续的,在特定范围里的是有序的。

What About Big Data?

(基本没有干货……)

Experimental Design

安利一个数据共享网站figshare

Confounding

比如说假如在某项研究中,我们统计了鞋号和识字能力。然后我们试着去发现,鞋号和识字能力之间的相关性。

可能我们确实观察到了一些相关性,因为穿小号鞋的人可能会认识少一些的字。但是我们可能忽略了一点,年龄才是导致这个相关性的真正原因。因为婴儿的鞋号非常小,识字能力也很低。再长大一点,需要更大号的鞋子,认识的字也更多,所以年龄才是真正的导致鞋号和识字能力之间相关性的混杂因素。

所以如果我们只统计鞋号和识字能力,然后去发现两个变量之间的相关性,我们可能就误入歧途了。这种情况称作混杂(Confounding)。它关注于研究可能导致相关性的其它变量。

【DataScience学习笔记】Coursera课程《数据科学家的工具箱》 约翰霍普金斯大学——Week3 Conceptual Issues课堂笔记的更多相关文章

  1. 【Python学习笔记】Coursera课程《Using Python to Access Web Data》 密歇根大学 Charles Severance——Week6 JSON and the REST Architecture课堂笔记

    Coursera课程<Using Python to Access Web Data> 密歇根大学 Week6 JSON and the REST Architecture 13.5 Ja ...

  2. 【Python学习笔记】Coursera课程《Using Python to Access Web Data 》 密歇根大学 Charles Severance——Week2 Regular Expressions课堂笔记

    Coursera课程<Using Python to Access Web Data > 密歇根大学 Charles Severance Week2 Regular Expressions ...

  3. 【网页开发学习】Coursera课程《面向 Web 开发者的 HTML、CSS 与 Javascript》Week1课堂笔记

    Coursera课程<面向 Web 开发者的 HTML.CSS 与 Javascript> Johns Hopkins University Yaakov Chaikin Week1 In ...

  4. 《Using Python to Access Web Data》 Week3 Networks and Sockets 课堂笔记

    Coursera课程<Using Python to Access Web Data> 密歇根大学 Week3 Networks and Sockets 12.1 Networked Te ...

  5. 数据科学家:神话 &amp; 超能力持有者

    一个打破神话的季节,正在降临.        我将坦诚地揭穿人们关于数据科学家所持有的惯有看法.在下文中,我将一个一个展示这些观点,宛如将一个又一个的玻璃瓶子摔碎在墙壁上一样.        关于数据 ...

  6. 《Using Python to Access Web Data》Week4 Programs that Surf the Web 课堂笔记

    Coursera课程<Using Python to Access Web Data> 密歇根大学 Week4 Programs that Surf the Web 12.3 Unicod ...

  7. 《Using Python to Access Web Data》 Week5 Web Services and XML 课堂笔记

    Coursera课程<Using Python to Access Web Data> 密歇根大学 Week5 Web Services and XML 13.1 Data on the ...

  8. 【DeepLearning学习笔记】Coursera课程《Neural Networks and Deep Learning》——Week2 Neural Networks Basics课堂笔记

    Coursera课程<Neural Networks and Deep Learning> deeplearning.ai Week2 Neural Networks Basics 2.1 ...

  9. 【DeepLearning学习笔记】Coursera课程《Neural Networks and Deep Learning》——Week1 Introduction to deep learning课堂笔记

    Coursera课程<Neural Networks and Deep Learning> deeplearning.ai Week1 Introduction to deep learn ...

随机推荐

  1. c++读取文件夹及子文件夹数据

    这里有两种情况:读取文件夹下所有嵌套的子文件夹里的所有文件  和 读取文件夹下的指定子文件夹(或所有子文件夹里指定的文件名) <ps,里面和file文件有关的结构体类型和方法在 <io.h ...

  2. Delphi中Sender对象的知识

    Sender是一个TObject类型的参数,它告诉Delphi哪个控件接收这个事件并调用相应的处理过程.你可以编写一个单一的事件处理句柄,通过Sender参数和IF…THEN…语句或者CASE语句配合 ...

  3. ASP.NET MVC4中使用bootstrip模态框时弹不出的问题

    最近发现使用在MVC中使用bootstrip的模态框时弹不出来,但单独建立一HTML文件时可以弹出,说明代码没有问题,经过多次测试发现,在MVC的cshtml文件中添加上以下语句就能正常 @{ Lay ...

  4. RT-thread内核之小内存管理算法

     一.动态内存管理 动态内存管理是一个真实的堆(Heap)内存管理模块,可以在当前资源满足的情况下,根据用户的需求分配任意大小的内存块.而当用户不需要再使用这些内存块时,又可以释放回堆中供其他应用分配 ...

  5. java 写入int型时会自动转换成字符

    java  写入int型时会自动转换成字符

  6. cogs1667[SGU422]傻叉小明打字

    其实和CF498bName that Tune差不多 题意: 现在需要依次输入n个字符,第i个字符输入的时候有pi的概率输错,不论是第几次输入(0<=pi<=0.5).每输入一个字符的用时 ...

  7. P1955 [NOI2015]程序自动分析

    题目描述 在实现程序自动分析的过程中,常常需要判定一些约束条件是否能被同时满足. 考虑一个约束满足问题的简化版本:假设x1,x2,x3...代表程序中出现的变量,给定n个形如xi=xj或xi≠xj的变 ...

  8. Jquery常用正则验证

    常用校验的正则表达式var rulesConfig = { /** * str.replace(/^\s+|\s+$/g, '') 解析: str:要替换的字符串 \s : 表示 space ,空格 ...

  9. 洛谷 P3521 [POI2011]ROT-Tree Rotations 解题报告

    P3521 [POI2011]ROT-Tree Rotations 题意:递归给出给一棵\(n(1≤n≤200000)\)个叶子的二叉树,可以交换每个点的左右子树,要求前序遍历叶子的逆序对最少. 大体 ...

  10. POJ3690:Constellations(二维哈希)

    Constellations Time Limit: 3000MS   Memory Limit: 65536K Total Submissions: 6822   Accepted: 1382 题目 ...