1、 公式(3.4)的推导。

可以直接对公式(3.3)中的$\beta_0$求导就得到$\hat{\beta}_0=\bar{y}-\beta_1\bar{x}$。

对公式(3.3)中的$\beta_0$求导会有:

$(y_1-\hat{\beta_0}-\hat{\beta_1}x_1)x_1+(y_2-\hat{\beta_0}-\hat{\beta_1}x_2)x_2\ldots+(y_n-\hat{\beta_0}-\hat{\beta_1}x_n)x_n$

将$\hat{\beta}_0=\bar{y}-\beta_1\bar{x}$代入上面的式子就有:

$\displaystyle \sum_{i=0}^n (y_i-(\bar{y}-\beta_1\bar{x})-\hat{\beta_1}x_i)x_i $

$\displaystyle = \sum_{i=0}^n (y_ix_i-\bar{y}x_i+\beta_1\bar{x}x_i-\hat{\beta_1}x_i^2) $    公式(1)

注意这样两个事实:

(a) $\displaystyle \sum_{i=0}^n \left(-x_i+\bar{x}\right)\bar{x}=\sum_{i=0}^n \left(-x_i\bar{x}+\bar{x}^2\right)=0$

(b) $\displaystyle \sum_{i=0}^n \left(-y_i+\bar{y}\right)\bar{x}=\sum_{i=0}^n \left(-y_i\bar{x}+\bar{y}\bar{x}\right)=0$

将这个两个等式代入到公式(1)中,则有

$\displaystyle  \sum_{i=0}^n\left(y_ix_i-\bar{y}x_i-\bar{x}(y_i-\bar{y}-\left( \bar{x}x_i+x_i^2-x_i\bar{x}+\bar{x}^2\right) \hat{\beta_1}\right) $

$\displaystyle = \sum_{i=0}^n\left((y_i-\bar{y})(x_i-\bar{x})-( x_i-\bar{x})^2\hat{\beta_1} \right)$

2、公式(3.7)的由来。

公式(3.7)反应了样本均值与总体(Population)  均值之间的偏离程度。假设总体的均值为$\mu$,方差为$\sigma^2$,$\mu_1,\mu_2,\ldots,\mu_n$是从总体中抽取的$n$个样本。样本均值$\bar{\mu}=\frac{1}{n}\sum_{i=1}^n\mu_i$,则有:

$var(\bar{\mu})=E(\bar{\mu}-E(\bar{\mu}))=E\left(\frac{1}{n}\sum_{i=1}^n(\mu_i-\mu)\right)=\frac{\sigma^2}{n}$

这个公式需要用到这样的事实:各个样本之间是独立的随机变量,比如$x_1,x_2$是独立同分布的随机变量,其对应的分布的期望和方差分别为$\mu$和$\sigma^2$,则:

$E\left(x_1+x_2-E(x_1+x_2)\right)^2=E\left(x_1+x_2-2\mu\right)^2=E(x_1^2)+E(x_2^2)+2E(x_1x_2)-4\mu E(x_1)-4\mu E(x_2)+4\mu^2)$

$=E(x_1^2)+E(x_2^2)-2\mu^2=2\sigma^2$

注意,由于前面已经假设$x_1,x_2$是独立的,则$E(x_1x_2)=E(x_1)E(x_2)$。

3、公式(3.8)的推导

可用方差(或标准差的平方)来度量某次参数估计与参数的均值之间差多远(见公式(3.7))。在对参数$\hat{\beta_1}$的估计中,随机变量是$y_i=f(x_i)+\epsilon_i$,其中$var(\epsilon_i)=\sigma^2$,因此有$var\left(y_i-\bar{y}\right)=\sigma^2$(注意,这里的$\bar{y}$是由多个$y_i$相加而得到,可看成是一个常量,实际上它会接近于$\epsilon_i$对应的分布的均值)。 这里假定$\epsilon_i$是对同一分布采样得到,而且这些采样是独立的(见原版书Pxx也是这样规定的),则

$\displaystyle \sum_{i=1}^n var\left((x_i-\bar{x})(y_i-\bar{y})\right)=n\sigma^2\left(\sum_{i=1}^n(x_i-\bar{x})^2\right)$

这个等式成立是利用了这样的定理:若随机变量$\xi_1$与$\xi_2$互不相关,则$var(\xi_1+\xi_2)=var(\xi_1)+var(\xi_2)$。

因此,有

$SE\left(\hat{\beta_1}\right)^2=SE\left(\frac{\sum_{i=1}^n\left((x_i-\bar{x})(y_i-\bar{y})\right)}{\sum_i^n(x_i-\bar{x})}\right)^2=\frac{n\sigma^2\left(\sum_{i=1}^n(x_i-\bar{x})^2\right)}{n\left(\sum_{i=1}^n(x_i-\bar{x})^4\right)}=\frac{\sigma^2}{\left(\sum_{i=1}^n(x_i-\bar{x})^2\right)}$

注意,上面这个等式中的$(x_i-\bar{x}$不是随机变量。

同理可得$SE(\hat{\beta_0})^2=\sigma^2\left[\frac{1}{n}-\frac{\bar{x}^2}{\left(\sum_{i=1}^n(x_i-\bar{x})^2\right)}\right]$

4、公式(3.23)的说明。

公式(3.23)的分子是一个自由度为p的卡方分布(chi squred distribution);而分每是一个自由度为(n-p-1)的卡方分布,因此它们相除就是F分布,即F(p,n-p-1)。

The Elements of Statistical Learning第3章导读的更多相关文章

  1. More 3D Graphics (rgl) for Classification with Local Logistic Regression and Kernel Density Estimates (from The Elements of Statistical Learning)(转)

    This post builds on a previous post, but can be read and understood independently. As part of my cou ...

  2. Some 3D Graphics (rgl) for Classification with Splines and Logistic Regression (from The Elements of Statistical Learning)(转)

    This semester I'm teaching from Hastie, Tibshirani, and Friedman's book, The Elements of Statistical ...

  3. ≪统计学习精要(The Elements of Statistical Learning)≫课堂笔记(三)

    照例文章第一段跑题,先附上个段子(转载的哦~): I hate CS people. They don't know linear algebra but want to teach projecti ...

  4. Hand on Machine Learning第三章课后作业(1):垃圾邮件分类

    import os import email import email.policy 1. 读取邮件数据 SPAM_PATH = os.path.join( "E:\\3.Study\\机器 ...

  5. 《Deep Learning》第二章 线性代数 笔记

    第二章 线性代数 2.1 名词 标量(scalar).向量(vector).矩阵(matrix).张量(tensor) 2.2 矩阵和向量相乘 1. 正常矩阵乘法: 2. 向量点积: 3. Hadam ...

  6. 斯坦福公开课:Statistical Learning中做错的选择题

    4.4 R1 In which of the following problems is Case/Control Sampling LEAST likely to make a positive i ...

  7. Learning Perl 第九章习题第二题

    把输入文件中的所有Fred换成Larry, 不区分大小写. 知识点 1. 文本文件读写 2. 简单的正则替换 3. unless 的用法 4. $_ 的用法

  8. Introduction to statistical learning:with Applications in R (书,数据,R代码,链接)

    http://faculty.marshall.usc.edu/gareth-james/ http://faculty.marshall.usc.edu/gareth-james/ISL/

  9. Hand on Machine Learning 第三章:分类器

    1. 获取数据 使用MNIST数据集练习分类任务 from sklearn.datasets import fetch_mldata from scipy.io import loadmat mnis ...

随机推荐

  1. AppCompatActivity工具栏的设置(返回操作)

    <android.support.v7.widget.Toolbar android:theme="@style/ThemeOverlay.AppCompat.Dark.ActionB ...

  2. margin

    <!doctype html> <html> <head> <meta charset="utf-8"> <title> ...

  3. css05 字体以及行间距

    <head><meta charset="utf-8"><title>无标题文档</title><style>#box{ ...

  4. 详细讲解MOSFET管驱动电路(转)

    作者:   来源:电源网 关键字:MOSFET 结构 开关 驱动电路 在使用MOS管设计开关电源或者马达驱动电路的时候,大部分人都会考虑MOS的导通电阻,最大电压等,最大电流等,也有很多人仅仅考虑这些 ...

  5. git 使用系列(一)—— git stash 的使用

    1. git 放弃本地修改 git checkout . #本地所有修改的.没有的提交的,都返回到原来的状态 git stash #把所有没有提交的修改暂存到stash里面.可用git stash p ...

  6. Hibernate的generator属性

    本文讲述Hibernate的generator属性的意义.Generator属性有7种class,本文简略描述了这7种class的意义和用法. <class name="onlyfun ...

  7. 洛谷 U4704 函数

    设gcd(a,b)为a和b的最大公约数,xor(a,b)为a异或b的结果. 题目描述 kkk总是把gcd写成xor.今天数学考试恰好出到了gcd(a,b)=?这样的题目,但是kkk全部理解成了xor( ...

  8. iOS开发——GCDAsyncSocket

    新进的这家公司搞智能家居,就随便整理一下其相关技术吧!首先,从GCDAsyncSocket的使用问题着手. 正如名称一样GCDAsyncSocket开源类库是以苹果的GCD多任务处理机制完成的一个异步 ...

  9. MySQL中文乱码修改

    一.从服务端进行修改 show variables like "%char%"; 然后可能显示如下信息,注意红色部分,不同的用户可能实际情况不同,但是需要保证除了 filesyst ...

  10. 一道js题(引用类型、基本类型、包装对象、函数赋值)

    var a = 1; var obj = {     b: 2 }; var fn = function () {}; fn.c = 3;   function test(x, y, z) {     ...