一、随机变量与分布律

1. 随机变量

称满足可测性条件的实值函数 X:Ω→R 为随机变量(random variable),简记为 r.v.。

常见的有离散型(Discrete Random Variable)和连续型(Continuous Random Variable)随机变量。

这两类并不涵盖所有随机变量,例如还有混合型。

2. 离散型随机变量的分布律

X 的分布律/概率(质量)函数:

P(X=xi)=pi,i=1,2,…

其中 pi≥0,且 ∑ipi=1。

X 的概率分布表:

X x1 x2 ⋯
P p1 p2 ⋯

二、期望、方差与标准差

1. 期望

离散型随机变量的期望:

E(X)=∑ixipi.

性质:

  1. E(c)=c。
  2. E(kX)=kE(X)。
  3. E(X+b)=E(X)+b。
  4. E(kX+b)=kE(X)+b(线性)。
  5. 对有限个随机变量,有
E(∑i=1nciXi)=∑i=1nciE(Xi).

期望的线性性质不要求相互独立,对离散型和连续型都成立。

2. 方差

方差记为D(X)或Var(X),

D(X)=E[(X−E(X))2]=∑i(xi−E(X))2pi.

记 μ=E(X),则

D(X)=E[(X−μ)2]=E(X2)−2μE(X)+μ2=E(X2)−[E(X)]2.

性质:

  1. D(X)≥0。
  2. D(c)=0。
  3. D(aX+b)=a2D(X)。

3. 标准差

标准差记为 σ(X)或D(X),是方差的非负平方根:

σ(X)=D(X).

三、协方差、互斥、独立与不相关

1. 协方差与相关系数

协方差用来描述两个随机变量共同变化的方向:

Cov(X,Y)=E[(X−E(X))(Y−E(Y))]=E(XY)−E(X)E(Y).
  • Cov(X,Y)>0:正相关,整体上有同向变化的倾向。
  • Cov(X,Y)<0:负相关,整体上有反向变化的倾向。
  • Cov(X,Y)=0:不相关,但仍可能存在非线性依赖。

协方差的大小受单位影响。当 D(X)>0 且 D(Y)>0 时,可定义相关系数:

ρX,Y=Cov(X,Y)σ(X)σ(Y).

其取值范围为 −1≤ρX,Y≤1。

与方差的关系:

D(X+Y)=D(X)+D(Y)+2Cov(X,Y).

因此,

D(X+Y)=D(X)+D(Y)⟺Cov(X,Y)=0,

即 X,Y 不相关。

2. 互斥

互斥描述的是事件。若 A∩B=∅,则称事件 A,B 互斥,即不能同时发生,此时

P(A∩B)=0.

3. 独立

事件的独立:

事件 A,B 独立,是指

P(A∩B)=P(A)P(B).

当 P(A)>0 时,这等价于 P(B∣A)=P(B),即 A 的发生不改变 B 发生的概率。

随机变量的独立:

随机变量 X,Y 独立,是指对任意实数 x,y,都有

P(X≤x,Y≤y)=P(X≤x)P(Y≤y).

对离散型随机变量,这等价于对所有可能取值 xi,yj,都有

P(X=xi,Y=yj)=P(X=xi)P(Y=yj).

4. 它们之间的关系

  • 互斥与独立:若 P(A)>0、P(B)>0,且 A,B 互斥,则它们一定不独立。若互斥事件中至少有一个概率为 0,则它们也满足独立的定义。
  • 独立推出不相关:在二阶矩有限的前提下,独立可推出 E(XY)=E(X)E(Y),从而 Cov(X,Y)=0。
  • 不相关不能反推独立:不相关只排除了以协方差衡量的线性相关,不能排除其他依赖关系。

例如,令 X 等概率地取 −1,0,1,并令 Y=X2。则

E(X)=0,E(XY)=E(X3)=0.

所以 Cov(X,Y)=0。但

P(X=0,Y=0)=13,P(X=0)P(Y=0)=19.

两者不相等,故 X,Y 不独立。

四、常见离散型分布

1. 0–1 分布

X∼B(1,p)或X∼Bernoulli(p).

其中 0≤p≤1。也称两点分布、伯努利分布(这里的两个取值为 0 和 1)。

分布律:

P(X=1)=p,P(X=0)=1−p.

期望与方差:

E(X)=p,D(X)=p(1−p),σ(X)=p(1−p).

2. 二项分布

X∼B(n,p).

其中 n∈{1,2,…},0≤p≤1。

X 表示 n 次相互独立、每次成功概率均为 p 的伯努利试验中成功的次数。

分布律:

对于 0<p<1,

P(X=k)=(nk)pk(1−p)n−k,

其中 k=0,1,…,n。

当 p=0 时,X=0 的概率为 1;当 p=1 时,X=n 的概率为 1。

令 Xi 表示第 i 次试验是否成功,则 Xi∼B(1,p),且 X=∑i=1nXi。

期望与方差:

E(X)=np,D(X)=np(1−p),σ(X)=np(1−p).

最可能取值

求使 P(X=k) 最大的 k,即众数。记 Pn(k)=P(X=k)。

当 p=0 时,k=0;当 p=1 时,k=n。

当 0<p<1 时,由相邻两项之比

Pn(k+1)Pn(k)=n−kk+1p1−p

可知概率随 k 先增后减。解不等式可得

(n+1)p−1≤k0≤(n+1)p,

且 k0∈{0,1,…,n}。

  • 若 (n+1)p 不是整数,则唯一的最可能取值为 ⌊(n+1)p⌋。
  • 若 (n+1)p 为整数,则有两个最可能取值:(n+1)p−1 和 (n+1)p。

3. 几何分布

X∼Ge(p),0<p≤1.

在相互独立、每次成功概率均为 p 的伯努利试验中,X 表示首次成功所需的试验总次数,包括成功的那一次。

分布律:

P(X=k)=(1−p)k−1p,

其中 k=1,2,…。

期望与方差:

E(X)=1p,D(X)=1−pp2.

当 p=1 时,X=1 的概率为 1,上述公式仍成立。

4. 负二项分布

X∼NB(r,p).

其中 r∈{1,2,…},0<p≤1。

在相互独立、每次成功概率均为 p 的伯努利试验中,X 表示第 r 次成功所需的试验总次数,包括第 r 次成功的那一次。

分布律:

P(X=k)=(k−1r−1)pr(1−p)k−r,

其中 k=r,r+1,…。

令 Xi 表示从第 i−1 次成功后到第 i 次成功所需的试验次数(X1 从试验开始计数),则 X1,…,Xr 相互独立,且均服从 Ge(p)。

期望与方差:

E(X)=rp,D(X)=r(1−p)p2.

当 r=1 时,负二项分布就是几何分布;当 p=1 时,X=r 的概率为 1。

5. 泊松分布

X∼P(λ)或X∼Poisson(λ).

其中 λ>0。

分布律:

P(X=k)=λke−λk!,

其中 k=0,1,2,…。

期望与方差:

利用指数函数的级数展开,可得

E(X)=λ,D(X)=λ.

泊松分布的可加性

若 X1,…,Xn 相互独立,且 Xi∼P(λi),则

∑i=1nXi∼P(∑i=1nλi).

五、连续型随机变量与概率密度

1. 连续型随机变量

定义: 设 X 是随机变量,如果存在非负可测函数 p(x),使得对任意 −∞≤a<b≤+∞,都有

P(a<X≤b)=∫abp(x)dx,

则称 X 为连续型随机变量,p(x) 为 X 的概率密度函数(PDF),简称概率密度或密度。

这里的连续型是指分布具有概率密度,不能仅凭"取值可以是某个区间内的一切实数"判断。

2. 概率密度的直观含义

若 p(x) 在 x0 处连续,则对很小的 δ>0,

P(x0−δ<X≤x0+δ)≈2δp(x0).

因此,

p(x0)≈P(x0−δ<X≤x0+δ)2δ.

即概率密度近似等于"附近区间的概率 ÷ 区间长度",描述随机变量在某个位置附近出现的相对集中程度。

注意:p(x0) 是密度,不是 P(X=x0)。

3. 概率密度的性质

设 p(x) 是 X 的概率密度,则有:

(1)非负性

p(x)≥0.

(2)概率由面积表示

P(a<X≤b)=∫abp(x)dx.

更一般地,对任意 Borel 集 A,

P(X∈A)=∫Ap(x)dx.

(3)总面积为 1

∫−∞+∞p(x)dx=1.

(4)单点概率为 0

P(X=a)=0.

由此可得,连续型随机变量落在某个区间内的概率,与区间端点的开闭无关:

P(a<X≤b)=P(a≤X<b)=P(a≤X≤b)=P(a<X<b).

六、常见连续型分布

1. 均匀分布

设 a<b。若 X 的密度函数为

p(x)={1b−a,a≤x≤b,0,其他,

则称 X 服从 [a,b] 区间上的均匀分布,记为

X∼U(a,b)或X∼U[a,b].

直观理解:

区间内每个点的密度相同。对于 a≤c<d≤b,

P(c<X≤d)=d−cb−a.

概率正比于区间长度,因此等长子区间具有相同的概率。

适用情形:

  • 在给定有限区间内,按长度均匀地随机取值。
  • 几何概率问题,例如按长度、面积或体积均匀取点。
  • 随机模拟与蒙特卡洛方法。

2. 指数分布

设 λ>0。若 X 的密度函数为

p(x)={λe−λx,x≥0,0,x<0,

则称 X 服从参数为 λ 的指数分布,记为

X∼E(λ)或X∼Exp(λ).

其中 λ 为率参数。本文使用 Exp(λ),以便与期望记号 E(X) 区分。

区间概率与尾概率

对 0≤a<b,

P(a<X<b)=e−λa−e−λb.

对 a≥0,

P(X>a)=e−λa,P(X<a)=1−e−λa.

适用情形:

指数分布常用来描述等待时间或寿命。例如,在发生率恒定的齐次泊松过程中,相邻两次事件之间的等待时间服从指数分布。

无记忆性

若 X∼Exp(λ),则

P(X>s+t∣X>s)=P(X>t),s,t≥0.

在非负、非退化的连续型随机变量分布中,指数分布是唯一具有无记忆性的分布。

最小值分布

设 Xi∼Exp(λi),i=1,…,n,且 X1,…,Xn 相互独立。令

Y=min1≤i≤nXi,

则

Y∼Exp(∑i=1nλi).

特别地,当所有 λi=λ 时,

Y∼Exp(nλ).

3. 正态分布

设 μ∈R,σ>0。若 X 的密度函数为

p(x)=12πσexp⁡(−(x−μ)22σ2),x∈R,

则称 X 服从正态分布,记为

X∼N(μ,σ2).

其中 μ 是均值,σ 是标准差,σ2 是方差。注意:记号 N(μ,σ2) 的第二个参数是方差。

常见建模情形:

  • 数据受大量微小、独立因素影响。
  • 分布大致对称,中间多、两头少。
  • 极端值较少,但仍可能出现。
  • 在独立同分布且方差有限等条件下,样本量足够大时,样本均值近似正态。
  • 测量误差、自然波动、随机噪声等。

密度曲线的性质

  • 曲线关于 x=μ 对称,在 x<μ 时递增,在 x>μ 时递减。
  • 当 x=μ 时,密度取得最大值 12πσ。
  • 当 x→±∞ 时,p(x)→0。
  • 曲线在 x=μ±σ 处有拐点。
  • 固定 σ、改变 μ 时,图形形状不变,只沿横轴平移。
  • 固定 μ、改变 σ 时,对称轴不变。σ 越小,图形越高越窄;σ 越大,图形越低越宽。

标准正态分布

若

Z∼N(0,1),

则称 Z 服从标准正态分布,其密度记为

ϕ(x)=12πe−x2/2.

其分布函数记为

Φ(x)=P(Z≤x)=∫−∞xϕ(t)dt.

由对称性,

Φ(−x)=1−Φ(x).

对 a<b,

P(a<Z<b)=Φ(b)−Φ(a).

例: 求 P(−1<Z<2.12)。

P(−1<Z<2.12)=Φ(2.12)−Φ(−1)=Φ(2.12)−[1−Φ(1)]≈0.9830−1+0.8413=0.8243.

标准正态分布表

下表给出 Φ(z)=P(Z≤z),数值保留四位小数。

行表示整数位与十分位,列表示百分位。例如,查 Φ(1.23),取行 1.2、列 0.03,得到 0.8907。负数可利用 Φ(−z)=1−Φ(z) 计算。

z 0.00 0.01 0.02 0.03 0.04 0.05 0.06 0.07 0.08 0.09
0.0 0.5000 0.5040 0.5080 0.5120 0.5160 0.5199 0.5239 0.5279 0.5319 0.5359
0.1 0.5398 0.5438 0.5478 0.5517 0.5557 0.5596 0.5636 0.5675 0.5714 0.5753
0.2 0.5793 0.5832 0.5871 0.5910 0.5948 0.5987 0.6026 0.6064 0.6103 0.6141
0.3 0.6179 0.6217 0.6255 0.6293 0.6331 0.6368 0.6406 0.6443 0.6480 0.6517
0.4 0.6554 0.6591 0.6628 0.6664 0.6700 0.6736 0.6772 0.6808 0.6844 0.6879
0.5 0.6915 0.6950 0.6985 0.7019 0.7054 0.7088 0.7123 0.7157 0.7190 0.7224
0.6 0.7257 0.7291 0.7324 0.7357 0.7389 0.7422 0.7454 0.7486 0.7517 0.7549
0.7 0.7580 0.7611 0.7642 0.7673 0.7704 0.7734 0.7764 0.7794 0.7823 0.7852
0.8 0.7881 0.7910 0.7939 0.7967 0.7995 0.8023 0.8051 0.8078 0.8106 0.8133
0.9 0.8159 0.8186 0.8212 0.8238 0.8264 0.8289 0.8315 0.8340 0.8365 0.8389
1.0 0.8413 0.8438 0.8461 0.8485 0.8508 0.8531 0.8554 0.8577 0.8599 0.8621
1.1 0.8643 0.8665 0.8686 0.8708 0.8729 0.8749 0.8770 0.8790 0.8810 0.8830
1.2 0.8849 0.8869 0.8888 0.8907 0.8925 0.8944 0.8962 0.8980 0.8997 0.9015
1.3 0.9032 0.9049 0.9066 0.9082 0.9099 0.9115 0.9131 0.9147 0.9162 0.9177
1.4 0.9192 0.9207 0.9222 0.9236 0.9251 0.9265 0.9279 0.9292 0.9306 0.9319
1.5 0.9332 0.9345 0.9357 0.9370 0.9382 0.9394 0.9406 0.9418 0.9429 0.9441
1.6 0.9452 0.9463 0.9474 0.9484 0.9495 0.9505 0.9515 0.9525 0.9535 0.9545
1.7 0.9554 0.9564 0.9573 0.9582 0.9591 0.9599 0.9608 0.9616 0.9625 0.9633
1.8 0.9641 0.9649 0.9656 0.9664 0.9671 0.9678 0.9686 0.9693 0.9699 0.9706
1.9 0.9713 0.9719 0.9726 0.9732 0.9738 0.9744 0.9750 0.9756 0.9761 0.9767
2.0 0.9772 0.9778 0.9783 0.9788 0.9793 0.9798 0.9803 0.9808 0.9812 0.9817
2.1 0.9821 0.9826 0.9830 0.9834 0.9838 0.9842 0.9846 0.9850 0.9854 0.9857
2.2 0.9861 0.9864 0.9868 0.9871 0.9875 0.9878 0.9881 0.9884 0.9887 0.9890
2.3 0.9893 0.9896 0.9898 0.9901 0.9904 0.9906 0.9909 0.9911 0.9913 0.9916
2.4 0.9918 0.9920 0.9922 0.9925 0.9927 0.9929 0.9931 0.9932 0.9934 0.9936
2.5 0.9938 0.9940 0.9941 0.9943 0.9945 0.9946 0.9948 0.9949 0.9951 0.9952
2.6 0.9953 0.9955 0.9956 0.9957 0.9959 0.9960 0.9961 0.9962 0.9963 0.9964
2.7 0.9965 0.9966 0.9967 0.9968 0.9969 0.9970 0.9971 0.9972 0.9973 0.9974

一般正态分布的标准化

对于 X∼N(μ,σ2),令

Z=X−μσ,

则 Z∼N(0,1)。这一过程称为标准化。

对 a<b,

P(a<X<b)=Φ(b−μσ)−Φ(a−μσ).

特别地,

P(X<b)=Φ(b−μσ),P(X>a)=1−Φ(a−μσ).

例: 设 X∼N(2,0.32),求 P(X>2.4)。

P(X>2.4)=1−Φ(2.4−20.3)=1−Φ(43)≈0.0912.

若使用上表,并将 4/3 近似为 1.33,则得到

P(X>2.4)≈1−0.9082=0.0918.

正态分布的 3σ 规则

对于 X∼N(μ,σ2),

P(|X−μ|≤σ)≈0.6827,P(|X−μ|≤2σ)≈0.9545,P(|X−μ|≤3σ)≈0.9973.

即约有 68.27% 的概率落在 μ±σ 内,95.45% 的概率落在 μ±2σ 内,99.73% 的概率落在 μ±3σ 内。

4. 伽玛分布

设 α>0,β>0。若 X 的密度函数为

p(x)={βαΓ(α)xα−1e−βx,x>0,0,x≤0,

则称 X 服从伽玛分布,记为

X∼Γ(α,β).

这里采用"形状—率"参数化:

  • α 为形状参数。
  • β 为率参数。

有些资料使用尺度参数 θ=1/β,阅读时应注意区分。

伽玛函数及其递推关系

伽玛函数定义为

Γ(α)=∫0∞yα−1e−ydy,α>0.

它满足

Γ(α+1)=αΓ(α).

由于 Γ(1)=1,特别地,对正整数 n,

Γ(n)=(n−1)!.

与指数分布的关系

当 α=1 时,由 Γ(1)=1,密度化为

p(x)=βe−βx,x>0.

因此,

X∼Γ(1,β)⟺X∼Exp(β).

即指数分布是伽玛分布的特例。

与卡方分布的关系

若 Z∼N(0,1),则

Z2∼Γ(12,12).

称

Γ(n2,12)

为自由度为 n 的卡方分布,记为

χ2(n).

当 n 为正整数时,若 Z1,…,Zn 相互独立,且均服从 N(0,1),则

∑i=1nZi2∼χ2(n).

此外,称 Γ(α,1) 为标准伽玛分布。

七、常见分布汇总表

1. 离散型分布

分布名称 记号 参数范围 分布律 P(X=k) 期望 E(X) 方差 D(X)
0-1分布 B(1,p) 0≤p≤1 pk(1−p)1−k,k=0,1 p p(1−p)
二项分布 B(n,p) n∈{1,2,…}
0≤p≤1
(nk)pk(1−p)n−k
k=0,1,…,n
np np(1−p)
几何分布 Ge(p) 0<p≤1 (1−p)k−1p
k=1,2,…
1p 1−pp2
负二项分布 NB(r,p) r∈{1,2,…}
0<p≤1
(k−1r−1)pr(1−p)k−r
k=r,r+1,…
rp r(1−p)p2
泊松分布 P(λ) λ>0 λke−λk!
k=0,1,2,…
λ λ

2. 连续型分布

分布名称 记号 参数范围 概率密度函数 p(x) 期望 E(X) 方差 D(X)
均匀分布 U(a,b) a<b {1b−a,a≤x≤b0,其他 a+b2 (b−a)212
指数分布 Exp(λ) λ>0 {λe−λx,x≥00,x<0 1λ 1λ2
正态分布 N(μ,σ2) μ∈R
σ>0
12πσexp⁡(−(x−μ)22σ2) μ σ2
标准正态分布 N(0,1) — 12πe−x2/2 0 1
伽玛分布 Γ(α,β) α>0
β>0
{βαΓ(α)xα−1e−βx,x>00,x≤0 αβ αβ2
卡方分布 χ2(n) n∈{1,2,…} 即 Γ(n2,12) n 2n

说明:

  • 0-1分布是二项分布 B(n,p) 当 n=1 时的特例。
  • 几何分布是负二项分布 NB(r,p) 当 r=1 时的特例。
  • 指数分布是伽玛分布 Γ(α,β) 当 α=1 时的特例。
  • 卡方分布 χ2(n) 等同于 Γ(n2,12)。