#019. 概率六:假设检验与置信区间
#学习目标:从直觉到检验
掷 100 次硬币得到 60 个正面,「硬币偏了」这句话在面试里是不合格的答案——偏多少算偏?多大的偶然波动算正常?假设检验(hypothesis testing)给出的回答是:先假设硬币公平,再看这次数据在公平假设下有多「离谱」,离谱到给定水平就拒绝假设。置信区间(confidence interval)则换一个方向:不回答「是不是偏」,而是给真实正面率一个可信的范围。
本章还会处理两个高频追问。第一是大样本陷阱:偏差只有 1%,但样本量一百万次,结论会怎样?统计显著(statistical significance)与经济显著(economic significance)是两件事。第二是独立性不够用的时候:周六周日各 20% 下雨,两天都下雨的概率是多少?你会发现 marginals 完全决定不了答案,必须引入相关性。
原假设、检验统计量、显著性水平、拒绝域、p 值。面试里能五件套齐着说出来,比直接报答案更加分。
用「偏离了几个标准误」来度量异常:\(z=(\hat p-p_0)/\sqrt{p_0(1-p_0)/n}\)。它把所有二项检验统一成一个数。
z 随 \(\sqrt{n}\) 放大:同样 1% 的偏差,1 万次掷是边界案例,100 万次是压倒性拒绝。但每次交易的「边」还是 1%。
- 我能说出检验五要素,并区分 p 值与「原假设为真的概率」。
- 我会用连续性修正把二项问题换成正态计算,并知道何时必须用精确二项。
#知识点一:假设检验的完整框架
检验的逻辑是「带显著性水平的反证法」:先立一个默认的怀疑对象——原假设(null hypothesis)\(H_0\),例如「硬币公平」,即正面率 \(p=0.5\);然后构造一个统计量度量数据与 \(H_0\) 的偏离程度;偏离超过临界值,就拒绝 \(H_0\)。它永远不能「证明」\(H_0\) 正确,只能说数据不足以拒绝它——这一点是面试追问的重灾区。
原假设与备择:\(H_0: p=p_0\)(如 \(p_0=0.5\)),双边备择 \(H_1: p\ne p_0\)。怎么读:我们只在「偏得过分」时改口,方向不限。
z 统计量:\(z=\dfrac{\hat p-p_0}{\sqrt{p_0(1-p_0)/n}}\),其中 \(\hat p=X/n\) 是观测频率。怎么读:观测频率偏离假设值多少个标准误(standard error)。
拒绝域:双边 5% 水平的拒绝域是 \(|z|\gt 1.96\),因为 \(\Phi(1.96)=0.975\),标准正态落在 \(\pm 1.96\) 之外的概率恰为 5%。
p 值:在 \(H_0\) 为真的前提下,出现与观测同样极端或更极端数据的概率;双边 \(p=2(1-\Phi(|z|))\)。当 \(p\lt\alpha\)(如 \(\alpha=5\%\))时拒绝。
两类错误:第一类错误(type I)是把无偏判成偏,概率受 \(\alpha\) 控制;第二类错误(type II)是把偏判成无偏。降低一个必然抬高另一个,除非增加样本量。
p 值是一个条件概率 \(P(\text{数据如此极端}\mid H_0)\),而很多人误读成 \(P(H_0\mid\text{数据})\)——后者是贝叶斯量,需要先验(见 018 章)。检验只有「拒绝」和「不拒绝」两种输出:「不拒绝」是证据不足,不是「接受 \(H_0\)」。
什么时候这套框架失效。三点:其一,\(np_0\) 与 \(n(1-p_0)\) 都不能太小(经验下限各为 5),否则正态近似失真,应改用精确二项分布;其二,试验必须独立同分布——掷同一枚硬币满足,但「策略连续 100 天的日收益」之间常有自相关;其三,多重检验(multiple testing)会污染 \(\alpha\):同时检验 100 个策略,5% 水平下「恰好」平均有 5 个被误判显著,这是回测过拟合的统计根源。
#知识点二:正态近似与置信区间
二项精确概率 \(\binom{n}{k}p^k(1-p)^{n-k}\) 在 \(n\) 大时手算不动,中心极限定理(CLT)提供替代:若 \(X\sim \mathrm{Bin}(n,p)\),则 \(\dfrac{X-np}{\sqrt{np(1-p)}}\) 近似标准正态。离散换连续要付一笔「连续性修正」(continuity correction):把整数点 \(k\) 想成区间 \((k-0.5,\,k+0.5)\)。
单点概率:\(P(X=k)\approx \dfrac{1}{\sigma}\,\varphi\!\left(\dfrac{k+0.5-np}{\sigma}\right)\),其中 \(\sigma=\sqrt{np(1-p)}\),\(\varphi\) 是标准正态密度。怎么读:用正态密度在区间中点的值乘区间宽度 1。
尾概率:\(P(X\ge k)\approx 1-\Phi\!\left(\dfrac{k-0.5-np}{\sigma}\right)\),\(P(X\le k)\approx \Phi\!\left(\dfrac{k+0.5-np}{\sigma}\right)\)。
Wald 置信区间:\(\hat p\pm 1.96\sqrt{\dfrac{\hat p(1-\hat p)}{n}}\)。怎么读:真实 \(p\) 落入该区间的长期频率约 95%。标准误里用的是 \(\hat p\) 而不是 \(p_0\),因为区间不预设假设值。
区间与检验的对偶:95% Wald 区间不含 \(p_0\),当且仅当 5% 双边 z 检验拒绝 \(H_0: p=p_0\)。两个口径一问一答,答案必须一致。
z 统计量近似等于 \(\sqrt{n}\cdot|\hat p-p_0|/\sqrt{p_0(1-p_0)}\):偏差固定,样本量翻一百倍,z 翻十倍。所以「极其显著」可能只是「样本量极大」;每次交易能赚多少取决于效应量 \(|\hat p-p_0|\),与 \(n\) 无关。面试里主动说破这一点,是区分背题者与从业者的分水岭。
#例题详解 I:二项概率的两种算法
例题 1(源题 P7):掷一枚公平硬币 100 次,恰好得到 60 个正面的概率是多少?至少 55 个正面的概率呢?
建模。正面数 \(X\sim\mathrm{Bin}(100,\tfrac12)\),均值 \(\mu=np=50\),方差 \(\sigma^2=np(1-p)=25\),标准差 \(\sigma=5\)。第一问是单点概率 \(P(X=60)\),第二问是右尾概率 \(P(X\ge 55)\)。按题意给两条路线:精确二项与正态近似。
推导。精确口径:
正态近似(带连续性修正):60 对应区间 \((59.5,60.5)\),端点的 z 值为 \((59.5-50)/5=1.9\) 与 \((60.5-50)/5=2.1\),区间宽度折算成密度乘 1:
右尾从 54.5 起算:\(P(X\ge 55)\approx 1-\Phi\!\big((54.5-50)/5\big)=1-\Phi(0.9)\approx 1-0.8159=0.1841\)。
检验。两条路线在四位小数上一致(0.0108 对 0.0108,0.1841 对 0.1841),说明 \(n=100\)、\(p=0.5\) 时正态近似已非常准。量级自查:60 正在均值上方 2 个标准差处,单点概率 1% 合理;「至少 55」即「至少 1 个标准差」,正态下约 15.9%,二项略偏(离散修正后 18.4%),量级吻合。
面试怎么讲。先报模型 \(X\sim\mathrm{Bin}(100,\tfrac12)\)、\(\sigma=5\),然后说「单点用密度近似 \(\varphi(2)/5\)、尾概率用 54.5 的连续性修正」,最后主动给出两个数:1.08% 和 18.4%。若面试官追问「不用修正会怎样」:\(P(X\ge 55)\approx 1-\Phi(1)=15.9\%\),比精确值低估约 2.5 个百分点——修正的价值就在这一档精度。
#例题详解 II:这枚硬币偏不偏
例题 2(源题 P8):掷一枚硬币 100 次得到 60 正 40 反。在 5% 显著性水平下,能否认为硬币无偏?
建模。原假设 \(H_0: p=0.5\),双边备择 \(H_1: p\ne 0.5\)。观测 \(\hat p=0.60\),标准误 \(\sqrt{0.25/100}=0.05\)。
推导。计算 z 统计量:
双边 p 值 \(p=2(1-\Phi(2))\approx 2\times 0.0228=0.0455\lt 0.05\)。落入双边拒绝域,在 5% 水平拒绝无偏假设:这份数据与公平硬币不相容。
检验。对照例题 1:\(P(X\ge 60)\approx 0.0284\),加倍得精确双边 p 值约 0.057——正态近似把边界案例的 p 值略微估小了(0.0455 对 0.057)。也就是说:按 z 检验拒绝、按精确二项检验差一点点,结论对检验口径敏感,这正是「边界上的案例」。诚实的面试答案是:按 z 检验拒绝;但要说明 \(z=2\) 恰好压线,若显著性水平取 1% 则完全不拒绝。
面试怎么讲。「60/40 对应 z = 2,双边 p ≈ 4.6%,在 5% 水平刚好拒绝无偏;但这是边界案例——换精确二项检验 p ≈ 5.7%,就拒绝不了了。我会说数据偏向『偏币』,但证据强度一般,想下结论需要更多样本。」
例题 3(源题 P64 与 P51,同族对照):掷 1 万次得 5100 正,掷 100 万次得 51 万正——偏差都是 1%,硬币偏吗?
建模。两问的效应量相同:\(\hat p=0.51\),偏差 \(|\hat p-p_0|=0.01\);差别只在样本量 \(n=10^4\) 对 \(n=10^6\)。把 z 写成 \(z=\sqrt{n}\,|\hat p-p_0|/\sqrt{p_0(1-p_0)}\),就能直接看出样本量的作用。
推导。1 万次:标准误 \(\sqrt{0.25/10^4}=0.005\),
压线拒绝,与例题 2 同一档。100 万次:标准误 \(\sqrt{0.25/10^6}=0.0005\),
远超一切临界值:任何合理水平下都断然拒绝,正面率与 0.5 的差异是确凿的。
检验。两个 z 之比 \(20/2=10=\sqrt{10^6/10^4}\),与 \(\sqrt{n}\) 缩放律吻合。反向自查:若硬币真公平,100 万次掷出 z = 20 的事件概率约为 \(10^{-89}\)——远小于「连续中两次彩票」,可以放心排除巧合。
面试怎么讲。分两句话说清:「统计上,1% 的偏差在 1 万次时刚过 5% 线,在 100 万次时 z = 20,是压倒性的显著——显著性随 \(\sqrt n\) 增长,样本够大任何微小偏差都能检出。经济上,显著性不等于赚钱多少:每掷一次的期望优势仍是 0.01,价值取决于能重复多少次、赔率如何。一个 51% 胜率的赔率游戏,长期下注期望为正(可联系 024 章),但单次优势仍然很薄。」主动把统计显著与经济显著拆开讲,是这道题的得分点。
#例题详解 III:区间、叠加概率与相关性
例题 4(源题 P38):掷硬币 100 次观察到 70 个正面,给出真实正面率 \(p\) 的置信区间。
建模。样本量 \(n=100\),\(\hat p=0.70\)。用 Wald 区间:\(\hat p\pm 1.96\sqrt{\hat p(1-\hat p)/n}\)。适用条件 \(n\hat p(1-\hat p)=21\) 远大于 5,近似可靠。
推导。代入:
得 95% 置信区间约 \([0.61,\,0.79]\)。
检验。对偶自查:区间不含 0.5,对应 5% 双边检验拒绝公平——z 值为 \((0.70-0.50)/0.05=4\gt 1.96\),两个口径一致。区间半宽约 0.09,说明 100 次掷只能把 \(p\) 定位到 ±9% 的量级;想把它压到 ±3% 需要 \(n\) 放大 9 倍(900 次),因为半宽按 \(1/\sqrt n\) 收缩。
面试怎么讲。「Wald 区间 \([0.61,0.79]\);区间不包含 0.5,所以数据与公平硬币显著不符。另外我会补充:Wald 区间在 \(\hat p\) 靠近 0 或 1、或 \(n\) 小时会越界失真,业内更稳妥的是 Wilson 区间——能说出这一点通常会让面试官点头。」
例题 5(源题 P85):投递 100 家对冲基金,每家成功率 1%。至少拿到一个 offer 的概率是多少?请分别用渐近公式和伯努利变量的中心极限定理两种方法推导。
建模。offer 数 \(S=\sum_{i=1}^{100} I_i\),\(I_i\sim\mathrm{Bernoulli}(0.01)\) 相互独立,\(S\sim\mathrm{Bin}(100,0.01)\)。所求 \(P(S\ge 1)=1-P(S=0)\)。精确值是基准:\(P(S=0)=0.99^{100}\approx 0.366\),故 \(P(S\ge 1)\approx 0.634\)。
推导(方法一:泊松渐近)。稀有事件、\(n\) 大、\(np=\lambda=1\) 适中,二项收敛到泊松:\(P(S=0)\approx e^{-\lambda}=e^{-1}\),
推导(方法二:伯努利 CLT)。对 \(S\) 用正态近似:\(E[S]=np=1\),\(\mathrm{Var}(S)=np(1-p)=0.99\),\(\sigma\approx 0.995\)。事件 \(S=0\) 用连续性修正写成 \(S\lt 0.5\):
检验。三个数排序:精确 0.634、泊松 0.632、正态 0.692。泊松几乎无误差;正态明显偏大,原因是 \(np=1\) 太小、分布严重右偏,CLT 的适用条件(\(np\) 与 \(n(1-p)\) 都够大)不满足——CLT 把 \(P(S=0)\) 估小了(0.308 对 0.366)。结论取 63% 左右;并主动说明两个近似的适用边界。
面试怎么讲。「答案约 63%,远低于直觉的『100 次机会总该中了吧』。我会先给泊松口径 \(1-e^{-1}\),再用 CLT 复核,并指出正态在这里精度差是因为 \(np=1\) 太小——题目要求两种推导,但更重要的是知道哪种近似在什么条件下可信。」
例题 6(源题 P76):周六下雨概率 20%,周日下雨概率 20%。两天都下雨的概率是多少?
建模。令 \(A\)、\(B\) 分别为周六、周日下雨,\(P(A)=P(B)=0.2\)。两个边缘概率定不了联合分布——必须引入相关系数 \(\rho\) 才能回答。用伯努利指示变量 \(I_A,I_B\) 的协方差把联合概率参数化。
推导。单个指示变量的标准差为 \(\sqrt{0.2\times 0.8}=0.4\),故 \(\mathrm{Cov}(I_A,I_B)=\rho\times 0.4\times 0.4=0.16\rho\)。于是
可行范围由 Fréchet 界给出:\(\max(0,\,0.2+0.2-1)\le P(AB)\le \min(0.2,0.2)\),即 \(P(AB)\in[0,\,0.2]\),对应 \(\rho\in[-0.25,\,1]\)。独立(\(\rho=0\))时答案就是 4%;若两天有天气持续性(\(\rho\gt 0\),气象上的常态),答案高于 4%。例如 \(\rho=0.5\) 时 \(P(AB)=0.12\),联合表为:都下 0.12、只周六 0.08、只周日 0.08、都不下 0.72,边缘与相关系数均吻合。
检验。代入 \(\rho=1\) 得 \(P(AB)=0.2\):两天完全同涨同落,一致事件概率等于边缘——上界吻合;\(\rho=-0.25\) 得 0,正好是不可能再小的下界。公式与界都对得上。
面试怎么讲。「只给边缘答不了,答案写成 \(0.04+0.16\rho\);独立时 4%,但天气有持续性,实际通常高于 4%。这道题考的是:不相关不是默认选项,联合行为需要相关结构——这与 029 章的相关系数、026 章的回归残差是同一族考点。」
#误区与边界
一,把 p 值说成「原假设为真的概率」——它是 \(P(\text{数据}\mid H_0)\),不是 \(P(H_0\mid\text{数据})\)。二,把「不拒绝」说成「接受无偏」——正确表述是证据不足。三,忽略边界敏感性:60/100 的正态 p 值 4.6% 拒绝、精确二项 5.7% 不拒绝,压线结论要交代口径。四,把统计显著当经济显著:z 随 \(\sqrt n\) 涨,效应量不涨。五,默认独立:P76 说明只要问「联合」,就必须问相关性。
考官追问的常见变式还有三个方向。变样本量:例题 3 的对照已经覆盖——记住「效应量固定,z 随 \(\sqrt n\) 放大」。变检验方向:单边检验的临界值是 1.645 而非 1.96,拒绝域只在一侧,面试要先问清「偏大算偏,还是偏大偏小都算偏」。变统计量:若已知硬币要么公平要么 60% 正面,更优的检验是似然比或贝叶斯判别(018 章),z 检验只是对「任意方向偏离」的通用装备。另外,Wald 区间在 \(\hat p\) 极端(接近 0 或 1)时可能越出 \([0,1]\),小样本换 Wilson 或精确 Clopper–Pearson 区间。
#检查清单
- 我能完整说出检验五要素,并用 z 统计量对二项数据做双边检验(60/100 → z = 2,p ≈ 4.6%)。
- 我能在正态近似中正确使用连续性修正,并解释为什么 59.5 与 54.5 是正确的替换端点。
- 我能用 \(np\)、\(n(1-p)\) 的大小判断该用精确二项、正态近似还是泊松近似(P85 三口径对照)。
- 我会构造 Wald 置信区间(70/100 → \([0.61,0.79]\)),并说清它与双边检验的对偶关系。
- 我能解释统计显著与经济显著的区别,并算出「同样 1% 偏差、n 差百倍、z 差十倍」。
- 遇到「两个事件都发生」类问题,我能先问相关结构,并写出 \(P(AB)=0.04+0.16\rho\) 与可行域。
- 我知道多重检验为何会让 5% 的假阳性批量出现,并能把它连到回测过拟合。