☆ 保存 伯努利分布(Bernoulli Distribution)—— 用成功概率 p 描述一次 0/1 试验的离散概率模型
02/18/2026
伯努利分布(Bernoulli distribution)用于刻画一次试验中结果只能取 0 或 1 的离散随机变量。它只用一个参数 p(“成功=1”的概率)就能把一次观测的随机性与不确定性统一表达出来。
通俗地说:你做一次判断,结果要么“对(1)”、要么“错(0)”。此时 p 表示“做对的可能性”,而一次结果就记为 0 或 1。伯努利分布就是把这种单次成功/失败用概率语言规范化描述的基本规则。
把一次 0/1 观测用 p 概括,就能在同一框架下理解结果与不确定性。
方法(工作机制与核心特征)
-
定义与参数
- 随机变量 X 只能取 1(成功)或 0(失败)。
- 成功概率 p 表示“X 取 1 的可能性”,剩余概率自然由 1-p 决定。
- 因此只要知道 p,一次试验的概率结构就完全确定。
- 也正因为足够“原子化”,伯努利常被当作许多概率模型的基本积木。
-
概率质量函数(PMF)与计算方式
- 若观测到 x=1,则概率为 p;若观测到 x=0,则概率为 1-p。
- 这个规则可以写成一个统一的表达式,使得根据 x 是 0 还是 1 自动“选中” p 或 1-p。
- 因此给定一次观测,就能立刻计算“该观测出现的概率”。
- 下面的公式就是把这种选择机制压缩成数学形式的结果。
-
\[ P(X=x) = p^x(1-p)^{1-x} \]
\[ x \in \{0,1\} \]
当 x=1 时只剩下 p;当 x=0 时只剩下 1-p,从而把两种情形统一到同一条公式里。
-
期望与方差的直观理解
- 数学期望可以理解为“重复很多次后,1 出现的平均比例”。若成功概率为 p,那么平均成功比例也会趋近于 p。
- 例如 p=0.2,则在 100 次类似情形下,最自然的预期是大约 20 次成功。
- 方差刻画“结果在 0 与 1 之间来回翻转的剧烈程度”。当 p=0.5 时最不稳定,因为 0/1 最均衡、最容易波动。
- 反之当 p 接近 0 或 1 时,结果几乎一边倒,波动小、预测也更容易。
-
\[ \mathbb{E}[X] = p \]
\[ \mathrm{Var}(X) = p(1-p) \]
均值是 p;“0/1 混在一起”的波动强度由 p(1-p) 概括,并在 p=0.5 时达到最大。
-
与二项分布(Binomial distribution)的区别
- 伯努利关注的是“单次试验”的 0/1 结果。
- 二项分布关注的是“把同样的伯努利试验重复 n 次后,成功(1)出现了几次”。
- 比如掷一次硬币看是不是正面,这是伯努利;掷 10 次统计正面次数,这是二项。
- 换句话说:伯努利看一次结果本身,二项看多次结果的“成功次数”汇总。
-
用数值例子把含义讲清楚
- 当 p=0.2 时,一次试验中 X=1 的概率是 0.2,X=0 的概率是 0.8。
- 把类似试验做 100 次,预期成功大约 20 次;这正是“期望等于 p”的直观含义。
- 若把 p 改为 0.5,0 与 1 更接近各占一半,结果更常翻转;若把 p 改为 0.95,则几乎总是 1,结果更稳定。
- 因此 p 不仅决定“成功有多常见”,也同时决定“结果能有多摇摆”。
意义与局限
伯努利分布的核心意义在于:它是把二元(0/1)观测用成功概率 p 组织起来的“最小概率模型”。在点击率预测、垃圾邮件分类、缺陷检测等带 0/1 标签的问题中,它为“单条数据如何用概率解释”提供了基础视角。其局限也很明确:当结果类别超过两类时不能直接套用;若关心的不是一次结果,而是重复多次后的成功次数,就应扩展到二项分布等更高层级的模型来分析。
建议先读 (3/5)
+2
接下来推荐阅读 (5/20)
+5
- 8.4 Posterior Inference — 后验分布与推断为什么困难
- 8.7 Normalizing Constant — 概率分布中的归一化常数
- 8.5 Approximate Inference — 使用 MCMC 与 Variational Inference 近似后验分布
- 8.6 Data Distribution Modeling — 数据分布与生成模型的学习原理
- Valid Probability Distribution — 为什么概率分布必须归一化为 1
- Parameterized Probability Distribution — 概率模型如何用 Parameter 学习数据分布
- Stationary Distribution(平稳分布)— Markov Chain 的长期概率如何稳定下来
- Joint Distribution Modeling — AI 如何通过联合概率学习变量之间的关系
- Isotropic Gaussian Distribution — 如何用 Covariance Matrix 理解各方向等方差的概率模型
- High-Dimensional Probability Distribution — 机器学习如何学习高维数据中的概率结构
- Parametric Approximation(参数近似)— 用概率模型估计数据分布的原理
- Unnormalized Probability Model — 为什么概率模型通常先计算未归一化分数
- 8.3 Inverse Problems — 从 Forward Problem 到 Inverse Problem 的核心区别
- 8.9 Diffusion Models — 从加噪到去噪的生成过程
- Markov Chain — 转移概率如何驱动状态演化
- Gibbs Sampling — 逐个更新参数,如何从 Posterior 中采样
- Normalizing Constant(归一化常数)— 从相对权重到概率分布的关键一步
- Stochastic Inference(随机推断)— AI 如何用概率处理不确定结果
- Metropolis-Hastings Algorithm — 使用 MCMC Sampling Posterior 的原理
- Markov Chain Monte Carlo(MCMC)— 通过 Parameter State 采样推断 Posterior 的原理
同一主题文章 (3/3)
- Intractable Posterior — 为什么 Bayesian Inference 需要 Approximate Inference
- High-Probability Region — 机器学习如何识别数据分布中的高概率区域
- Hidden Variable(潜在变量)— 概率模型如何学习不可直接观测的信息
相关概念 (7/7)
- 概率估计——如何用数据计算不确定事件发生的可能性
- 期望值——考虑概率的平均值
- 概率论——为不确定现象提供量化、预测与推断基础的理论
- 概率分解——将复杂联合概率拆成条件概率链式乘积的计算方法
- 联合概率——用统一的概率结构刻画多个事件的同时发生
- 指数分布(Exponential Distribution)——用于刻画“事件发生前等待时间”的连续概率分布
- 条件概率分布(Conditional Probability Distribution)—— 在给定条件下的概率分布
📍 这个概念在 AI 学习地图中的位置
查看这个概念在整个 AI Universe 中的位置。
📍 AI Universe 中的当前位置
☰
重置 显示已完成 · 需要登录 加载中…
🌌 AI Universe
‹
›
⭐ 概念
请选择一个节点。