概念入门统计描述与离散度量
众数
也叫:Mode
数据集中出现次数最多的数。
核心讲解
众数是数据集中出现频率最高的那个数。例如{2,4,5,5,7,8,8,8,10,12}中8出现最多,众数就是8。英文mode也有“流行”之意,可以借此记忆。
众数有几条特殊规则:它可以不止一个——只有一个叫单峰,两个叫双峰,三个叫三峰;如果所有数据都不相等,则这个数据集没有众数。原书特别指出,当数据用名义尺度度量(比如类别)时,众数能有效识别出现最频繁的类别。
众数最大的好处是不受极端值影响,也不要求数据能排序或计算,适合分类数据;缺点是可能不唯一,甚至在数据没有重复时根本不存在,因此在连续数据里用得较少(连续分布中会另作定义)。
费曼版:用大白话再讲一遍
统计全班同学最喜欢的颜色,选红色的人最多,那红色就是“众数”。它不在乎颜色的数值大小,只关心哪个选项被选得最频繁——所以用来找“最常见的类别”很合适。
要点
- 众数=出现频率最高的数。
- 可以不止一个(双峰、三峰),也可能不存在。
- 不受极端值影响,适合名义尺度等分类数据。
- 识别“最常见类别”时非常有用的统计量。
常见误区
- 以为任何数据集都一定有众数,其实所有数据都不相等时就没有众数。
- 把“最大”当成众数,众数看的是出现次数而非数值大小。
- 在连续数据里生搬硬套众数,忽略了连续分布需另作定义。