☆ 保存 激活图维度——决定 CNN 中空间分辨率与特征表达规模的关键尺度
03/24/2026
激活图维度(Activation Map Dimension)是指CNN 每一层之后产生的特征图在高度、宽度与通道数上的维度结构。它同时决定了输入中的空间信息能保留多少,以及模型能够以多丰富的方式表达所学到的特征。
**通俗地说:**这就像把一张很大的地图一层层折起来,只保留最重要的标记。最开始,街道、建筑和形状都看得很清楚;越往后,地图本身会变小,但上面会出现更多有意义的标记,比如“这里是道路”“这里是边缘”“这里是人脸的一部分”。所谓激活图维度,说的就是这张“摘要地图”的大小,以及它包含了多少种特征标记。
随着卷积与池化不断重复,空间分辨率会被重新调整,按通道组织的特征表示会被重构,而每一层所关注的信息层次也会随之变化。
工作方式(原理、特点与设计含义)
-
基本结构
- 激活图通常可以表示为一个 H×W×C 的张量。
- 其中 H 和 W 表示空间分辨率,C 表示通道数,也就是不同卷积滤波器提取出的特征种类数量。
- 因此,这个维度结构同时包含了“某种信息出现在什么位置”的空间信息,以及“模型正在看什么特征”的语义信息。
-
卷积带来的变化
- 卷积层会根据卷积核大小、步幅和填充方式改变输出的高度与宽度。
- 输出通道数通常等于卷积核的数量。卷积核越多,模型就越能学习到更丰富的模式检测器。
- 例如,对一个 32×32×3 的输入使用 16 个 3×3 卷积核,并设置 padding 为 1、stride 为 1,那么输出就会变成 32×32×16。
- 也就是说,卷积既可以在保留或压缩空间结构的同时,又扩展特征表达的宽度。
-
输出尺寸的计算
- 输出的空间尺寸可以用下面的公式来计算。它能帮助我们在堆叠网络层之前,先预测维度会怎样变化。
-
\[ H_{out} = \frac{H_{in} – K + 2P}{S} + 1 \]
\[ W_{out} = \frac{W_{in} – K + 2P}{S} + 1 \]
只要知道输入尺寸、卷积核大小、填充和步幅,就可以计算输出特征图的空间大小。
-
公式的直观理解
- Hin、Win 表示输入尺寸,K 表示卷积核大小,P 表示填充,S 表示步幅。
- 卷积核越大,一次看到的区域越广,但输出尺寸也可能更快缩小。
- 填充有助于减少边缘信息的丢失,而步幅决定卷积核每次移动时跨过多少位置。
- 例如,对于一个 32×32 的输入,如果卷积核为 5×5、padding 为 0、stride 为 1,那么输出就是 28×28。
-
池化与分辨率压缩
- 池化通常会降低高度与宽度,从而减少计算量,并让表示更加紧凑。
- 与此同时,通道数一般会保持不变。
- 例如,对一个 32×32×16 的特征图应用 2×2 最大池化,输出会变成 16×16×16。
- 因此,池化并不是在减少特征种类,而是在用更粗粒度的方式总结这些特征出现的位置。
-
随深度变化的语义层次
- 较浅的层通常更容易捕捉边缘、亮度变化、颜色对比等低层特征。
- 中间层会进一步提取纹理、重复图案、边缘组合等更复杂的结构。
- 较深的层则更强调物体局部结构或类别区分所需的高层特征。
- 在这个过程中,随着网络加深,receptive field 也会逐渐增大,使得每个位置都能反映更大范围的输入上下文。
-
设计中的权衡关系
- 更长时间保持较高分辨率,有助于保留小目标和精细的位置细节。
- 相反,如果过早降低分辨率,虽然计算量会下降,但细节结构也可能过早消失。
- 增加通道数可以表达更丰富的特征类型,但也会同时提高内存和计算开销。
- 所以,很多 CNN 会在前面几层尽量保留一定的空间信息,而在后面逐步减小空间尺寸、增加通道深度。
-
面向任务的维度设计
- 对于图像分类来说,最终目标是类别判别,因此在后部进行更积极的 downsampling 通常是可以接受的。
- 而在目标检测或图像分割中,位置精度更重要,所以往往需要更长时间保留较高分辨率。
- 任务中目标越小,模型对前期分辨率损失就越敏感。
- 因此,激活图维度并不只是一个简单的数字,而是与具体任务目标直接相关的设计选择。
意义与局限
激活图维度是理解 CNN 如何保留输入分辨率、又如何逐步把它转化为更高层次特征表示的关键尺度。理解这个概念之后,我们就能更系统地分析各层之间的信息损失、表达能力变化以及计算成本差异,因此它对模型设计与调试都非常重要。尤其是在小目标识别、图像分类、目标检测和图像分割等任务中,不同任务对应的维度策略本来就不一样,这一点也可以通过激活图维度很好地解释。不过,如果维度缩小得太快,位置信息和细节结构就会丢失;反过来,如果维度长期保持得过大,内存占用和计算负担又会迅速增加。归根结底,一个设计良好的 CNN,需要通过合理调节激活图维度,在信息保留、语义表达和计算效率之间取得平衡。
建议先读 (3/5)
+2
接下来推荐阅读 (5/17)
+5
- 最大反池化——一种恢复经池化缩小后特征图位置信息的重建方法
- 上采样——扩展缩小后的特征图并恢复空间分辨率的方法
- 平移等变性——卷积的核心性质:输入移动,特征也随之移动
- 可学习上采样——用可学习操作提升分辨率的方法
- 平移不变性 — 位置改变也能识别同一模式的能力
- Segmentation Decoder — 为什么只有 Upsampling 还不够?
- Sub-pixel Convolution — 将通道信息展开到空间维度,实现高分辨率图像生成
- 4. 多层感知机(MLP)—— 神经网络的基本结构与学习原理
- EDSR (Enhanced Deep Super-Resolution) — 它为何大幅提升了 Super-Resolution 的重建能力?第 1 部分
- 7.9 大型语言模型中的现代Transformer模块——2024时代Transformer架构的核心变化
- 7. Transformer —— 从 Self-Attention 到最新 LLM 架构
- 7.4 多头注意力、位置编码与 Add & Norm — 完成 Transformer 模块的核心结构
- 7.1 Transformer 架构与核心组件 — 序列到序列模型与编码器-解码器结构
- 棋盘格伪影 — 上采样中的网格状失真
- 基于插值的上采样 —— 依据邻近像素估计数值来提升分辨率的传统放大方法
- 步幅卷积(Strided Convolution)—— 在降低分辨率的同时提取特征的下采样方式
- Inception 模块——一种通过并行使用不同感受野来同时学习多尺度空间特征的 CNN 架构
同一主题文章 (0/0)
该单元暂时没有其他文章。
相关概念 (4/4)
- Self-Attention 与 Cross-Attention —— 输入内部信息连接与跨输入信息关联的区别
- Transformer QKV 机制详解:Self-Attention 如何完成信息检索与聚合
- Matrix Formulation of Self-Attention — 为什么要用矩阵计算 Token 之间的关系
- Bottleneck Architecture — 通过通道压缩降低计算量与参数规模的网络模块设计
📍 这个概念在 AI 学习地图中的位置
查看这个概念在整个 AI Universe 中的位置。
📍 AI Universe 中的当前位置
☰
重置 显示已完成 · 需要登录 加载中…
🌌 AI Universe
‹
›
⭐ 概念
请选择一个节点。