DBSCAN — 基于密度的聚类与噪声检测算法

DBSCAN (Density-Based Spatial Clustering of Applications with Noise)是一种通过分析数据点的密度分布来构建Cluster,并将处于低密度区域的孤立点识别为Noise的无监督学习聚类算法。它最大的特点是不需要预先指定Cluster数量,同时能够发现非规则形状的数据分布。与先决定“需要划分多少组”的方法不同,DBSCAN会直接在数据空间中寻找密度连续的区域,并根据这些区域之间的连接关系形成Cluster。

07/28/2026

Outlier Exposure——利用外部 OOD 数据降低模型过度自信的机制

Outlier Exposure是一种在训练阶段引入外部 out-of-distribution(OOD)数据,帮助模型区分已知分布输入与未知输入的方法。传统分类模型通常只学习如何在已有类别之间进行判断,因此当遇到训练数据之外的样本时,仍可能强行选择某个类别,并给出过高的置信度。

08/02/2026

Temporal Convolutional Network (TCN) — 用于学习时间序列长程过去依赖的因果卷积结构

Temporal Convolutional Network (TCN) 是一种面向时间有序数据的 1D 卷积模型,它在预测时只使用当前和过去的信息,而不会访问未来信息。和按时间一步一步计算的 RNN 不同,TCN 可以并行处理多个时间点,同时又能稳定地学习长程时间依赖。

04/20/2026

在线异常检测(Online AD)——在流式数据中即时发现异常信号

在线异常检测(Online Anomaly Detection, Online AD)面向持续到来的流式数据(日志、传感器、网络流量、业务指标等),在数据偏离正常模式的第一时间发现异常(anomaly),并尽量做到低延迟告警。它不是“攒一批再分析”的批处理思路,而是每个时间点都更新状态,实时输出风险信号。

02/15/2026

密度估计(Density Estimation)——复原数据生成的概率结构:概率建模的核心

密度估计(Density Estimation)指的是:根据观测到的数据,去推断这些数据是由怎样的概率分布生成的。它关心的不是“每个点对不对”,而是能否把数据背后的概率结构复原出来。

02/18/2026

异常检测(Anomaly Detection)——识别偏离正常模式的事件,提前暴露潜在风险的关键技术

异常检测(Anomaly Detection)是一类以“正常模式”为参照、识别偏离常态的异常观测的方法。它常用于在缺乏明确标签或标准答案的情况下·尽早捕捉系统故障、风险信号与各类例外行为·是工程系统与数据安全中非常核心的一环。

02/18/2026

无监督学习——在没有标签的情况下发现数据的隐藏结构

无监督学习(Unsupervised Learning)是一种不依赖真实标签、仅利用输入数据本身来发现数据内部结构、相似性与分布模式的机器学习范式。如果说监督学习的目标是训练一个“能够预测正确答案的模型”,那么无监督学习更关注“让模型理解数据本身是如何组织起来的”。由于现实世界中的大多数数据都没有标注,因此无监督学习在数据分析、表征学习以及现代人工智能系统中都具有基础性作用。

03/14/2026