安全运营与治理 · kp-027
日志、检测与 SIEM
一句话定义
安全检测体系把散落在主机、网络与应用的日志汇聚、标准化并施加规则与异常分析,把"正在发生的攻击"变成"有人看到的告警"——集中平台即 SIEM,检测知识库的代表框架是 MITRE ATT&CK。
为什么重要
防御的时效性取决于检测时效:行业数据显示入侵从发生到被发现的平均时长以"月"计,而攻击者的破坏窗口以"小时"计。没有检测体系的防御是"只守不查"——被打了也不知道。检测也是评估其他防御是否生效的唯一途径:告警数据能回答防火墙规则、加固基线(kp-022)到底拦住了什么。
前置知识
kp-022(主机加固):日志采集与外发是其可观测层。
核心概念
- 值得采集的事件:认证成功/失败(kp-015 的登录事件)、提权与 sudo、配置变更、管理面操作、防火墙/WAF 拒绝、异常出向流量、关键应用业务错误。
- 日志质量四要素:统一时间源(NTP)、结构化字段(JSON/规范模式)、不可篡改(只追加存储 + 访问隔离)、集中外发(本机日志可被攻击者删除)。
- 检测三类方法:签名/规则(已知模式,如"5 分钟内同账号失败 20 次")、关联(跨源串联,如"新设备登录 + 立即创建 API 密钥")、异常(偏离基线的统计检测,UEBA 思路)。
- 检测类工具谱系:SIEM(集中分析)、IDS/IPS(网络侧检测/阻断)、EDR(终端检测与响应)、NDR(网络检测)——各自覆盖一层,构成纵深。
- MITRE ATT&CK:按"战术(为什么做)× 技术(怎么做)"组织攻击行为知识的框架,用途是对照自查"我的日志能看见哪些技术"、规划检测覆盖地图。
- 告警运营:分级(P1-P4)、值守、误报率治理——检测体系的生命线是信噪比。
公式、模型或图示
检测流水线:
[主机/网络/应用日志] ─采集─▶ 归一化(NTP+结构化) ─▶ SIEM 集中存储
─▶ 规则/关联/异常引擎 ─▶ 告警分级 ─▶ 值守研判 ─▶ 响应(kp-028)
规则示例(伪查询):
SELECT user, count(*) FROM auth_failures
WHERE time > now()-5m GROUP BY user HAVING count(*) > 20原理与机制
检测体系的第一性问题是"覆盖率 vs 信噪比":日志越多告警越全,但值守被淹没后等于没有检测。工程上的解法是分层假设:不要试图检测一切,而是用 ATT&CK 做覆盖地图,优先为高价值资产的关键战术(初始访问、提权、数据外传)建立高质量规则,并为每条规则维护误报率——误报率过高的规则会被值守者心理性忽略("狼来了"效应),其防护价值归零。时间线完整性依赖两个前提:统一时钟(否则跨机事件排序错误,取证链断裂)与日志不可篡改(攻击者的标准动作之一是清日志,因此必须外发到攻击者不可达的存储)。检测有效性必须演练验证——定期的"紫队"测试(红队模拟攻击、蓝队验证告警是否触发)是唯一诚实的覆盖度量。
实例或案例
一组高性价比的入门规则(中小团队第一天就能上线):单账号短时多次认证失败(暴力破解)、非常规时段特权变更(配置滥用)、新设备登录后立即修改邮箱/密钥(账号接管信号)、出向流量突增到未知域名(数据外传候选)。四条规则配合 kp-015/kp-022 产生的日志即可覆盖最常见攻击模式的"可看见性"。
直观类比
SIEM 之于安全,像监控中心之于商场:每个货架(主机)的摄像头(日志)汇聚到一面墙(平台),保安(值守)盯着异常行为规则(徘徊、撬柜)。规则太少像没有摄像头,规则太多像每个轻微晃动都拉警报——保安很快就会麻木。
常见误区
- "日志越多越安全":无结构的海量日志只产生存储成本;价值在覆盖度与信噪比,不在体积。
- "有告警就是有检测":无值守、无分级、不闭环的告警只是噪音生成器;检测必须连接响应(kp-028)。
- "SIEM 买来即安全":平台是引擎,检测内容(规则、覆盖、调优)才是安全;空跑的 SIEM 只是一座空哨所。
与其他知识点的关系
- kp-028(应急响应):告警研判的下游流程。
- kp-015(认证安全):登录日志是最重要的检测数据源。
- kp-016(OWASP A09):日志与监控失效本身就是 Top 10 风险之一。
自测题
- 为什么日志必须外发集中存储?要点:本机日志可被攻击者删除/篡改(清痕迹),外发到独立存储保证取证链完整。
- NTP 对检测体系为什么是硬前提?要点:跨源事件关联与时间线重建依赖统一时钟,时钟漂移直接破坏取证与规则准确性。
- ATT&CK 的实际用法是什么?要点:作为攻击行为知识地图,对照自查日志可见性与检测覆盖缺口,规划规则优先级。
延伸阅读
《NIST SP 800-92》(NIST):日志管理的官方指南。