AI风险评估
梦想国际AI
梦想国际AI为什么不能把“风险评分95”直接翻译成“95%会被攻击”?
安全平台给出一个数字,界面上写着“风险评分95”。会议室里最容易接上的一句话是“那就是95%的概率会被打穿”。这两件事之间没有等号,而且差得很远。把相对排序的结果读成概率预测,最直接的后果不是理论上的不严谨,而是钱和人被放到错误的位置上。
先说清楚风险评分到底是什么。它是一个多因素相对排序模型的输出。输入项通常包括几类:这个对象是否对外可达,它关联的身份能触达多大的权限范围,它承载或能读到的数据属于哪一级,现有控制对它的覆盖情况如何,相关漏洞的利用需要哪些前置条件,以及它在业务上处于什么位置。每个因子有自己的取值方式,模型按权重合并,再归一化到一个方便比较的区间,比如0到100。这个数字回答的问题只有一个:在同一个时点、同一套口径下,这一批对象里哪一个应该先被处理。
而概率预测要成立,需要的东西完全是另一套。你需要一个定义清晰的事件(“被成功入侵”到底指什么,是账号被盗、数据外泄,还是任意一次未授权访问),一个明确的时间窗,足够数量的历史样本,一个可计算的基准率,以及事后可验证的机制。单个企业内部几乎不可能在“某台服务器未来九十天内被成功入侵”这种事件上积累到统计意义上的样本量。更麻烦的是,企业看到评分之后会采取动作,动作又改变了结果,事后验证因此变得更难成立。所以严肃的风险评分模型通常不会把自己的输出定义成概率——它给的是顺序,不是可能性。
把顺序读成概率,会引出三种典型的错误。
- 期望损失被算错。有人会把评分当成概率,乘以资产价值当成预期损失,再拿这个数字去做预算或者谈保额。这条推理链在第一步就断了,后面算得再精细也没有意义。
- 低分被当成安全。31分不是“31%的风险”,它更接近于“在这一轮排序里它排得比较靠后”。排得靠后不等于没有问题,只是相对不紧急。把低分对象直接从待办清单里划掉,等于把排序模型当成了通过与不通过的判定器。
- 分数波动被误解。一个对象从95降到70,通常不是风险下降了25个百分点。更常见的原因是这一轮排序里前面多了别的东西,或者某个因子的数据被补全之后权重发生了变化。评分是相对量,参照系一动,数字就会动。
评分下降不等于变安全了。它更可能意味着,在这一轮相对排序里,你前面又多了别的东西。
还有一个常被忽略的点:孤立的分数没法处置。安全团队真正需要的不是“92”,而是“这92分里,有多少来自对外暴露,有多少来自权限范围,有多少来自控制缺口”。因子拆开之后,动作才有落点。如果主要驱动是对外暴露,那就先收网络入口;如果主要驱动是权限过大,那就先做权限复核;如果主要驱动是日志覆盖不足,那要做的其实是补可观测性,而不是急着打补丁。一个只给总分不给构成的系统,等于把最需要人判断的部分藏了起来。
那么风险评分该怎么用,不该用在哪里?可以用的场景是:同一时点、同一口径下的对象排序;有限资源的分配顺序;跟踪同一个对象在某个因子改变之后的变化方向。不建议的用法包括:拿自己的分数和另一家组织的分数比较(口径不同,比出来的是模型差异不是安全差异);把分数写进对外承诺或者合同条款;作为保险精算、损失估算的输入;以及最危险的一种——把某个分值设成阈值,让自动化系统一超过就直接执行禁用账号、隔离主机这类高影响动作。排序模型的误差在排序里是可以接受的,在自动执行里就不是。
梦想国际AI在这件事上的处理方式是把数字和它的来源绑在一起输出。评分旁边必须同时给出证据、驱动因子的构成、置信度,以及当前存在哪些数据缺口。当资产标签缺失、依赖关系不完整、日志覆盖有断层时,模型会把置信度标低并写明原因,而不是用一个漂亮的整数把不确定性盖住。涉及禁用账号、修改权限策略、隔离系统这类动作时,评分只能作为排队依据,执行本身仍然要走人工审批流程。
没有足够证据的时候,最专业的安全结论有时就是这样一句:目前只能确认这个对象在本轮排序里排在前面,不能确认它一定会出事。这句话看起来比“95%会被攻击”弱得多,但它是可以被后续工作验证和修正的,而后者从一开始就没法验证。
查看梦想国际官网首页的梦想国际AI精选内容
外部威胁与内部资产
梦想国际AI
梦想国际大模型已经读完全球安全新闻以后,为什么最重要的下一步是先看看企业自己到底用了什么?
“我们的模型读完了全球公开安全资讯。”这句话在评估一个安全AI时几乎没有信息量。读完只是拿到了原料。真正决定它有没有用的,是下一步——把这些原料和企业自己的资产清单、身份上下文、依赖关系、供应商名单对一遍。对不上的,它就还是一条新闻。
这里不要急着把情报条目数量当安全能力。一个每天推送几千条指标的系统,和一个每天告诉你“今天这批情报里有两条和你们环境相关,理由如下”的系统,前者看起来更勤奋,后者才真正减少了工作量。安全运营里最贵的资源是人的注意力,而未经匹配的情报是纯粹的注意力消耗品。
要完成匹配,企业侧需要五个锚点,缺一个匹配就会松一层。第一是资产清单,回答“我们到底有什么”;第二是身份与权限,回答“谁能碰到它、能碰到多深”;第三是云与SaaS的授权关系,尤其是那些用户点过同意之后就再没人看过的第三方权限;第四是软件依赖与组件的真实部署位置,注意是真实部署,不是构建清单上有;第五是供应商与数据流,回答“哪些外部方持有访问权限、能看到哪一类数据”。这五样东西的共同特点是:它们全都在企业内部,全都需要维护,而且全都不好维护。这也是为什么很多组织宁愿把预算花在买更多情报上——买情报是一次性动作,维护清单是长期工程。
外部情报与内部上下文的匹配关系示意:只有两侧能连上的部分,才会进入优先级队列(产品功能规划与结构示意)。
表格右侧那一列常常被忽略,但它其实是这套方法最有价值的部分:匹配不上,也是一个结论。“我们确认没有引入这个组件”和“我们不知道有没有引入这个组件”,在风险管理上是完全不同的两种状态,前者可以结案,后者是一个待办。一个成熟的安全AI应该能明确区分这两句话,而不是在拿不准的时候输出一段模棱两可的通用建议。真正应该先确认的,永远是公司到底有没有这个组件、有没有这个集成、有没有这个供应商。
情报的价值不在于让你多做事,而在于让你少做事——把那些明确与本环境无关的部分干净地排除掉,剩下的才配占用人的时间。
匹配这件事还有一个前提条件,很容易被跳过:内部上下文本身的新鲜度。如果资产清单是半年前的快照,身份目录里还留着已经离职三个月的账号,SaaS的第三方授权列表从来没有人复核过,那么匹配出来的结果同样不可信——只不过这次是以“看起来很确定”的形式不可信。清单的更新频率,实际上决定了外部情报能发挥的价值上限。买再多情报也补不上这一段。所以在评估一个安全AI能带来多少改善时,一个更实际的问题是:它有没有能力告诉你“我依据的这份清单最后更新于什么时候”。
还有一类容易走偏的情况,是把外部情报里的具体细节直接当成检测规则。公开报告里描述的入口、路径、工具,是某一次事件的具体形态,而不是这类攻击的全部。照抄细节做检测,往往只能挡住完全一样的重复动作。更稳的做法是从情报里提取模式层面的东西——攻击者利用的是哪一类信任关系,绕过的是技术控制还是人工核实环节,前置条件是什么——再拿这个模式去比对自己的环境。近两年公开讨论里反复出现的两个模式就很典型:一个是绕过认证背后的人工核实流程而不是认证技术本身,另一个是滥用用户已经点过同意、之后再没人关注的第三方授权。这两个模式对应到内部,要检查的是流程设计和授权治理,而不是某个具体的域名。
梦想国际大模型在处理外部情报时的默认顺序是:先解析这条情报的模式与前置条件,再到企业内部的五个锚点里找对应项,能对上的部分整理成证据链并给出优先级,对不上的部分明确写出“未在当前环境中找到对应项”以及这个判断依据的清单更新时间。所有结论都带置信度,涉及权限调整、账号处置、系统隔离的建议一律标注为需要人工复核后执行。模型不负责替安全团队做决定,它负责把决定所需要的材料,按能被检验的方式摆出来。
查看梦想国际官网首页的梦想国际AI精选内容
AI Agent权限治理
梦想国际AI
一个安全AI可以自动封号、断开系统和修改权限以后,为什么管理员反而应该给它设置更多审批边界?
当一个安全AI只能读取和分析时,它出错的代价是浪费一段时间。当它拿到了禁用账号、隔离主机、修改权限策略的能力之后,同一个错误的代价变成了业务中断、权限被误扩大、或者一次没人说得清缘由的配置变更。能力提升并不会自动带来安全性提升,它只是把错误的后果从“看错了”改成了“做错了”。
所以正确的方向不是随着自动化能力增强而放松管控,而是反过来:能力越强,边界要划得越细。这里的边界不是笼统的“需要审批”,而是按动作的影响范围和可逆性分级。一个可以自动执行的动作和一个必须双人审批的动作之间,差别不在于它有多难,而在于做错之后能不能撤回来。
安全AI的动作按影响范围与可逆性分层,越靠近右侧的动作越需要人的介入(框架示意)。
把边界划出来只是第一步。更需要正视的是,安全AI自身也会引入新的风险类型,而这些风险和传统自动化脚本的失效方式并不一样。
- 提示注入(Prompt Injection)。安全AI要读的东西里,有大量是外部可以影响的内容:工单正文、邮件正文、日志字段、告警描述、甚至资产备注。如果系统把这些内容当成可以执行的指令,那么任何能往工单里写字的人,都获得了间接驱动这个高权限身份的能力。防御方向是把读到的一切都当成数据而不是指令,对内容来源做可信度分级,并且让工具调用必须由独立的授权路径触发,而不是由被读取的内容触发。
- 越权工具访问。为了省事,agent 的服务账号常常被配成一个大权限身份,理由是“将来可能会用到”。结果是它的实际权限远超它需要的范围,一旦被误导,可触达的面就是这个大权限的全部。更稳的做法是按动作类型拆分账号:读的账号只有读权限,写的账号权限限定到具体资源范围,并且加上时间窗。
- 幻觉与过度确定。模型有时会把不存在的资产、不存在的策略、不存在的日志字段描述得非常具体,因为具体的表达在语言上更自然。在安全场景里,这种错误特别危险——它看起来像证据。对应的约束是:任何结论必须能指回原始记录,指不回去的一律降置信度并标注,而不是补一段听起来合理的解释。
安全AI本身就是一个高权限身份。它应该出现在权限评审清单里,而不是留在清单之外,作为一个“工具”被跳过。
审计留痕(Audit Trail)是另一个不能省的部分,而且要求比普通操作日志更高。普通日志回答“做了什么”,安全AI的日志还要回答“为什么当时会做这个”。一条完整的记录至少应包含:触发这次动作的原始输入是什么、模型依据了哪些证据、调用了哪些工具、使用的是哪个身份、审批人是谁、以及回滚方式是什么。缺了“依据的证据”这一项,事后复盘就只能停留在“它做了这个操作”,没法判断当时的判断链条哪里出了问题,也就没法改进。这类日志本身也应当受到保护,防止被同一套自动化流程清理掉。
还有几个工程上的约束值得一起做。断路器:给单位时间内的动作数量设上限,异常放量时自动停下来等人确认,避免一个错误判断被批量放大。灰度:新增的自动化能力先在小范围资产上运行一段时间,确认误报模式之后再扩大。演练模式:让 agent 先以只输出建议、不实际执行的方式跑一段,把它“本来会做什么”和人实际做了什么对照,这个对照数据比任何准确率描述都更有说服力。退出路径:任何时候都要有一个明确的开关,能把自动执行降级回只读分析,并且这个开关不依赖 agent 自己。
梦想国际在这件事上的立场很明确:梦想国际助手与梦想国际大模型的定位是给人提供判断材料,不是替人做决定。高影响动作一律走人工审批,权限按最小必要原则拆分,所有动作留痕并可回滚,不宣称任何形式的全自动防御。同时需要再说明一次能力边界——梦想国际网络安全相关内容用于防御性网络安全研究、企业风险管理、隐私保护、威胁情报与授权安全运营,不提供用于未授权访问、窃取凭证、部署恶意软件、规避安全控制或破坏第三方系统的操作指南。一个能被要求去攻击别人的安全AI,本身就是一个没有做好治理的高权限身份。
高影响动作的人工审批环节:确认证据、确认回滚方案、留下审批记录(流程示意)。
查看梦想国际官网首页的梦想国际AI精选内容