Hugging Face 遭 AI 驱动的网络攻击——并用 AI 反击
一个自主 AI 代理通过数据集管道攻入 Hugging Face 的生产基础设施。该公司在商用模型的护栏阻挡调查后,转而使用开源模型 GLM 5.2 进行 AI 取证分析,数小时内还原了 17,000 多个攻击者动作。
60 秒版本
一个自主 AI 代理通过数据集管道攻破了 Hugging Face 的生产基础设施;Hugging Face 在商用护栏阻挡调查后,使用运行在开源模型上的 AI 取证进行了反击。
要点
- 攻击者通过 Hugging Face 数据集处理管道中的两条代码执行路径入侵——远程代码数据集加载器和模板注入——随后升级权限并在内部集群间横向移动。
- 整场行动由自主 AI 代理框架驱动,在临时沙箱中执行了数千次操作,C2 在公共服务之间迁移——这是首次确认的野外'代理型攻击者'实例。
- Hugging Face 的基于 LLM 的异常检测标记出了入侵。对 17,000+ 事件的取证分析通过运行在内部基础设施上的 GLM 5.2 LLM 代理完成,因为商业前沿模型拒绝处理真实的攻击载荷。
- 根因漏洞已修补,凭证已轮换,集群防护已部署。未发现公开模型、数据集或软件供应链被篡改的证据。
结论. 此次事件证实了自主 AI 驱动的攻击已在现实中运作,防御者必须拥有可在内部运行的不受限制的模型来调查它们——因为保护系统免受攻击者侵害的同一道安全护栏,也可能锁住取证分析师。
入侵途径数据集管道就是那道门
7月16日,Hugging Face 披露了一个自主 AI 代理系统攻破其生产基础设施的安全事件。入口点不是配置错误的云存储桶或钓鱼邮件——而是平台的核心价值主张:数据处理管道。一个恶意数据集利用了两条代码执行路径——远程代码数据集加载器和数据集配置中的模板注入——在处理节点上执行代码。攻击者从那里提升至节点级权限,获取了云和集群凭证,并在整个周末期间在多个内部集群间横向移动。
整场行动由自主 AI 代理框架驱动,在大量短生命周期的沙箱中执行了成千上万次独立操作。其命令与控制基础设施在公共服务之间不断迁移以逃避检测。这就是安全行业数月来一直在预警的'代理型攻击者'场景——而现在它已在真实世界中登场。
应对措施AI 对抗 AI
这次入侵首先被 Hugging Face 自身的 AI 系统标记。他们的异常检测管道使用基于 LLM 的分级系统处理安全遥测数据,将真正的信号从日常噪音中分离出来——正是这些信号的相关性触发了警报。
攻击被遏制后,团队面临一项艰巨的取证任务:从超过 17,000 条攻击者事件记录中重建完整时间线。他们运行 LLM 驱动的分析代理处理整个日志,提取入侵指标,映射每个被触及的凭证,并将真正的损害与伪装活动区分开来。这种方法将通常需要数天的工作压缩到了几小时。
不对称问题当护栏阻挡了防御者
取证分析揭示了一个令人不安的不对称性。Hugging Face 首先尝试了商业 API 背后的前沿模型。分析失败了——因为提交真实的攻击命令、漏洞利用载荷和 C2 工件会被提供商的安全护栏阻止——它们无法区分取证调查员和攻击者。
团队转而使用 GLM 5.2,一个运行在自有基础设施上的开源模型。它毫无阻碍地处理了整个攻击日志。还有一个额外的好处:没有任何攻击者数据——以及其中涉及的被盗凭证——离开过 Hugging Face 的环境。
修复措施Hugging Face 做了什么
- 关闭了用于初始入侵的数据集代码执行路径。
- 清除了攻击者在受影响集群中的据点并重建了受感染节点。
- 撤销并轮换了受影响的凭证和令牌;开始了更广泛的预防性密钥轮换。
- 部署了额外的防护栏和更严格的集群准入控制。
- 改进了检测和告警系统,使高严重性信号能在数分钟内通知响应人员——全天候。
Hugging Face 还在与外部网络安全取证专家合作,并向执法部门报告了此事件。他们建议所有用户轮换访问令牌并审查近期账户活动作为预防措施。
这意味着什么游戏规则已经改变
Hugging Face 事件标志着一个转折点。自主 AI 驱动的攻击工具不再是桌面推演。它降低了开展广泛、耐心、多阶段攻击行动的成本,并且以机器速度运行——在人类防御者睡眠时执行数千次操作。保护在线平台意味着将数据和模型面视为一等攻击面,并使用 AI 进行防御才能跟上步伐。
「自主 AI 驱动的攻击工具不再是理论。它降低了开展广泛、耐心、多阶段攻击行动的成本,并以机器速度运行。」—— Hugging Face
对于安全团队而言,不对称问题同样紧迫。拥有一个不受限制且能力强大的模型在内部就绪,不再是锦上添花——而是调查那些对手不受政策约束的攻击事件的先决条件。代理型攻击者的时代已经来临。