多伦多大学的 Chris Lin、Joyce Qu、Gururaj Saileshwar 及其同事演示了一种名为 GPUHammer 的 RowHammer 攻击,该攻击针对配备 GDDR6 的 NVIDIA A6000 GPU,在大约 12,000 次连续读取中翻转相邻单元中的位。
我们观察到,一位翻转会将 ImageNet DNN 模型的准确率从 80% 降低到 0.1%。
NVIDIA建议在2025年7月12日启用系统级ECC,其应用将导致推理性能下降3%至10%,内存容量减少6.25%。 H100 和 RTX 5090 等较新的 GPU 具有片上 ECC,因此不受影响。
大约在同一时间,NTT 社会信息研究实验室和 Centrale Supélec 演示了使用 RowHammer“CrowHammer”的单比特反转来实现 FALCON 后量子签名的密钥恢复。
从:
GPUHammer:新的 RowHammer 攻击变体会降低 NVIDIA GPU 上的 AI 模型性能
【编辑部评论】
GPUHammer 的突破性在于它将仅限于 CPU 内存的 RowHammer 攻击扩展到了 GPU 专用内存。它通过并行锤击内核突破了 GDDR6 的高刷新率和延迟障碍,实现每个刷新窗口约 500,000 次激活。这使得有针对性的攻击变得更加实用。
在云环境中,很多情况下多个租户共享同一个GPU,GPU Hammer可能会故意降低其他用户的AI模型的风险。作为对策的系统级ECC会导致性能下降3%~10%,内存容量减少6.25%,因此需要确定安全性和性能之间的最佳平衡点。
责任披露于 2025 年 1 月 15 日进行,NVIDIA 于 7 月 12 日发布公告。研究人员计划在 8 月 12 日禁运结束后在 GitHub (https://github.com/sith-lab/gpuhammer) 上发布 PoC 代码。
大约在同一时间,NTT社会信息研究实验室和Centrale Supélec发布的CrowHammer使用FALCON后量子签名的RCDT作为逆累积分布表,并表明可以用一个比特从数亿个签名中完全恢复密钥。这也引发了有关抗量子密码学安全性的重大问题。
这一发现强化了在硬件设计阶段彻底实施Secure by Design以确保AI工作负载安全的呼声,其对未来AI法规和标准化的影响也不容忽视。
【术语解释】
RowHammer攻击
重复访问 DRAM 中相邻单元时导致电气干扰和位翻转的硬件漏洞。
GPU锤子
第一个 RowHammer 变体针对 NVIDIA GPU 中的 GDDR6 内存。大约 12,000 次访问后会发生位翻转,从而降低 AI 模型的性能。
鸦锤
由 NTT 社会信息实验室和 Centrale Supélec 开发的 RowHammer 攻击,利用 FALCON 后量子签名的逆累积分布表从数亿个签名中恢复私钥。
[参考链接]
英伟达官方网站(外部)
用于人工智能、图形和数据中心的 GPU 的全球领导者。
NVIDIA RTX A6000制品情报(ELSA)(外部)
配备 48GB GDDR6 显存的专业 GPU。与 ECC 兼容。
NTT社会情报研究所(外部)
NTT 的研究机构,从事网络安全和隐私技术的研究和开发。
中央电力学院官方网站(外部)
法国著名的工程高等院校。
[参考文章]
NVIDIA 分享了保护 GDDR6 GPU 免受 Rowhammer 攻击的指南(外部)
NVIDIA 解释了启用系统级 ECC 的必要性,以及至少 12,000 次激活引发位翻转的演示结果。
GPUHammer:Rowhammer 对 GPU 内存的攻击是实用的 (PDF)(外部)
论文全文。对 GDDR6 特定问题的技术解释以及如何使用并行锤击实施攻击的详细信息。
行锤 - 维基百科(外部)
一本英文百科全书,总结了RowHammer攻击的基本原理和历史背景。
[编者后记]
AI模型的可靠性是由硬件设计的安全性支撑的。系统级 ECC 设置是否适合您使用的云服务和工作站?
虽然有性能下降的权衡,但为什么不一起想想如何保证安全呢?
