AMD ROCm 10 正式发布:ROCm.AI 结束预览转为 GA,把调优工作流交给智能体
AMD 于 8 月 27 日发布 ROCm 10,同时宣布 ROCm.AI 正式 GA。这是 ROCm 软件栈发布十周年,也是 AMD 首次把智能体式优化作为正式组件纳入 GPU 开发工具链。ROCm.AI 整合三块能力:Hyperloom 负责端到端推理负载的自主优化,覆盖剖析、瓶颈定位、改动实施、基准测试与正确性验证的完整闭环;AMD Skills 把经验证的 ROCm 知识注入 Claude Code、Cursor、Codex 等主流 AI 编码助手;ROCm CLI 提供统一的命令行入口,承担环境安装、模型服务、诊断与运行时管理。ROCm 10 本体则推进模块化的 ROCm Core SDK,统一 Windows 与 Linux 的 SDK 定义,并在库、编译器、框架与硬件支持上同步更新,vLLM、SGLang 等推理框架的官方容器随版本一并交付。

AMD 同时披露了一组性能数据:在 8 卡 Instinct MI355X 平台上,基于 ROCm 7.2.2 预览版优化的 ROCm.AI 相对 ROCm 7.0,在 GLM-5、Kimi-K2.5、DeepSeek-R1-0528 三个模型上平均推理吞吐提升 3.3 倍,训练吞吐平均提升 2.4 倍。这组数字来自特定测试配置,反映的是内核、并行度与调度协同优化的空间,而非跨平台的普遍结论。
值得注意的变化在于优化责任的转移。过去 GPU 软件栈竞争的焦点是算子库与编译器,比的是手写内核的覆盖广度;Hyperloom 把剖析—改代码—验证这个原本由工程师驱动的循环交给智能体自动执行,等于把「谁家的栈更容易调出性能」变成产品本身的一部分。对推理服务团队,ROCm CLI 的环境管理和 ROCm Console 的实时遥测(HBM 用量、功耗、tokens per watt)也补上了此前运维侧的短板。国产算力适配团队可以对照这条路径检查自己的工具链:迁移脚本、调优助手、可观测性三层是否齐备,将直接决定开发者在真实业务里切换平台的成本。











评论