Skip to content

Latest commit

 

History

History
306 lines (223 loc) · 22.1 KB

File metadata and controls

306 lines (223 loc) · 22.1 KB

04-References

📚 ROCm 优质参考资料

精选的 AMD 官方与社区资源

返回主页

简介

  本模块收集整理了 ROCm 和 AMD GPU 相关的优质学习资源,包括官方文档、社区教程、技术博客和相关新闻。帮助你快速找到所需的参考资料。

hello-rocm Skill

hello-rocm Skill 是本项目内置的 AI 助手导航能力。它会把本项目的学习路径、Reference 索引、GPU 架构表、部署教程与排障清单提供给支持 Skills、Rules 或 Agent 配置的 AI 编程工具使用。

你想问 Skill 会索引
我的 GPU 属于什么架构、对应哪个 gfx? docs/zh/00-environment/rocm-gpu-architecture-table.md
我想最快跑通第一个模型 src/hello-rocm-skill/references/quick-deploy/SKILL.md
PyTorch / vLLM / Ollama / llama.cpp 在 ROCm 上怎么装? 本页“框架与推理服务”
ROCm / PyTorch / HIP 报错怎么排? src/hello-rocm-skill/references/troubleshooting/SKILL.md
该从哪个章节开始学习? README 与各章节 index.md

一键复制使用提示

将下面这句话复制给你的 AI 编程工具,让它根据自身支持的 Skills、Rules 或 Agent 配置方式自动判断如何加载:

请使用当前仓库的 src/hello-rocm-skill 作为 hello-rocm Skill;如果你的工具支持 Skills、Rules 或 Agent 配置,请把它安装或加载到合适位置(例如 .claude/skills、.cursor/skills 或 .agents/skills),然后根据该 Skill 帮我学习、部署和排查 AMD ROCm。

如果你想手动安装,也可以按工具复制到对应目录:

::: code-group

mkdir -p .claude/skills
cp -r src/hello-rocm-skill .claude/skills/hello-rocm
mkdir -p .cursor/skills
cp -r src/hello-rocm-skill .cursor/skills/hello-rocm
mkdir -p .agents/skills
cp -r src/hello-rocm-skill .agents/skills/hello-rocm

:::

安装或加载后,新开一个会话并尝试:

请加载 hello-rocm skill,帮我判断我的 AMD GPU 应该从哪个 ROCm 教程开始。

如果遇到故障排查与常见问题,也可以加入 飞书社区讨论

官方资源

AMD 官方文档

资源 描述 链接
ROCm 文档 ROCm 平台官方文档 rocm.docs.amd.com
ROCm Release Notes 版本发布说明 Release Notes
HIP 编程指南 HIP API 和编程指南 HIP Docs
AMD GitHub AMD 开源项目仓库 github.com/amd
ROCm GitHub ROCm 项目仓库 github.com/ROCm

AMD GPU / APU 架构与官方技术资料

hello-rocm 更偏向本地学习、Radeon 显卡与 Ryzen AI PC 场景,因此本表优先列出 RDNA / Ryzen / Radeon 相关资料;CDNA / Instinct 资料保留在后半部分,供数据中心 GPU 对照使用。并非每一代都有传统 whitepaper,AMD 对 Radeon / Ryzen 侧更常发布 ISA Reference、ROCm 支持文档与官方技术文章。

架构 / 资源 适用方向 架构概览 / 支持入口 白皮书 / 官方技术资料
AMD RDNA 4 架构 Radeon RX 9000 / Radeon AI PRO R9000 系列,最新消费级与工作站 GPU AMD RDNA Architecture RDNA 4 ISA Reference Guide
AMD RDNA 3.5 架构 Ryzen AI Max / AI 300 / AI 400 系列 APU 集成 GPU(gfx1150 / gfx1151 / gfx1152 AMD RDNA3.5 system optimization RDNA 3.5 ISA Reference Guide
AMD RDNA 3 架构 Radeon RX 7000 / Radeon PRO W7000 系列与部分 Ryzen APU AMD RDNA Architecture RDNA 3 ISA Reference Guide
AMD RDNA 2 架构 Radeon RX 6000 / Radeon PRO W6000 系列 AMD RDNA Architecture RDNA 2 Explained: Radeon PRO W6000 / RDNA 2 ISA Reference Guide
AMD RDNA 架构 Radeon RX 5000 / Radeon PRO W5000 系列,RDNA 基础架构 AMD RDNA Architecture GPUOpen AMD GPU architecture programming documentation
ROCm on Radeon and Ryzen Radeon RX / Radeon PRO / Ryzen APU 的 ROCm + PyTorch 支持入口 Use ROCm on Radeon and Ryzen GPU hardware specifications
AMD XDNA / Ryzen AI NPU Ryzen AI 端侧 NPU 推理,区别于 ROCm/HIP GPU 计算 AMD XDNA Architecture AMD Ryzen AI Software / Ryzen AI Docs PDF
AMD CDNA 4 架构 Instinct MI350 系列与新一代 AI 计算加速 AMD CDNA Architecture AMD CDNA 4 Architecture Whitepaper
AMD CDNA 3 架构 Instinct MI300 系列与生成式 AI/HPC 加速 AMD CDNA Architecture AMD CDNA 3 White Paper
AMD CDNA 2 架构 Instinct MI200 系列、科学计算与机器学习加速 AMD CDNA Architecture AMD CDNA 2 White Paper
AMD CDNA 架构 Instinct MI100 系列与 Exascale 级 GPU 计算 AMD CDNA Architecture AMD CDNA White Paper

架构、产品与 LLVM Target 速查

对初学者来说,可以先用产品名称定位架构,再用 LLVM Target(gfx)选择 ROCm / PyTorch 安装索引。完整 GPU 清单见下方“支持的 GPU 列表”。

CDNA:数据中心 Instinct GPU

架构 典型产品 LLVM Target 主要方向
CDNA 4 AMD Instinct MI350 系列(MI355X, MI350X) gfx950 新一代 AI 训练 / 推理与 HPC
CDNA 3 AMD Instinct MI300 系列(MI325X, MI300X, MI300A) gfx942 生成式 AI 与 HPC 加速
CDNA 2 AMD Instinct MI200 系列(MI250X, MI250, MI210) gfx90a 科学计算与机器学习加速
CDNA AMD Instinct MI100 系列 gfx908 Exascale 级 GPU 计算

RDNA:Radeon 显卡与 Ryzen APU

架构 典型产品 / Graphics model LLVM Target 主要方向
RDNA 4 Radeon RX 9000 系列(RX 9070 XT / 9070 GRE / 9070)与 Radeon AI PRO R9000 系列 gfx1201 游戏显卡、工作站图形与 AI 能力
RDNA 4 Radeon RX 9060 XT LP / 9060 XT / 9060 系列 gfx1200 主流游戏显卡
RDNA 3.5 Ryzen AI Max / Max PRO 300(Radeon 8060S / 8050S)含 AI Max+ 392/388 gfx1151 移动端 / APU 集成 GPU
RDNA 3.5 Ryzen AI 300 / AI 400 / AI PRO 400 高端型号(Radeon 890M / 880M) gfx1150 移动端 / APU 集成 GPU
RDNA 3.5 Ryzen AI 300 / AI 400 / AI PRO 400 中端型号(Radeon 860M 等) gfx1152 移动端 / APU 集成 GPU
RDNA 3 Radeon RX 7900 / PRO W7900 / PRO W7800 系列 gfx1100 高端消费级与工作站显卡
RDNA 3 Radeon RX 7800 / 7700 / PRO W7700 / V710 系列 gfx1101 消费级与工作站显卡
RDNA 3 Radeon RX 7600 系列 gfx1102 主流消费级显卡
RDNA 3 Ryzen 200 系列(Radeon 780M / 760M / 740M) gfx1103 移动端 / APU 集成 GPU

Ryzen 系列与端侧 AI PC 官方资料

说明:用户常说的 gfx3.5 更准确地对应 RDNA 3.5 / GFX11.5。在 ROCm / LLVM target 中应使用 gfx1150gfx1151gfx1152 等名称,而不是 gfx3.5

主题 适用设备 / 方向 官方资料 重点用途
ROCm on Radeon and Ryzen Radeon 9000/7000 系列、Ryzen APU Use ROCm on Radeon and Ryzen 面向消费级 Radeon 与 Ryzen APU 的 ROCm / PyTorch 入口
RDNA 3.5 系统优化 Ryzen AI Max / AI 300 / AI 400 APU(gfx1150 / gfx1151 / gfx1152 AMD RDNA3.5 system optimization RDNA 3.5 APU 的 GPUVM、内核版本与系统调优要求
GPU 硬件规格 Instinct、Radeon PRO/RX、Ryzen APU GPU hardware specifications 查询 CU、wavefront、cache、LLVM target 与 GFXIP 版本
ROCm 兼容性矩阵 ROCm 各版本支持的 GPU / APU ROCm Compatibility Matrix 核对硬件、系统、驱动与 ROCm 版本组合
AMDGPU LLVM target 编译器与底层 target 查询 LLVM AMDGPU Backend User Guide 查询 gfx1150 / gfx1151 / gfx1152 等 LLVM target 命名
Ryzen AI Max 本地大模型推理 Ryzen AI Max+ 395 / Radeon 8060S AI Inference on AMD Ryzen AI Max Processor 统一内存 APU 上的本地 LLM 推理实践
Ryzen AI Max+ 395 产品与架构说明 Ryzen AI Max+ 395、Radeon 8060S、XDNA 2 NPU AMD Ryzen AI Max+ 395 Processor 端侧 AI PC 的 CPU / GPU / NPU 组合与定位
Ryzen AI Software Ryzen AI NPU / iGPU 应用开发 AMD Ryzen AI Software / Ryzen AI Docs PDF NPU 侧 ONNX Runtime / Vitis AI EP 软件栈(与 ROCm/HIP 区分)
AMD XDNA NPU 架构 Ryzen AI NPU AMD XDNA Architecture 端侧 NPU 的 spatial dataflow / AI Engine 架构背景

框架与推理服务(ROCm 快速安装入口)

本节面向 hello-rocm Skill 的快速查阅场景:优先给出框架官方或 AMD ROCm 官方安装入口,并附 AMD ROCm Blog 作为实践案例与版本动态的互相印证。

类型 项目 ROCm 快速安装 / 官方说明 AMD 官方实践参考 本项目入口
深度学习框架 PyTorch Install PyTorch for ROCm AMD ROCm Blog - PyTorch 环境安装
深度学习框架 TensorFlow Install TensorFlow for ROCm AMD ROCm Blog - TensorFlow 环境安装
深度学习框架 JAX Install JAX for ROCm AMD ROCm Blog - JAX 环境安装
推理服务 vLLM vLLM AMD ROCm installation AMD ROCm Blog - vLLM vLLM 部署教程
推理服务 Ollama Ollama GPU docs AMD ROCm Blog - Ollama Ollama 部署教程
推理服务 llama.cpp llama.cpp build docs - HIP/ROCm AMD ROCm Blog - llama.cpp llama.cpp 部署教程
推理服务 LM Studio LM Studio GPU docs AMD ROCm Blog - LM Studio LM Studio 部署教程
推理运行时 ONNX Runtime Install ONNX Runtime for ROCm AMD ROCm Blog - ONNX Runtime 环境安装

库文档

库名称 用途 文档链接
rocBLAS 基础线性代数库 rocBLAS Docs
MIOpen 深度学习原语库 MIOpen Docs
RCCL 集合通信库 RCCL Docs
rocFFT 快速傅里叶变换 rocFFT Docs
rocSPARSE 稀疏矩阵库 rocSPARSE Docs

硬件支持

支持的 GPU 列表

Instinct 系列(数据中心)

系列 型号 架构 LLVM Target ROCm 支持
MI350 MI355X, MI350X, MI350P CDNA 4 gfx950
MI300 MI325X, MI300X, MI300A CDNA 3 gfx942
MI200 MI250X, MI250, MI210 CDNA 2 gfx90a
MI100 MI100 CDNA gfx908

Radeon PRO 系列(工作站)

系列 型号 架构 LLVM Target ROCm 支持
AI PRO R9000 R9700S, R9700, R9600D RDNA 4 gfx1201
PRO W7000 W7900 Dual Slot, W7900, W7800 48GB, W7800 RDNA 3 gfx1100
PRO W7700 W7700, V710 RDNA 3 gfx1101

Radeon RX 系列(消费级)

系列 型号 架构 LLVM Target ROCm 支持
RX 9000 RX 9070 XT, 9070 GRE, 9070 RDNA 4 gfx1201
RX 9000 RX 9060 XT LP, 9060 XT, 9060 RDNA 4 gfx1200
RX 7000 RX 7900 XTX, 7900 XT, 7900 GRE RDNA 3 gfx1100
RX 7000 RX 7800 XT, 7700 XT, 7700 XE, 7700 RDNA 3 gfx1101
RX 7000 RX 7600 RDNA 3 gfx1102

Ryzen APU 系列(笔记本/移动端)

系列 型号 Graphics model (iGPU) 架构 LLVM Target ROCm 支持
Ryzen AI Max PRO 300 AI Max+ PRO 395, Max PRO 390/385/380 Radeon 8060S RDNA 3.5 gfx1151
Ryzen AI Max 300 AI Max+ 395, AI Max+ 392, AI Max+ 388, Max 390, Max 385 Radeon 8060S / 8050S RDNA 3.5 gfx1151
Ryzen AI PRO 400 AI 9 HX PRO 475/470, AI 9 PRO 465, AI 7 PRO 450, AI 5 PRO 440 Radeon 890M / 880M / 860M RDNA 3.5 gfx1150 / gfx1152
Ryzen AI 400 AI 9 HX 475/470, AI 9 465, AI 7 450 Radeon 890M / 880M / 860M RDNA 3.5 gfx1150 / gfx1152
Ryzen AI 300 AI 9 HX 375/370, AI 9 365, AI 7 350/345, AI 5 340/330 Radeon 890M / 880M RDNA 3.5 gfx1150 / gfx1152
Ryzen 200 9 270, 7 260/250, 5 240/230/220, 3 210 及 PRO 系列 Radeon 780M / 760M / 740M RDNA 3 gfx1103

完整支持列表请以 ROCm 7.13.0 Compatibility Matrix 为准。

社区资源

教程与博客

视频教程

持续更新中...

论坛与社区

平台 描述 链接
AMD Community AMD 官方社区论坛 community.amd.com
GitHub Discussions ROCm 项目讨论区 ROCm Discussions
Reddit r/Amd AMD 相关讨论 r/Amd

常用工具

开发工具

工具 用途 安装命令
hipcc HIP 编译器 sudo apt install hip-dev
rocprof 性能分析工具 sudo apt install rocprofiler
rocgdb GPU 调试器 sudo apt install rocgdb
hipify-clang CUDA 到 HIP 转换 sudo apt install hipify-clang

AI 框架

框架 ROCm 支持 安装方式
PyTorch pip install torch --index-url https://download.pytorch.org/whl/rocm6.2
TensorFlow 参考官方文档
JAX 参考官方文档
ONNX Runtime 参考官方文档

相关新闻

2026

  • 2026.07.15 - ROCm 7.14.0 Release Notes 🚀 里程碑版本:ROCm 正式转向 TheRock

    • TheRock 成为 ROCm 的未来构建与发布基座:ROCm 7.14.0 正式将 ROCm 迁移到 TheRock —— 一套模块化的构建与发布体系。这是自 7.10.0 引入 Windows / pip 支持以来最重要的架构转折,标志着 ROCm 从"单体大包"走向"模块化生态"。今后 ROCm 的演进、社区硬件启用与独立组件发布都将以 TheRock 为核心,详见 TheRock 迁移指南
    • 三大设计理念:① 精简内核(Core SDK 只保留必要的运行时与开发组件);② 按需扩展(面向 AI、数据科学、HPC 的可选领域 SDK);③ 模块化安装(只装工作流所需组件,减小体积、加快创新)
    • 安装与打包变化:安装目录由 /opt/rocm/ 变为 /opt/rocm/core;包名前缀由 rocm-* / roc* / hip* 统一为 amdrocm-*(如 hipBLAS 与 rocBLAS 合并为 amdrocm-blas);新增 /opt/rocm/extras-7/ 共享前缀。保持与 ROCm 7.2 legacy 的 ABI/API 兼容,无需重新编译;包管理器安装时 amdrocm 元包通过 update-alternatives 提供向后兼容软链接
    • AI 框架更新:PyTorch 2.12.0、JAX 0.10.0、vLLM 0.23.0、SGLang 0.5.13、TensorFlow 2.21(替代此前 PyTorch 2.9.1 / JAX 0.8.2 / vLLM 0.19.1 / SGLang 0.5.9)
    • 新增硬件支持:Ryzen AI MAX+ PRO 495 / MAX PRO 490/485 (gfx1151)、Ryzen AI 5 435/430、AI 5 PRO 435、AI 7 445 (gfx1153) 等 APU
    • 新增 OS 支持:RHEL 10.2 / 9.8(分别替代 10.1 / 9.7);MI350P 上支持 SLES 15 SP7、SLES 16、Debian 13
    • 组件重组(TheRock 分层):ROCm SMI 移除(由 AMD SMI 替代);ROCm Bandwidth Test 到达 EOL(改用 TransferBench 或 ROCm Validation Suite);ROCm Validation Suite、TransferBench、MIGraphX 移入 ROCm-Extras;ONNX runtime 独立为 Standalone/ONNX;新增 hipFile 直连存储 I/O 库
    • 性能与工具:ROCprofiler-SDK 成为 PyTorch Profiler(2.12+)的默认后端;新增 SPM(流式性能监视器,Beta);ROCm Compute Profiler / Systems Profiler 支持 pip 安装
    • 注意:7.14.0 延续自 7.9.0 preview 起的版本编号断点;ASAN 包在 7.14.0 暂不提供,计划后续版本补齐

  • 2026.05.15 - ROCm 7.13.0 Preview Release Notes

    • 兼容性信息以 ROCm 7.13.0 Compatibility Matrix 为准
    • 新增硬件支持:Instinct MI350P (gfx950)、Radeon AI PRO R9700S (gfx1201)、Radeon RX 9060 XT LP (gfx1200)、Ryzen AI Max+ 392/388 (gfx1151)、Ryzen AI PRO 400 / AI 400 系列多款型号 (gfx1150/gfx1152)
    • 新增 OS 支持:Ubuntu 26.04 (kernel 7.0)、RHEL 10.0/10.1、Debian 13、Oracle Linux 10、Rocky Linux 9、SLES 16.0
    • 最新 amdgpu 驱动版本 31.30.0;固件 PLDM bundle 01.26.00.02
  • 2026.03.11 - ROCm 7.12.0 Preview Release Notes

    • 更新 ROCm 7.12.0 预览版发布说明,覆盖 ROCm 组件、安装方式与平台支持变化
    • 兼容性信息以 ROCm 7.12.0 Compatibility Matrix 为准
    • pip 安装索引按 GPU 架构拆分,便于在虚拟环境中选择对应 wheel 源

2025

  • 2025.12.11 - ROCm 7.10.0 发布
    • 支持 Windows 平台
    • 支持 pip 安装到 Python 虚拟环境
    • TheRock 项目重构底层架构

更多新闻持续更新中...

书籍推荐

持续更新中...

贡献资源

  如果你有优质的 ROCm 相关资源想要分享,欢迎提交 PR 或 Issue!

提交要求

  • 资源链接有效且内容优质
  • 提供简短的资源描述
  • 按照现有分类整理

欢迎分享更多优质资源! 🎉

提交 Issue | 提交 PR