跳转到主要内容
瑞苏盈科专栏
我与瑞苏盈科板卡的开发故事

AMD 锐龙 AI 嵌入式 X100 系列:在边缘整合计算、图形与 AI 能力

嵌入式系统正在被要求在本地完成更多任务。它们需要采集并处理传感器数据、渲染丰富的显示画面、运行 AI 辅助分析并支持软件定义功能,而这一切通常都要在严格的功耗、散热和空间限制内完成。

共同的挑战不仅在于需要更多算力、图形或 AI 性能,更在于如何将这些能力整合到高性能芯片中,让高要求的工作负载能够持续运行,同时还能为下一个软件版本、下一次型号更新以及下一代客户需求预留足够的余量。

这正是 AMD Ryzen(锐龙)AI 嵌入式 X100 系列处理器背后的理念:一款高性能 x86 嵌入式 APU 平台,将高性能 CPU 核心、独立级集成 GPU、NPU 加速能力和统一内存整合在一起,以应对严苛的边缘工作负载。

嵌入式系统本身正成为工作负载

在许多嵌入式设计中,应用已不再是单一、清晰的处理流水线,而是由多条流水线、服务、显示、加速器和软件层共同组成,并需要彼此协同工作。

医用超声技术融合了滤波、波束成形、后处理图像生成、AI 辅助检测和实时可视化功能。软件定义广播系统也可能需要整合图形渲染、视频流水线、多显示输出、分析能力以及可现场更新的应用逻辑。

这些工作负载很难简单映射到单一计算引擎上。有些任务是标量计算,有些适合向量化处理,有些具备大规模并行特征,还有一些则天然适合 AI 加速。真正的难点在于,其中很多任务需要同时运行。

因此,面向广泛市场的嵌入式平台越来越需要异构计算能力。CPU 性能对于编排、中间件、网络、存储和应用代码至关重要;GPU 性能对于可视化、图形、视频、AI 和 DSP 计算十分关键;NPU 性能则有助于在边缘侧支持高效推理。而同样关键的是,内存架构决定了数据在不同处理阶段之间流转的效率,并直接影响系统时延和吞吐量。

医疗成像:波束成形、可视化与 AI

高端超声几乎会对嵌入式系统的每个部分提出要求,包括波束成形、信号处理、图像生成、可视化以及 AI 辅助分析。如果增加独立加速器,可能会进一步提高电路板复杂度、散热负载、验证工作量和功耗。

锐龙 AI 嵌入式 X100 系列处理器通过在单个 APU 中整合 x86 CPU 核心、独立级集成 GPU、NPU 加速能力和统一内存,帮助应对这些挑战。CPU 可协调数据采集、控制、应用逻辑和工作流管理;GPU 可加速数据并行处理和可视化;NPU 则可为 AI 辅助成像或工作流功能提供高效推理支持。

这一优势与实际应用高度相关。AMD 内部测试显示,锐龙 AI 嵌入式 X100 系列处理器可为医疗超声扫描中的波束成形工作负载提供出色性能。在便携式推车式超声系统中,以集成式 X100 器件取代独立 GPU,有助于医疗设备制造商节省空间、功耗和物料清单成本。

软件可移植性在这一市场中同样重要。AMD ROCm HIPIFY 可帮助开发者将基于 CUDA® 的工作负载迁移至可移植代码路径,减少重新开发工作量,同时维持跨异构计算平台的可移植性。

超声性能不仅取决于原始算力,也取决于数据在系统中流转的效率。锐龙 AI 嵌入式 X100 系列 CPU 支持高达 273GB/s 的内存带宽和共享 32MB MALL 缓存,有助于提升系统中的数据流转效率,支持医疗超声等高带宽工作负载。

专业音视频、广播:从固定功能走向软件定义

专业音视频和广播系统正在从固定功能硬件转向软件定义平台。编码、解码、播出、AV-over-IP 路由、交互式图形、多显示输出以及 AI 增强型工作流,正越来越多地运行于灵活的 x86 系统上。这一转变也改变了处理器选择逻辑:平台必须能够支持媒体流水线、渲染、操作界面、分析和网络化工作流,同时让系统构建者能够在不更换硬件的情况下增加新编解码器、新功能和新的部署模式。

X100 系列进一步扩展了这一价值主张。其搭载独立级集成 GPU,可支持最多四路 4K120 或两路 8K60 显示输出,并采用面向并发媒体、图形和 AI 工作负载优化的 CPU/GPU/NPU 架构。在 GFXBench 5.0.0 等图形测试中,锐龙 AI 嵌入式 X100 系列处理器展现出强劲的 OpenGL® 和 Vulkan® 图形性能,可助力图形丰富型界面、多画面显示、叠加层、可视化和渲染工作负载,同时让设计人员在不便采用独立 GPU 的系统中获得更高灵活性。

总体而言,在这些应用中进行设备端推理,还可支持内容标注、场景分析、自动化制作功能、个性化体验或操作员辅助,同时让 CPU 和 GPU 继续服务于媒体或图形流水线中的其他任务。

边缘 AI 不止于 TOPS

AI 正在成为更多嵌入式系统的一部分,但推理只是应用中的一个环节。平台还需要处理数据采集、预处理、编排、网络、安全、模型生命周期管理、存储、可视化和应用逻辑。

通过在单个 SoC 中整合高性能 CPU 核心和独立级 GPU,锐龙 AI 嵌入式 X100 系列处理器有助于在物理 AI 应用中减少对单独计算模块的需求,从而为系统成本优化提供空间。

mimik 近期发布的论文也进一步印证了这一点。在采用 mimik Agentix Operating Engine 建模的智能体工作负载中,基于锐龙 AI 嵌入式 X100 系列处理器的平台可通过跨设备动态调度,提升智能体 AI 工作负载的处理能力。随着工作负载在推理、编排、内存移动、网络和可视化之间切换,锐龙 AI 嵌入式 X100 系列处理器可帮助开发者保留部署灵活性。

在采用 Vulkan 后端运行 llama-bench 时,锐龙 AI 嵌入式 X100 处理器展现出良好的令牌生成性能和首个令牌生成时间表现。对嵌入式 AI 开发者而言,加速器性能固然重要,但周边平台决定了这些性能在实际部署中能够被有效利用到什么程度。

X100 的芯片基础

这一基础始于 CPU 复合体:最多 16 颗 AMD“Zen 5”核心,以及最多 32 个处理线程,可为多线程工作负载提供强劲算力,并支持需要高吞吐量和快速响应能力的嵌入式应用。

AMD RDNA 3.5 GPU、AMD XDNA 2 NPU 和统一内存子系统共同完善了这一平台能力:提供图形和并行计算能力、专用 AI 加速能力,并减少显式数据移动。

开放软件,支持系统持续演进

嵌入式开发团队通常已在 Linux®、虚拟机管理程序、x86 应用、媒体框架、图形 API、AI 框架、基于 CUDA 的工作负载以及行业专用代码方面进行了大量软件投入。新的嵌入式平台需要在支持这些既有投入的同时,增加加速能力和新功能。

锐龙 AI 嵌入式 X100 系列处理器构建于开发者熟悉的 x86 开发环境和开放软件生态系统之上。AMD ROCm 软件提供开源 GPU 计算栈。HIP 和 HIPIFY 可帮助开发者将基于 CUDA 的工作负载迁移至可移植代码路径;一旦 CUDA 代码完成迁移,同一代码库即可同时支持 ROCm 和 CUDA 后端,为开发者提供更加灵活的部署选择。

对于软件定义系统而言,这种灵活性是设计的核心。医疗成像团队可以保留核心应用逻辑,同时探索 GPU 和 AI 加速;广播、专业音视频系统构建者,则可以通过软件部署新编解码器、渲染更新和应用工作流,而无需等待新的固定功能硬件周期。

面向长生命周期嵌入式部署而打造

医疗设备、工业设备、广播基础设施和边缘设备可能需要运行多年。它们需要稳定供货、长生命周期规划、持续运行能力、环境适应性以及部署灵活性。

锐龙 AI 嵌入式 X100 系列处理器正是面向这些实际需求而设计。该系列处理器规划提供 10 年制造供货周期,支持同一时间跨度内的 7×24 小时连续运行,并在全产品栈提供工业温度选项,额定结温范围为 −40°C 至 +105°C。X100 还支持多种量产路径,包括板载芯片设计和合作伙伴系统模块选项。

结  语

高性能嵌入式系统正在发生变化。它们被要求在本地整合更多工作负载,支持更多软件定义功能,并在尺寸、功耗、成本和生命周期支持等现实限制下运行。

对于系统设计人员而言,这意味着更少的独立组件、更少的数据移动、更高的工作负载整合度以及更大的软件灵活性。

文章来源:AMD Xilinx赛灵思官微