22nm 工艺 · 65K 逻辑 · 4 通道 12.5Gbps SerDes · 硬核 PCIe Gen3 · 独立 Cortex-M3
—— 从 TLP 链路验证到 1080P@60Hz 实时采集,全链路实测通过 ——
本文看点
- PV65 异构架构:FPGA 可编程逻辑 + 独立 Cortex-M3,算力与系统管控集于单颗芯片
- 硬核 PCIe Gen3:事务层 / 数据链路层 / 物理层全硬件实现,用户无需开发协议逻辑
- 三组工程实测:TLP 寄存器读写、DMA 双向传输、1080P@60Hz 高清图像采集全部 PASS
- 资源留有余量:整套采集方案 LUT 占用 25.81%,可继续扩展 AI 推理与图像预处理
导语
在机器视觉、工业检测、嵌入式 AI 等场景中,高速数据传输与实时图像处理能力,往往是硬件方案能否落地的核心门槛。协议栈自研周期长、链路稳定性难保证、主机 CPU 负载高,是开发者最常遇到的三道坎。
京微齐力飞马系列PV65,是专为 AI 视觉打造的国产异构 FPGA 芯片,搭载硬核 PCIe Gen3 控制器与独立 Cortex-M3 MCU,实现 FPGA 可编程逻辑与微控制器的异构协同。依托完整的 PCIe 软硬件协同方案,我们已完成寄存器读写、高速 DMA 传输、高清视频采集的全链路验证,为国产化高速视觉硬件提供一条高可靠的落地路径。

一、PV65 芯片:
国产异构 FPGA,兼顾算力、高速接口与系统管控
PV65 是京微齐力“飞马”系列首款面向 AI 视觉处理的异构 FPGA 芯片,采用 22nm 工艺,拥有 40K LUT6 逻辑资源(等效 65K LUT4),集成 4 通道 12.5Gbps SerDes,内置硬核 PCIe Gen3 控制器与独立 Cortex-M3 微控制器。
FPGA 可编程逻辑分区与 MCU 相互独立、分工调度:一边承担高速图像处理与数据搬运,一边完成整机硬件管理,真正实现异构协同。芯片原生支持 PCIe Gen3 x1/x2/x4 多通道配置,把高速传输能力与嵌入式系统管理能力集于单颗芯片,非常适配工业视觉、车载、嵌入式 AI 设备开发。
核心硬件亮点
- 22nm 工艺,40,800 个 LUT6,充足的逻辑、DSP、存储资源支撑视觉算法预处理;
- 4 路 12.5Gbps SerDes,硬核 PCIe Gen3,硬件实现完整三层协议,无需用户开发协议逻辑;
- 内置独立 Cortex-M3,可自主完成外设初始化与芯片配置,减轻主机 CPU 负担;
- 集成 MIPI、HDMI 高速视频接口,适配主流图像输入输出场景。

图 1. PV65 芯片完整规格
二、硬核 PCIe Gen3:
硬件原生实现,高可靠多模式高速互联
PV65 的 PCIe 采用全硬件硬核,实现事务层、数据链路层、物理层完整协议。开发者无需投入精力开发复杂的协议逻辑,可把资源集中在业务算法上,大幅缩短项目周期。
广泛协议兼容:遵循 PCIe 3.0 标准,向下兼容 PCIe 2.x/1.x,可对接 PC、RK 系列嵌入式平台等各类主机,通用性强。
双角色硬件支持:原生支持端点设备(EP)、根端口(Root)两种工作模式,适配多样化系统拓扑。
灵活带宽配置:支持 x1/x2/x4 通道可配置,按需平衡带宽与功耗;支持 8.0Gbps / 5.0Gbps / 2.5Gbps 速率自动协商。
工业级可靠性保障:集成 AER 高级错误上报、ECRC 数据包校验、奇偶校验、ECC 纠错,支持故障定位与错误自动恢复,满足工业、车载复杂环境的稳定性需求。
标准化接口输出:对外提供 128bit TLP 事务接口与标准 PIPE PHY 接口,方便上层业务逻辑快速对接底层物理层。
配套 DMA 传输软核,进一步释放 PCIe 带宽潜力
- 双向独立通路:Host↔FPGA 双向通道互不抢占带宽;
- 总线兼容性好:兼容 AXI4-MM、AXI4-Stream、AXI4-Lite 接口;
- 适配大图搬运:支持 64 位地址描述符,单描述符最大传输 8MB,最多支持 64 个连续描述符;
- 实时交互能力:配备传输中断以及 16 路自定义 MSI 用户中断,实现 FPGA 与主机高效实时交互。
三、PV65 PCIe 开发板:一体化 AI 视觉硬件平台
基于 PV65 芯片打造的 PCIe 开发板,是面向图像采集、AI 视觉处理的完整硬件评估平台。板卡以 PV65 为主控,集成视频输入输出、大容量缓存与 PCIe 高速外设,采用直插式 PCIe x4 金手指,无需额外线缆,可直接安装到台式机或 RK 系列嵌入式主机上。
板卡核心组成
- PV65 异构 FPGA 主控:统一完成视频解析、帧缓存调度、中断管理与 PCIe 高速数据传输;
- HDMI RX:接入摄像头、PC 等视频源,兼容 HDMI 1.4/2.0;
- HDMI TX:本地画面输出,方便调试与现场监控,不依赖主机预览;
- DDR 大容量缓存:支持双帧乒乓缓存,平滑视频数据流,消除画面撕裂;
- PCIe 金手指:直插主机,快速搭建整套评估系统。

图 2. PV65 PCIe 开发板实物
四、工程验证:从寄存器读写到 DMA 高速传输,链路全通过
我们基于开发板完成了多组工程验证,从基础链路连通性到大流量数据传输全部通过测试,资源占用与时序均满足设计指标。
4.1 TLP 寄存器读写验证
该工程基于 PCIe TLP 事务包实现 BAR 空间寄存器读写,把 PCIe 内存读写 TLP 包转化为片内 RAM 读写,用于 PCIe 链路连通性与寄存器交互的基础验证。

图 3. TLP 寄存器读写功能框图
- 测试流程
- RK3588 主机运行 TLP 读写测试程序;
- FPGA 端收发、解析 PCIe 数据包,完成 TLP 指令解析;
- 将内存读写指令映射到片内 BRAM,执行读写操作。
- 实测效果
在 RK3588 平台实测,对 BRAM 多组地址写入测试数据,回读校验全部匹配,测试结果 PASS。

图 4. TLP 寄存器读写实测结果(RK3588 平台,全部 PASS)
- 资源与时序

方案涉及的各时钟域均达到要求:TLP APP Clock(250MHz)、EP TLP Clock(125MHz)。
4.2 DMA 双向高速传输验证
利用 PCIe DMA 双向通路,实现主机内存与 FPGA 片上 RAM 之间的高速数据读写校验,验证大吞吐量传输能力。

图 5. DMA 双向高速传输功能框图
- 测试流程
- 主机加载 DMA 驱动,运行测试程序或 Qt 上位机;
- FPGA 的 PCIe-DMA 模块解析 DMA 描述符,通过 AXI 总线完成数据交互;
- 将读写操作映射至片内 RAM,完成数据收发校验。
- 实测效果
命令行实测单次 4KB 双向 DMA 传输(8 个描述符 × 512 字节),H2F 写入与 F2H 读回分段校验全部正确。

图 6. 命令行 DMA 双向传输实测:分段校验全部 OK,结果 PASS
同时配套 Qt 图形化上位机,可视化展示收发数据、统计字节数,调试直观便捷。

图 7. Qt 图形化上位机:PCIe 内存读写调试工具
- 资源与时序

表 2. DMA 双向传输工程资源占用
方案涉及的各时钟域 FMAX 均达到要求:
DMA AXI Clock(125MHz)、DMA TLP Clock(250MHz)。
五、实战落地:
基于 PCIe-DMA 的高清图像采集方案
针对 AI 视觉最常用的图像采集场景,我们搭建了一套“FPGA 采集缓存 → 中断通知 → DMA 高速搬移 → 上位机硬件渲染”的流水线架构,采集与 DMA 搬移并行工作,最大化系统吞吐性能。
整套工作流程
- 上电自主初始化:板卡上电后,片内 Cortex-M3 独立完成硬件初始化,配置 HDMI 接收芯片、完成 DDR4 训练锁定时序,无需主机介入。
- 视频采集 + 乒乓缓存:HDMI RX 输入 RGB888 视频流并写入 DDR4;采用双帧乒乓缓存,写新帧的同时读取旧帧,避免读写冲突,保障视频连续无撕裂。一帧缓存完成后,触发 MSI 中断通知主机。
- DMA 零拷贝搬移:主机收到中断后配置 DMA 引擎,将 DDR 中的图像帧直接搬运至主机内存。传输完成再次触发中断,CPU 仅做调度,资源占用极低。
- 上位机硬件渲染:Qt 上位机读取图像缓冲区,借助 OpenGL 硬件加速渲染输出,画面流畅、低延迟。
流水线优势:采集缓存与 DMA 搬移并行——当芯片正在采集第 N 帧时,主机同步读取处理上一帧,充分挖掘整机性能。

图 8. 高清图像采集方案功能框图
- 主要时钟规划

表 3. 高清图像采集方案时钟规划
- 实测效果
方案稳定支持 1080P@60Hz 全高清视频采集,上位机实时显示画面并输出帧率、分辨率信息,支持全屏切换;OpenGL 硬件加速降低 GPU 负载,画面流畅无卡顿。

图 9. 上位机实时采集画面:1920×1080 @ 60fps

图 10. 整机实测环境:开发板 + 主机 + 本地显示
- 资源与时序
整套采集方案 LUT 占用 25.81%、REG 占用 16.22%。芯片仍留存大量逻辑与 DSP 资源,可继续扩展 AI 推理、多通道视频拼接、图像预处理等业务功能;全部时钟域时序满足设计要求。

表 4. 高清图像采集方案资源占用

表 5. 高清图像采集方案时序收敛结果
六、完善配套,助力客户快速开展国产化项目
针对 PV65 PCIe 整套应用,京微齐力提供全套开发资料包,帮助客户快速上手二次开发:
PV65 芯片完整数据手册
FPGA 全套参考工程源码
RK 嵌入式平台 PCIe 底层驱动
Qt 可视化上位机完整工程
开发指南、调试手册
结语

国产异构 FPGA PV65 凭借硬核 PCIe Gen3、独立 MCU 异构架构与丰富的视频接口,打通了从底层链路验证到高清图像采集的完整应用链条。在机器视觉、工业检测、嵌入式 AI、智能车载等国产化场景中,可帮助开发者降低高速接口开发门槛,缩短产品落地周期。
后续京微齐力也将持续迭代参考设计,推出更多面向 AI 视觉的解决方案。
文章来源:京微齐力

