使用量子纠错码抑制量子噪声,是实现实用化、高保真量子计算的关键
量子计算机有望在分子模拟、密码破解、组合优化等领域带来指数级加速,但物理量子比特极易受噪声干扰,错误率比经典比特高数个数量级。退相干、门操作误差、测量误差和串扰等多种噪声源使得未经纠错的量子计算无法扩展到实用规模。
量子纠错码(Quantum Error Correction, QEC)是解决这一问题的核心方案。其基本思想是将一个逻辑量子比特编码到多个物理量子比特中,通过冗余编码引入信息冗余,使得个别物理比特的错误可以被检测和纠正,而不会破坏逻辑量子比特携带的量子信息。
在此背景下,复旦微电使用FPGA Agent生成QEC-ACC 量子纠错解码器IP核,应对量子噪声挑战。
IP核产品整体概述
工程参数总览
QEC-ACC量子纠错解码器IP核采用纯 Verilog 可综合代码实现,目标器件为复旦微电FM9V2400TA2104高端 FPGA 平台;设计主时钟域 core_clk 目标工作频率可达 300 MHz,可充分满足高性能计算需求。
整个系统包含 25 个可综合模块与六大解码引擎,完成完整的系统级封装;接口采用 AXI4‑Lite 作为配置通路、AXI‑Stream 作为高速数据通路,实现双时钟域架构隔离。
当前为 v.9 DSU 指针栈优化版本,于 2026 年 8 月发布。
核心特性
QEC-ACC是一款参数化的多引擎量子纠错解码器IP核,支持表面码d=3和d=5两种码距配置。核心特性如下:
五引擎并行架构
Union-Find(UF)、Belief Propagation(BP)、Relaxed BP(RelayBP)、MWPM、OSD五大解码算法引擎集成于同一IP核,针对表面码等主流纠错码优化,支持d=3到d=7多码距配置。
FPGA原生加速
基于FM9V2400TA2104架构深度优化,纯Verilog RTL实现300MHz目标工作频率。
标准AXI接口
拥有25个可综合模块与完整AXI接口生态。AXI4-Lite配置寄存器 + AXI4-Stream症候输入/纠错输出,无缝集成SoC
参数化设计
码距D可配置(3/5),数据位宽64-bit,支持Tanner图配置
全流程质量保障
遵循fmfpga-v3+二阶段框架,以七大铁律约束,通过OEOW代码门禁和零退化验证机制确保工程级可靠性,杜绝虚假PASS,且支持多引擎交替运行与结果交叉验证。
异步复位、低功耗设计
适配复旦微电高端9系列FPGA产品
架构概述
QEC-ACC IP核采用模块化设计,主要包含以下子模块:

六大解码引擎

系统模块层级

应用场景
超导量子计算
作为实时解码加速器嵌入FPGA控制板卡,在1μs QEC周期内完成表面码/拓扑码实时解码与反馈纠错,提升量子门保真度,可适配NISQ及容错计算。
离子阱量子计算
症候测量周期约1ms,可支持更大码距和更复杂解码算法的实时处理。
量子计算云平台
批量离线解码大规模量子纠错实验数据,加速后处理分析。
量子通信QKD后处理
适配光量子通信链路,完成量子密钥分发纠错、信息协调与保密增强,加速高速密钥生成。
航天抗辐照纠错
解决空间辐射单粒子翻转问题,保障星载计算、深空探测等场景下的极端环境高可靠容错运行。
数据中心存储纠错
应用于SSD NAND Flash纠错,RAID阵列数据恢复,内存ECC增强等场景,提高大容量存储可靠性。
5G/6G信道纠错
面向 Sidelink 直连通信场景,实现极化码 / LDPC 高速解码,完成信道编码硬件加速,支撑低时延高可靠通信。
算法研究平台
多引擎灵活切换用于算法对比验证与性能评估。
ASIC原型验证
为定制化量子纠错芯片提供RTL参考设计,FPGA原型验证。
核心技术原理与亮点
表面码
表面码将逻辑量子比特编码在二维晶格的物理量子比特阵列上。
数据量子比特位于格点,辅助量子比特(X型和Z型)交替排列在格点之间。
码距d决定纠错能力:可纠正最多t=(d-1)/2 个错误。
QEC-ACC支持两种码距配置:

示例:
• d=3: N=9个数据比特, M=4个稳定子
• d=5: N=25个数据比特, M=12个稳定子
校验矩阵H定义症候与错误的线性关系:
s = H · e (mod 2)
s为症候向量, e为错误向量
解码器目标:找到满足 H·c=s 的最小权重纠正向量 c。
这是 GF(2) 上的 NP-hard 优化问题,不同算法在精度和速度间各有取舍。而QEC-ACC集成了五种解码算法,覆盖从极速到高精度的全谱需求。
五大解码算法
Union-Find (UF)
基于并查集数据结构,快速合并错误簇并判定边界。平均复杂度近O(d³),已知最快解码算法。集成OSD-1优化提升纠错精度。
Belief Propagation (BP)
基于Tanner图的消息传递算法,迭代更新比特置信度。精度高但迭代次数多,非收敛时转入GE求解保证H·c=s。
Relaxed BP (RelayBP)
BP的松弛变体,减少消息传递轮次以降低延时。非收敛时同样用GE兜底。精度与速度的最佳平衡。
MWPM
最小权重完美匹配,将解码转化为图论最优匹配问题。精度最高,用GE替换贪心映射确保正确性。
OSD
有序统计解码,先BP预解码再高斯消元精确求解。精度接近MWPM,GE两级流水化设计降低关键路径延时。
三大技术亮点
亮点1:核心架构创新
DSU指针栈优化
并查集数据结构是UF解码器的核心,传统pvalid线性扫描需要12级LUT链串行判断,成为时序瓶颈。
通过创新采用ptop指针栈架构,将有效指针以栈的形式维护,实现O(1)栈顶直接寻址,fmax从77MHz提升至443MHz,WNS改善约1.7ns,P0路径全部清零。
多解码引擎异构架构
单一解码算法无法兼顾所有纠错场景。本IP集成五大解码引擎:Union-Find、Belief Propagation、MWPM、OSD、高斯消元,可通过寄存器配置灵活
切换不同码型、不同码距、不同错误率下自动选择最优算法,适应表面码、CSS码等多种量子纠错码。
亮点2:精准设计与高吞吐接口
静态预估误报甄别
传统静态时序分析容易对表面码等小规模电路产生
误报。本项目建立了精确的瓶颈甄别机制:
- 区分真实关键路径与表面码邻居连接,码距 D=5 的表面码,其节点邻居仅 2‑4 个。
- 避免对小规模局部连接的过度悲观估计
- 精确识别真正需要优化的PO路径
- 减少无效优化投入,聚焦真实瓶颈
AXI-Stream流水线接口
采用标准AXI-Stream协议构建高吞吐数据通路:
- 流式Syndrome输入,支持背压传输
- 纠错结果流式输出,流水线并行处理
- 输入输出FIFO平滑速率波动
- 仲裁器智能调度多引擎共享
亮点3:BRAM资源统一管理
双时钟域隔离
将 100 MHz 的 AXI4‑Lite 配置域与 io_logic_clk 相互隔离,规避跨时钟域时序风险。
三级顶层封装
在RTL层面,通过qec_top → qec_acc_top → qec_acc_score_top,三级逐层封装,实现控制通路与高速计算通路的双重隔离,保障系统稳定可靠。
集中式存储调度
qec_bram_manager统一管理片上BRAM资源,多解码引擎共享内存,避免重复存储浪费。
Tanner图灵活配置
qec_tanner_config模块支持运行时配置纠错码Tanner图结构,适应不同码型和码距。
完整寄存器映射
AXI4-Lite从设备提供完整的寄存器接口,支持状态读取、控制配置、中断管理。
性能分析与行业对标
各引擎实测延时

- UF引擎是最快引擎:d=3仅13 cycles(39ns@331MHz),满足超导量子比特1μs QEC周期约束,达到世界一流水平
- RelayBP是精度与速度的最佳平衡:d=3仅39 cycles(118ns),约为BP延时的1/3
- MWPM兼顾高精度与低延时:d=3约22 cycles(67ns),比Micro Blossom的MWPM实现快5倍以上
- BP引擎延时最高但精度最优:d=5非收敛135 cycles(408ns),仍满足1μs时限
- OSD引擎在BP收敛时极快(23 cycles),非收敛时GE兜底增加延时
不同解码算法在精度(逻辑错误率)和延时之间存在根本性权衡:
- UF算法:速度最快但精度最低,适合实时反馈场景,错误可通过多轮纠错累积修正
- MWPM算法:精度最高(理论最优解),Micro Blossom将d=9降至367ns仍是该算法最好成绩
- BP/OSD算法:精度接近MWPM,延时介于UF与MWPM之间,是精度与速度的折中选择
QEC-ACC的核心优势在于五引擎集成于同一IP核,用户可根据应用场景灵活选择:
- 超导量子计算(1μs周期):UF或RelayBP满足实时约束
- 离子阱量子计算(1ms周期):MWPM或OSD追求最高精度
- 研究验证场景:多引擎交叉比对,评估不同算法效果
延时数据在行业内的对比
以下为QEC-ACC与业界已发表的QEC解码器延时对比,涵盖UF、MWPM、神经网络等多种算法和FPGA、ASIC、软件等多种实现平台:
- UF引擎d=3仅39ns,与AFS的42ns(d=11)同级,远快于Google AlphaQubit(63μs)和Riverlane(16μs)
- MWPM引擎d=3仅67ns,比Micro Blossom的367ns(d=9)快5倍以上
- Helios在更大码距(d=21)下达到11.5ns,得益于VCU129大规模FPGA和O(d³)并行处理单元
- 神经网络解码器(Google/GNN/TCN)延时在百纳秒到微秒级,软件实现慢3个数量级
综上数据可得,QEC-ACC在d=3码距下延时达到世界一流水平,且集成了五种算法提供灵活性
性能数据:时序优化成果显著
优化后性能提高5.7倍,P0路径全部清零,300MHz目标频率稳定达标,关键路径余量充足,具体优化情况如下:
优化前
设计方式:pvalid线性扫描
结构:12级LUT链串行判断
最高频率:77MHz
WNS:严重违例
瓶颈:每拍遍历所有有效指针
优化后
设计方式:ptop指针栈架构
结构:栈顶指针直接寻址
最高频率:443 MHz
WNS:改善约1.7ns
优势:O(1)O(1)O(1)栈顶访问
验证质量保障
分层验证体系:L0编译 → L1单元 → L2 Golden对齐 →L3系统级(稳定性/随机/边界/背靠背)
测试矩阵:5引擎 × 2码距 × 8错误权重 × 5测试类型 完整组合
功能覆盖:CP1-CP7覆盖点 + CC1-CC5交叉覆盖全部100%,d=3症候16/16穷举
H·c=s校验:每条测试验证 H·correction=syndrome(mod2),三态判定
自证清白:四阶段递进论证,Golden三源独立(暴力枚举+核搜索+数学不变量)
接口与使用
硬件集成
AXI4-Lite 配置接口
- 配置域时钟:saxi aclk100 MHz
- 功能:寄存器配置与状态读取
- 控制寄存器:引擎选择、启动停止
- 状态寄存器:就绪标志、错误指示
- 参数寄存器:码型配置、码距设置
- 中断管理:完成中断、错误中断
- 特点:异步时钟域,独立复位,低带宽配置通路
- 配数措器映场观图
AXI4-Stream 数据接口
- 数据域时钟:core_clk 300MHz
- 功能:Syndrome输入与纠错结果输出
- 输入通道:s_axis_syndrome,流式症候输入
- 输入通道:m_axis_result,纠错结果输出
- 输出通道:maxis result,纠错结果输出
- TREADY/TVALID握手,支持背压
- FIFO缓冲,平滑速率波动
- 特点:高吞吐数据通路,流水线并行处理
系统集成架构

软件流程
1.上电复位
拉低rst_n至少10个时钟周期,所有引擎进入空闲态。
2.配置寄存器
通过AXI4-Lite写入引擎类型(0-4)、码距(3或5)、Tanner图参数。
3.发送症候
通过AXI4-Stream将测量得到的syndrome数据写入,每轮一个64-bit word。
4.等待完成
轮询状态寄存器done位,或使用中断(如已连接)
5.读取结果
通过AXI4-Stream读取64-bit纠正向量,对数据量子比特执行X/Z翻转
6.循环纠错
步骤3-5重复执行,每个QEC周期一轮
总结与展望
QEC-ACC是一款面向实用化量子计算的低延时多引擎表面码解码器IP核,具有以下核心优势:
- 极速解码:UF引擎d=3仅39ns,满足超导量子比特1μs QEC周期约束,达到世界一流水平
- 算法全面:五引擎覆盖从极速UF到高精度MWPM的全谱需求,用户按场景灵活选择
- 数学保证:H·c=s不变量校验确保每条输出数学正确,功能覆盖率100%,零虚假PASS
- 标准接口:AXI4-Lite + AXI4-Stream,即插即用集成量子控制SoC
- 验证充分:2155条测试0 INVALID,自证清白S级10.0/10
未来这一IP核也将不断迭代,优化方向包括:
- 扩展支持d=7/d=9更大码距,面向百万物理量子比特规模
- 探索神经网络解码器引擎,利用AI提升纠错精度
- ASIC定制化设计,进一步降低延时与功耗
- 与量子控制硬件深度集成,实现亚微秒全闭环QEC
写在最后
从策划方案到验证交付,该IP核的诞生依托于复旦微电FPGA Agent——fmfpga-v3的十二阶段全流程运作。

欢迎联系复旦微电获取QEC-ACC技术白皮书完整版及试用支持
FPGA开发门槛高、调试周期长是行业普遍难题。复旦微电FPGA Agent以AI智能体赋能FPGA完整研发链路,支持从需求解析、RTL生成、仿真验证到时序调试的全流程自动化,沉淀可复用IP资产,重塑硬件开发模式。
《复旦微电FPGA Agent智创IP系列》文章将持续分享最新的Agent生成IP的设计、验证与落地实践,欢迎持续关注!
文章来源:复旦微电

