量子计算的脚步声越来越近,你的RSA和ECC还安全吗?
Shor算法早已在理论上证明:足够强大的量子计算机可以在多项式时间内破解RSA和ECC。更要命的是“先存储,后解密”(Harvest Now, Decrypt Later)攻击——对手今天截获你的密文,等量子计算机成熟后再回头破解。
2024年,NIST正式将ML-KEM(CRYSTALS-Kyber)标准化为FIPS 203,后量子密码迁移的号角正式吹响。但问题来了:ML-KEM的NTT变换、高斯采样、Keccak哈希这些计算密集操作,在通用处理器上跑起来又慢又耗电,嵌入式设备和高速通信场景根本等不起。
硬件加速是必然选择。而今天要讲的故事是:这颗名为FM-PQC100-HT的后量子密码硬件加速IP,是由复旦微电FPGA Agent智能体框架主导开发的。
先看成果:PQC100交出了什么答卷?
FM-PQC100-HT是一颗完整实现NIST FIPS 203标准的ML-KEM硬件加速IP核,规格相当能打:
更让人惊喜的是资源占用——这颗IP核轻得不像实力派:
LUT占用仅3.81%,BRAM只用了6块——这意味着PQC100可以作为协处理器轻松嵌入几乎任何现有FPGA设计,无论是5G基站的基带板卡还是物联网网关,都不用为“塞不塞得下”发愁。低资源占用加上AXI4-Lite标准接口,集成门槛几乎为零。
验证层面的数据更硬核:
• NIST KAT测试:三个参数集全部25/25 PASS,与官方测试向量逐bit精确一致;
• 203项测试全部通过:覆盖模块级功能、边界、异常负向、压力测试;
• 运行时参数切换零退化:75/75组切换测试全部PASS,三个安全级别共用一份比特流,无需重新编译;
• VULTURE时序签核:基于复旦微电自研EDA工具链,布线后WNS = +0.093ns、WHS = +0.043ns,0 Error、0 Critical Warning。
性能方面,以ML-KEM-768为例:KeyGen约2.19ms、Encaps约2.94ms、Decaps约3.70ms(@300MHz),全部操作延迟控制在4ms以内。
看到毫秒级,可能有读者会问:PC上跑软件不是微秒级吗?这里要厘清一个误区——PQC100的战场不在服务器机房,而在5G基站、物联网网关、边缘设备这些没有x86大核的地方。在这些场景里,软件实现的参照系是嵌入式MCU:同样的ML-KEM-768密钥生成,Cortex-M4上软件大约要跑68万个周期,折算成168MHz主频就是约4ms,而且CPU全程被占死。PQC100硬件2.19ms完成的同时,主CPU可以完全腾出手处理业务。
更重要的是FPGA硬件加速的三个不可替代性:
• 确定性延迟:硬件流水线执行,每次耗时恒定,没有OS调度抖动和cache miss——对硬实时场景,“恒定3ms”远比“平均很快、偶尔飙高”值钱;
• 并行可扩展:本文数据是单引擎成绩,FPGA上复制N个引擎,吞吐量线性翻倍,单核MCU没有这个选项;
• 恒定时间执行:硬件级抗侧信道攻击(白皮书中的CAST常量时间扫描就是为这个做的),软件实现要做到这一点需付出额外代价。
对TLS握手而言,网络往返动辄几十毫秒,3ms的密码运算从来不是瓶颈——但不稳定的延迟和被占满的CPU是。值得一提的是,得益于架构优化,ML-KEM-1024的KeyGen/Encaps周期数反而低于ML-KEM-768——安全级别更高,速度还更快。
三⼤技术亮点,每⼀个都是“硬⻣头”
亮点1:v5.0 Codec—— ⼀招“以乘代除”救回时序
ML-KEM的压缩/解压缩涉及对q=3329的除法取整。直接在FPGA上实现除法器?组合逻辑链⻓达152级,关键路径延迟25.251ns,WNS = -21.938ns——严重时序违例,300MHz想都别想。
解决方案是以乘代除——
用预计算常数乘法加移位代替除法运算(即Magic Number除法技术):x / 3329变成x * DIV_MAGIC >> DIV_SHIFT。效果如何?
• 组合逻辑链:152级 → 14级(减少91.8%)
• 关键路径:25.251ns → 3.222ns(降低87.3%)
• WNS:-21.938ns → +0.093ns
从“彻底跑不通”到“正裕量收敛”,一次优化直接逆转战局。
亮点2:S2行融合—— A矩阵“永不整块驻留”
ML-KEM-1024(k=4)的A矩阵需要4096 words存储空间,加上其他中间数据,SRAM容量告急。
S2行融合方案的思路很巧妙:A矩阵永远不整块存进SRAM,而是按行生成、按行消费。Phase 0由XOF生成一行写入行缓冲,Phase 1由Basemul立即消费。行缓冲只需1024 words,峰值占用7425 words < 8192 words,还留出704 words安全裕量。最关键的是——零性能损失,执行次数不变,只改执行顺序。
亮点3:运⾏时参数化—— ⼀份⽐特流,三个安全级别
传统PQC IP用编译期参数,每个安全级别单独编译一份比特流。PQC100把k值、η₁、du/dv、SRAM地址偏移等全部改为运行时从寄存器派生,通过param_sel_i[1:0]信号动态切换。
升级安全策略?
不用重新烧比特流,改个寄存器就行。
幕后功臣:复旦微电FPGA Agent开发框架
重点来了——这样一颗高规格IP,背后的开发模式才是行业真正的风向标。
PQC100的全流程开发基于fmfpga agent框架,这是一套面向FPGA/芯片全流程的AI Agent驱动开发框架。它代表着一种范式转变:
传统模式:⼯程师驱动EDA⼯具,⼈⼯分析报告,经验主导迭代。
Agent模式:Agent⾃主分析→识别根因→调整策略,“输⼊规格→输出结果迭代审查”全⾃动闭环,⼯程师只需审查最终结果。
在Agent时代,FPGA恰好占据“软件定义硬件”的独特生态位——比芯片快十倍(无需流片),比软件Agent多一分硬核(直接生成比特流),堪称AI硬件开发的最佳试验田。
12阶段全流程 + 三位⼀体架构
fmfpga agent把FPGA开发拆解为12个阶段(需求发现→质量策划→系统⽅案→…→上板调试→交付复盘),采⽤纪律层、编排层、执⾏层三位⼀体设计:
纪律层:7条质量铁律构成不可逾越的红线,全⾯嵌⼊GJB9000C质量体系;
编排层:基于Kahn拓扑排序的DAG任务分解,各阶段按依赖有序推进;
执⾏层:30+专业Skill按需组合,RTL设计、验证、综合、调试各归其位。
框架还达到了L5级全⾃主开发能⼒:决策⻔禁引擎五维度量化置信度、⾃动验证闭环六阶段(TB⽣成→仿真→三态判定→Bug修复循环→置信度⻔禁→收敛追踪)、项⽬知识图谱持久化每个设计决策——经验不再随⼈⾛,⽽是沉淀进体系。
七⼤铁律在PQC100上的实战记录
光说理念不够,看实战:

设计周期缩短70-90%、验证覆盖率95%+、重复劳动减少50%、知识100%自动沉淀——这不是PPT上的愿景,而是PQC100项目跑出来的真实路径。
上板实测:真刀真枪的硬核证据
仿真正确、签核通过,只是上半场。FPGA工程师都懂——上板才是照妖镜。PQC100已经完成了真刀真枪的板级验证,直接上结果:
• 实测平台:复旦微电FM9V800TC1517 国产高端FPGA开发板,运行频率300MHz;
• 验证方式:上位机Python脚本通过UART串口向FPGA下发指令和数据,FPGA完成运算后回传结果,脚本现场用NIST KAT标准测试向量逐组比对;
• 实测结果:ML-KEM-768在真实硬件上——
– 密钥生成(KeyGen):25/25 PASS
– 封装(Encaps):25/25 PASS
– 解封装(Decaps):10/10 PASS

实测平台:复旦微电FM9V800TC1517 国产⾼端FPGA开发板
NIST全部KAT测试向量在真实FPGA硬件上100%通过,密钥生成、封装、解封装三大操作全部执行正确。仿真里跑对不算赢,在真实硬件上逐bit对齐NIST官方向量,才是真正的“自证清白”。
上板实测串⼝输出(⾃上⽽下):KeyGen 25/25 PASS、Encaps 25/25 PASS、Decaps 10/10 PASS
不止于PQC100:PQC200已在路上
基于PQC100核心架构,PQC200扩展版已经成型:PQC + 国密SM2/SM3/SM4 + Hybrid混合组合器 + TRNG,RTL复用率超70%,支持10种操作模式。验证成绩同样亮眼:ML-DSA 44/65/87 KAT 210/210 PASS,PQC+SM2混合密钥交换115/115 PASS,国密全功能28/28 PASS。
后量子时代的中国方案,正在加速落地。
写在最后
从“人使用工具”到“Agent编排流程”,PQC100不只是一颗IP核的诞生,更是FPGA研发模式变革的一次实弹演习。当AI Agent遇上后量子密码,我们看到的不仅是更快的开发速度,更是一套质量内建、知识复用、持续进化的研发体系。
量子计算的倒计时已经启动,你的系统准备好了吗?
文章来源:复旦微电子

