跳转到主要内容
瑞苏盈科专栏
我与瑞苏盈科板卡的开发故事

机器人有了"耳朵":声学感知如何成为自主机器人的下一个突破口?

我们谈论机器人自主性的时候,讨论的几乎都是视觉——摄像头、激光雷达、计算机视觉算法。但有一个问题很少被提及:机器人其实是“聋”的。

在工厂里,这不是问题。机器人按程序运行,不需要和人交流。但当机器人走进仓库、医院、办公室,开始和真实的人协作时,单靠“看”已经不够了。

人不会总站在摄像头正前方。嘈杂的环境、遮挡、逆光……任何一个因素都可能让视觉系统失效。而声音不一样,它绕过障碍物传播,来自四面八方,不受光线影响。

赋予机器人“听”的能力,是人机协作走向真正自然的关键一步。

在机器人上装个收音麦克风不就行了?

现实没那么简单。单个麦克风收到的是一锅“大杂烩”——人声、电机振动、空调噪音全都混在一起,根本无法区分。要让机器人真正“听懂”,需要的是一套分布式麦克风阵列,配合空间计算,才能做到两件关键的事:

  • 定位(听到哪里来的): 通过计算声音到达各麦克风的时间差,推算出说话人的三维空间坐标,引导机器人转向正确的方向。
  • 隔离(听清说的什么): 用波束成形技术,像“聚光灯”一样只聚焦目标方向的声音,同时滤掉周围所有噪声,提取干净的语音。

三层技术,构建完整的听觉感知链路

莱迪思最新白皮书《自主机器人的声学感知》,详细描述了一套将上述能力落地的完整边缘计算架构,由三层技术协同构成:

第一层:布线不再是噩梦

ADI 的 A²B® 技术用一根普通双绞线,就能同时传输高保真数字音频、供电和控制信号,支持最多32路麦克风级联。机器人头部、躯干、底盘上的麦克风,不再需要一堆复杂的线束,布线重量和复杂度大幅降低,同时保证各路音频严格同步——这是波束成形的基础。

第二层:数据直达GPU,零延迟

莱迪思FPGA 承担数据采集与传输的工作,将麦克风阵列的多通道音频打包成标准数据流,通过以太网直接送入 NVIDIA GPU,全程不经过 CPU,延迟可控、时序确定。

第三层:GPU上的实时声学计算

音频进入 NVIDIA Holoscan 流水线后,定位计算、协方差矩阵、空间三角测量全部在 GPU 上并行运行。波束成形器随即将“声学镜头”对准说话人,输出干净的语音信号——不是经过压缩或美化的音频,而是保留完整物理信息的原始 PCM 波形,可直接送入语音识别模型或 VLA/VLM 大模型。

Image
莱迪思声学感知方案

为大模型时代做好准备

VLA(视觉-语言-动作)模型正在重新定义机器人智能的边界。但大模型的上限,取决于它能“看到”和“听到”什么。

这套声学流水线输出的不仅是音频,还有说话人的三维空间坐标,两者同步发布在 GPU 环境中,可与视觉帧、IMU 数据在同一融合层对齐。机器人由此获得真正意义上的多模态感知——它知道你在哪里,也听清楚了你说了什么。

点击立即获取完整白皮书:涵盖 FPGA 实现方案、波束成形信号链设计、GPU 流水线架构等深度内容。