下方视频展示了在 AMD Radeon™ 集成 GPU 上运行的实时视觉语言推理流程,重点体现了在高能效嵌入式平台上实现多模态 AI 的能力。
该系统可处理实时或录制的视频流,并基于对视觉场景的理解提供交互式问答。
轻量级视觉语言模型(VLM)联合视觉输入理解和自然语言查询,从而实现目标识别、场景描述和上下文推理等应用。
该流程支持交帧级交互查询,用户可以针对当前视频逐帧提问,并实时获得模型生成的回答。
请点击查看更多 AMD ROCm.AI 详细介绍
下方视频展示了在 AMD Radeon™ 集成 GPU 上运行的实时视觉语言推理流程,重点体现了在高能效嵌入式平台上实现多模态 AI 的能力。
该系统可处理实时或录制的视频流,并基于对视觉场景的理解提供交互式问答。
轻量级视觉语言模型(VLM)联合视觉输入理解和自然语言查询,从而实现目标识别、场景描述和上下文推理等应用。
该流程支持交帧级交互查询,用户可以针对当前视频逐帧提问,并实时获得模型生成的回答。
请点击查看更多 AMD ROCm.AI 详细介绍