诚恒微近日正式推出旗舰边端侧 AI SoC CH3715。与只强调 NPU 算力的设计不同,这款芯片同时集成 CPU、NPU、GPGPU、3D GPU、双 ISP、VPU、DPU、DSP 和 FFT 加速器等单元,希望在一颗芯片内完成数据采集、视觉处理、AI 推理、系统决策和设备控制。

加入 GPGPU 的直接原因,是 NPU 无法高效覆盖端侧设备的全部计算负载。NPU主要面向神经网络中的矩阵和张量运算,适合执行经过适配的低精度 AI 推理;但机器人、无人机、雷达和多传感器融合系统还包含高精度浮点计算、几何运算、信号处理及不断变化的自定义算法,这些任务对可编程性和计算精度提出了不同要求。
按照诚恒微公布的规格,CH3715集成六核NPU,提供48TOPS的INT8稠密算力;其自研GPGPU则提供最高1TFLOPS的FP32算力,并支持FP64、FP32、FP16和INT8等精度格式。两者的定位并不重叠:NPU负责已适配神经网络模型的主要推理工作,GPGPU承接NPU不擅长或尚未完成算子适配的并行计算任务。
这种分工也体现于诚恒微设定的应用方向。公司表示,GPGPU可用于雷达信号和浮点计算,FFT专用加速器处理特定数字信号任务,双路ISP负责可见光与红外图像,CPU则承担系统调度和业务逻辑。数据在片内不同单元之间流转,可减少多颗独立芯片之间的数据搬运。
软件生态是GPGPU能否发挥作用的另一项关键因素。诚恒微称,CH37系列支持ONNX模型格式以及PyTorch、TensorFlow和ONNX Runtime等推理框架,并提供NPU部署工具链;其GPGPU指令集为自主设计,同时在编程模型和工具链层面兼顾CUDA开发习惯,目标是降低已有程序迁移到新平台的成本。
不过,更多计算单元并不自动等于更高的实际性能。在端侧SoC中,NPU、GPGPU、CPU和图像处理模块需要共享有限的内存带宽和功耗预算。诚恒微也将内存访问仲裁、计算单元调度、电源管理和物理设计列为CH3715研发中的主要挑战。异构架构的最终效果,仍取决于软件调度、模型适配以及具体应用负载。
从产品路线看,CH3715更像是一个覆盖多类端侧任务的“全能力”平台。诚恒微计划在后续产品中依据具身智能等具体场景裁剪部分模块,并强化VLA模型加速、机器视觉和带宽能力。这意味着GPGPU并非对NPU路线的否定,而是诚恒微为端侧复杂工作负载增加的一层通用计算补充。
目前公开的性能和效率数据主要来自诚恒微及相关媒体采访,尚不足以代替不同模型、功耗条件和终端设备下的独立测试。CH3715能否把异构集成优势转化为量产产品中的成本、功耗和开发效率优势,仍需结合客户导入与实际部署情况观察。