2025 年之后,工业 AI 项目"国产化"已经不再是可选项。从信创政策推动到供应链安全意识提升,越来越多的客户在招标时明确要求"国产 AI 芯片方案"。
好消息是,国产 AI 边缘芯片已经形成了完整梯队,从轻量推理到高性能计算,从工业检测到自动驾驶,都有对应的芯片。坏消息是,方案多、生态杂,选型复杂度反而增加了。
这篇文章讲清楚目前用量最大的四家:算能、瑞芯微、地平线、华为昇腾。
一、四大方案参数速览
| 芯片 | 算力(INT8) | 架构 | 典型功耗 | 工具链 | 量产成熟度 |
|---|---|---|---|---|---|
| 算能 BM1684 | 17.6 TOPS | 自研 TPU | 13~18W | Sophon SDK + ONNX/PyTorch | ⭐⭐⭐⭐⭐ |
| 算能 BM1688 | 32 TOPS | 自研 TPU | 10~15W | Sophon SDK | ⭐⭐⭐⭐ |
| 瑞芯微 RK3588 | 6 TOPS | NPU(三核) | 8~12W | RKNN-Toolkit2 | ⭐⭐⭐⭐⭐ |
| 瑞芯微 RK3576 | 6 TOPS | NPU(双核) | 5~8W | RKNN-Toolkit2 | ⭐⭐⭐ |
| 地平线 J6 | 8~32 TOPS | BPU Nash | 8~25W | TogetheROS + Horizon SDK | ⭐⭐⭐ |
| 华为昇腾 310B | 20 TOPS | 达芬奇架构 | 8W | CANN + MindSpore/ONNX | ⭐⭐⭐ |
这里面算能 BM1684 和瑞芯微 RK3588是目前工业 AI 盒子中应用最广的两款——供应链稳定,开发者社区活跃,方案成熟度高。
二、逐家解读
算能(Sophgo):工业 AI 盒子首选
算能是比特大陆孵化的 AI 芯片公司,BM1684 这款芯片几乎统治了"国产 AI 边缘盒子"这个品类。原因很简单:
17.6 TOPS 算力刚好卡在一个甜点位:跑 YOLOv8s 级别模型、1080p @ 30fps 检测,轻松搞定;多数工业缺陷检测、OCR、分类任务也够用
Sophon SDK 兼容 ONNX 和 PyTorch:训练好的模型通过量化工具转成 BM1684 适配格式,流程相对成熟
功耗 15W 左右:无风扇散热可用,做嵌入式整机没压力
价格竞争力极强:单芯片成本远低于同级 NVIDIA Jetson
算能接下来要推的 BM1688(32 TOPS)会把性能再拉高一个台阶,同时功耗反而更低,是值得关注的下一代平台。
代表产品:朗锐创新 AIC-211 算能 AI 边缘盒子(16 TOPS,嵌入式设计)
瑞芯微(Rockchip):多媒体 + AI 的性价比之王
RK3588 不只是一颗 AI 芯片,它是一颗多媒体 SOC——8K 视频编解码 + 多路 MIPI/LVDS 显示 + 6 TOPS NPU 集成在一颗芯片里。这种"异构计算"的设计让它特别适合:
带屏幕的 AI 边缘终端(AI 检测结果直接本地显示)
多路视频接入 + AI 分析 + 编转码回传
机器人/具身智能(搭配 ROS2)
6 TOPS 算力够用吗? 实事求是,如果任务是标准 YOLO 级别的检测,够。但如果是复杂 Transformer 模型或多模型级联,建议往上选算能或地平线。
代表产品:朗锐创新 AIC-3160 具身智能控制器(RK3588 + 6TOPS NPU + ROS2)
地平线(Horizon Robotics):车规级的工业渗透
地平线的主战场在智能驾驶,征程系列芯片通过了严苛的车规认证(AEC-Q100),可靠性是工业级芯片没法比的。这带来两个优势:
工业场景担心长期稳定性?车规芯片 10 年供货保证
温度范围、震动、EMC 指标远高于工规
地平线的 BPU 架构在视觉场景上优化很深,但工具链上手门槛比算能高——需要适应 Horizon 自己的算法部署流程。
华为昇腾(Ascend):全栈生态但起步高
昇腾 310B 是 Atlas 200 系列的边缘推理芯片,20 TOPS。华为的优势是生态闭环——CANN 计算架构 + MindSpore 框架 + Ascend 硬件,开箱即用。
但门槛也在这里:你必须接受华为的技术栈。如果你的 AI 模型是用 PyTorch 训练的,要走一个"PyTorch → ONNX → Ascend 模型"的转换流程。
适合的场景:已经有华为云/昇腾基础设施的项目、信创要求最高的党政军领域。
三、选型决策框架
你的项目是否必须通过信创认证? ├─ 是 → 只能选国产芯片,继续往下 │ ├─ 只是单路检测/分类 → RK3588(性价比最高) │ ├─ 复杂多模型或多路分析 → 算能 BM1684/1688 │ └─ 有华为云/昇腾基础设施 → 华为昇腾 310 └─ 不是 → NVIDIA Jetson 和国产可以同台对比 ├─ 需要 CUDA 生态(TensorRT、DeepStream)→ 还是 Jetson ├─ 纯推理、ONNX 兼容 → 算能更省钱 └─ 需要视频编解码 + AI → RK3588 一箭双雕
四、国产 AI 芯片的通用注意事项
模型转换是必经之路
不管用哪家的国产 AI 芯片,都绕不过"模型转换"这一步。流程通常是:
训练好的 PyTorch/ONNX 模型 → 量化(FP32 → INT8) → 芯片厂商的转换工具 → 芯片可执行的格式
每家都有自己的转换工具:算能用 Sophon SDK、瑞芯微用 RKNN-Toolkit2、地平线用 Horizon Plugin、昇腾用 ATC。
经验之谈:模型转换环节会吃掉项目 30%~40% 的开发时间,不是"点一个按钮就完成"的事情。INT8 量化带来的精度损失需要反复验证,有时候某些 OP 不支持需要手动替换——这些都要提前留出时间。
别只看纸面 TOPS
国产芯片厂商宣传的 TOPS 数字大概率是 INT8 峰值,实际跑业务模型的利用率能有 50% 就不错。同样是 20 TOPS 纸面算力:
Jetson Orin Nano 20 TOPS:实测能跑到 16~18 TOPS 有效利用率
部分国产 NPU:实测可能只有 8~10 TOPS
差距来自软件栈优化成熟度、算子覆盖率和量化工具的质量。选型时要参考实际项目的 benchmark 数据,不要只看宣传册。
供应链和供货周期
国产芯片相比 NVIDIA 的一个隐蔽优势:供应稳定。对于需要持续量产的项目,供应链稳定性是隐性但致命的选型因素。
五、朗锐创新的国产 AI 产品布局
我们不做芯片,但我们做国产 AI 芯片的整机集成和量产交付:
AIC-9211:算能 BM1684 边缘 AI 盒子,16 TOPS,嵌入式无风扇设计,适配主流 ONNX 模型和国内主流 AI 框架的模型转换
AIC-3160:瑞芯微 RK3588 具身智能控制器,6TOPS NPU + ROS2 + 多传感器接口
定制开发:算能 BM1688 / 瑞芯微 RK3576 / 地平线 J6 等平台的整机设计、载板开发、散热与认证全套服务








