前言:

        不少客户说之前的项目想上大模型,让我们推荐一个适配好的算力卡。但端侧 AI 算力卡这两年型号满天飞,技术路线各异,算力功耗各不相同,算法环境生态与适配场景天差地别,实在不敢拍胸脯说”这张卡在你的板子上一定能跑起来”。

        既然是客户需求痛点,我们仔细筛选各类适合端侧AI应用场景落地的M.2算力卡,干脆把主流的几款卡都买回来,在眺望电子RK3588核心板平台上上逐一适配、验证、写文档。

目前我司已深度适配调通如下四款:

●瑞芯微 RK1828

图片

图片

●Hailo-8

图片

图片

●DEEPX DX-M1

图片

图片

●爱芯元智 AX-M1

图片

图片

一、四款算力卡基本参数对比

●RK1828:瑞芯微自研协处理器,20TOPS,片内 5GB 高带宽 DRAM,官方评估 Qwen2.5-7B int4 约 3.5GB,是四款里唯一能官方备书跑 7B 的。

●Hailo-8:26TOPS,无 CPU 无 DRAM、全靠片上 SRAM,功耗低至 2.5W,视觉推理全家桶,走极致低功耗路线。

●DX-M1:25TOPS + 4GB LPDDR5,4.5W,特色是 PPU 硬件后处理和 systemd 服务化驱动,面向多路摄像头场景友好。

●AX-M1:24TOPS,自带八核 A55 和 8K 编解码 VPU,8GB 内存,LLM、多模态、语音、文生图都能跑,上手较为全能的一张。999

维度

RK1828

Hailo-8

DX-M1

AX-M1

品牌

瑞芯微RK182X

以色列Hailo

韩国DEEPX

爱芯元智AX8850

NPU

20TOPS@INT8

26TOPS@INT8

25TOPS@INT8

24TOPS@INT8

内存

片内 5GB DRAM

片上 SRAM

4GB LPDDR5

8GB LPDDR4x

接口

M.2 Key-B,

PCIe/USB3.0 二选一

M.2 M-Key

PCIe Gen3 ×4/×2

M.2 2280

PCIe Gen3 ×4

M.2 2242~2280

PCIe Gen3 ×4

功耗

外接 12V/3A + 3.3V/3A

2.5W

4.5W

≤8W

定位

大模型协处理器

纯视觉推理、低功耗

摄像头边缘推理

端侧多模态一体化

温度

-10℃ ~ 55℃

工业级:-40°C~85°C 

车规级:-40°C~105°C

商业级:0°C至70°C

 工业级:-40°C至85°C

 车规级:-40°C至85°C

0°C 至 70°C

价格

¥1999

¥1199

¥999

¥1619

二、链路联调实测

 2.1  模型支持与验证

卡/模型

RK1828

Hailo-8

DX-M1

AX-M1

多模态模型 

FastVLM

GME-Qwen2-VL

InternVLM

MiniCPM-V-4

Qwen2.5-VL

Qwen3-VL

Qwen3-VL-LoRA

Gemma4

SmolVLM

SmolVLM2

CLIP

YOLOWorldv2

CLIP

InternVL3

Qwen2.5-VL

SmolVLM2

CLIP

YOLOWorldv2

Lcm-lora-sdv1-5

Janus-Pro-1B

LivePortrait

大语言模型

Qwen2.5-Omni

Qwen3-ASR

Qwen3-TTS

vits

zipformer

-

-

DeepSeek-R1-Distill

Qwen3

Qwen2.5

MiniCPM4

SmolLM3

Llama3.2

Gemma2

Phi3

StableDiffusionv1.5

视觉模型

mobilenet_v1

mobilenet_v2

resnet

yolov5

yolov6

yolov8

Depth-AnythingV2

SCDepthv3

FastDepth

StereoNet

YOLO11

YOLOv7-Face

YOLO11-Seg

YOLOv8

YOLOv8-Seg

YOLO11-POSE

YOLOv5

YOLOv6

YOLOv9

YOLOv10

YOLOX

SSD

CenterNet

Real-ESRGAN

低光增强

图像去噪

人脸检测

人脸识别

人脸属性

人脸关键点

实例分割

语义分割

人体属性

行人重识别

手部关键点

3D 目标检测

文本检测识别

视频分类

AlexNet

DenseNet121/161

EfficientNetB2/V2S

HarDNet39DS

MobileNetV1/V2

RegNetX/Y 系列

RepVGGA1

ResNet18/34/50/101

ResNeXt26/50

SqueezeNet1_0/1_1

VGG11/13/19(含 BN)

WideResNet50/101

YOLOv5(N/S/M/L)

YOLOv7(E6/W6)

YOLOv8

YOLOv9

YOLOX

SSD(V1/V2 Lite)

YOLOv3

YOLOv7-Face

YOLO11-Seg

YOLOv8-Seg

DeepLabv3

PIDNet

BiSeNetV1/V2

YOLO11-POSE

Real-ESRGAN

DnCNN

人脸识别

人脸属性

人脸关键点

手部关键点

3D 目标检测

PPOCR v4/v5

视频分类

低光增强

Depth-AnythingV2 

MixFormerV2

YOLO11

YOLOv7-Face

YOLO11-Seg

YOLOv8

YOLOv8-Seg

YOLO11-POSE

Real-ESRGAN

LivePortrait

语音模型

Qwen2.5-Omni

Qwen3-ASR

Qwen3-TTS

vits

zipformer

Whisper

-

Whisper

SenseVoice

MeloTTS

 2.2  实测FAQ

卡/模型

最硬的坑

RK1828 

●PCIe 和 USB3.0 是 Combo PHY,只能二选一;

●必须外接 12V(12V/3A + 3.3V/3A);

●片内 5GB vs 7B int4 约 3.5GB,跑 7B 时空间逼近上限

Hailo-8

●跑 demo 前修改 /etc/security/limits.conf,必须从 1024 改 4096,否则起不来;

rockit sdkak_rockit_demo无法运行,可以修改/etc/hailo_integration_tool/input.json文件选择测试项。

DX-M1

●多路复用推荐转化成ppu模型进行加速,对性能会有质的提升,但2.2版本编译工具链转化为ppu模型转化需要python3.11以上

AX-M1

●不同模型需要的opencv版本不一样,例如视觉模型需要4.6版本的opencv,其他模型4.5版本即可

 2.3  交付的不是 demo,是确定能落地

1.Qwen3-VL在RK3588+RK1828已全链路跑通:RKNN3模型获取、RKNN模型转换、RK3588应用编译及RK1828运行环境部署。

2.Hailo-8配合RK3588 的 rockit SDK 负责视频解码上屏,Hailo-8 跑目标检测,最后 ak_rockit_demo 把 16 路画面 4×4 拼接,每路同时画人和车的框。

3.DX-M1 打通一条完整的摄像头实时推理链路,整包固件加预装编译器的虚拟机。每份文档都按真实踩坑记录写——环境几步走、量化怎么配、哪些坑我们已经替客户踩过,文档写不全的,技术支持来补。

4.AX-M1 把大模型跑成了服务。 Python tokenizer HTTP 服务加 C 推理程序的组合架构,KVCache 落盘可复用;按模型类别做了 6 个整包固件(CV、AUD、LLM、MLLM、T2T、BASE),要什么烧什么;

三、小结

四款卡、四种路线,都在 RK3588 上跑通了。如果您的项目还在为端侧算力选型发愁的话,带着场景来找眺望电子——我们工程师将帮你把”选型”变成”落地”。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐