日期:2026-07-22
端侧大模型的算力缺口正在扩大
端侧大模型落地正在全面加速。储能系统的智能告警、工业产线的视觉质检、服务机器人的实时交互——这些场景对本地推理的需求已经从"可有可无"变成"业务刚需"。但一个现实问题是:RK3588、RK3576 等主流主控虽已集成 NPU,在面对 3B 以上大语言模型时,片外内存带宽成为绕不开的瓶颈——模型参数搬运速度跟不上 NPU 计算吞吐,算力再强也无法充分释放。
迅为电子的解决方案是:主控不动,外挂算力。
RK182X是瑞芯微面向大模型推理场景打造的业界首款3D堆叠AI协处理器,定位为端侧大模型算力加速方案,专门解决大模型在边缘设备上部署时的带宽瓶颈与算力不足问题。
迅为iTOP-RK3588 与 iTOP-RK3576 开发板现已完成瑞芯微 RK1820、RK1828 AI 协处理器的适配验证。这款算力卡通过板载 M.2 插槽直连主控,PCIe 高速总线通信,为端侧大模型推理提供专用算力通道,不抢占主控 CPU 与 NPU 资源。
3D 堆叠拉到1TB/s 带宽破解大模型数据搬运困局
RK182X 系列采用 3D 堆叠封装工艺,将高带宽 DRAM 垂直集成于计算芯片上方,片上内存带宽理论值达1TB/s,较传统片外 DDR 方案提升约 10 倍。这一架构的核心价值在于:大模型推理时最耗时的"数据搬运"环节被极大压缩,NPU 无需等待数据就位,计算效率显著提升。
迅为RK182X系列目前提供(M.2模组)两款型号:
迅为RK1820/RK1828 (M.2模组)
两款型号峰值算力一致,DRAM 容量差异决定了可承载的模型规模上限。RK1820 面向轻量化部署,RK1828 面向 7B~8B 级多模态模型。
模型生态:40+ 主流模型完成适配
RK182X 算力卡已全面适配主流大语言模型、多模态模型、视觉模型与声音模型,覆盖端侧 AI 主要应用方向。以下是完整适配模型列表:
■ LLM 大语言模型
Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B、Qwen2.5-7B、Qwen3-0.6B、Qwen3-1.7B、Qwen3-4B、Qwen3-8B、HY-MT1.5-1.8B、Youtu-LLM-2B、GLM-Edge、Gemma4、Qwen3-Reranker-0.6B、Qwen3-Reranker-4B、Qwen3-Embedding-4B
■ VLM 多模态模型
Qwen2.5-VL-3B、Qwen2.5-VL-7B、Qwen2.5-Omni-3B (Thinker)、Qwen3-VL-2B、Qwen3-VL-4B、FastVLM-1.6B、InternVL3-2B、InternVL3.5-4B、MiMo-VL-7B-RL、SmoVLM、SmoVLM2、UI_TARS、PaddleOCR-VL、gme-Qwen2-VL-2B
■ CNN / 视觉模型
SigLIP、SigLIP2、MetaCLIP2、DINOv2、DINOv3、MobileNetV1、MobileNetV2、ResNet-50、YOLOv5、YOLOv6、YOLOv8、YOLO-World、Diffusion Policy
■ 声音模型
GROOT、VITS、Qwen3-ASR、Qwen3-TTS、Whisper、SenseVoice、Zipformer
上述模型均可在 RK182X 算力卡上完成端侧推理部署。迅为提供的预转换模型库覆盖其中主流模型,到手即可直接运行,完整列表见配套资料包。
配套资料:完整手册目录
适配工作不止于驱动层面的打通。迅为围绕 RK182X 算力卡编写了完整的《RK1820 / RK1828 算力卡开发与部署指南》,以下为手册目录:
| 第1章 前言 |
  1.1 大模型发展趋势 1.2 RK182X产品定位 1.3 瑞芯微AI发展历程与双轨战略 1.4 端侧大模型应用方向   |
| 第2章 RK182X算力卡概述 |
  2.1 3D堆叠技术 2.2 模组硬件   |
| 第3章 RK182X SDK 1.0.4资料介绍 |
  3.1 SDK架构与目录概览 3.2 SDK目录内容详解 3.2.1 NPU核心开发套件 3.2.2 官方文档和应用示例 3.3 SDK编译   |
| 第4章 搭建快速验证开发环境 |
  4.1 前提准备工作 4.2 硬件与软件清单置 4.3 固件安装 4.4 验证安装状态   |
| 第5章 模型推理测试 |
  5.1 预转换模型说明 5.2 CNN 模型测试 5.3 LLM 模型测试 5.4 性能模式调整 5.5 使用aicp自动化测试脚本   |
| 设备状态与调试 |
  6.1 rknn-smi 常用命令 6.2 rknn-console工具 6.3 多设备管理 6.4 温控策略   |
| 第7章rknn3-toolkit环境搭建和使用 |
  7.1 环境准备 7.2 rknn3-toolkit安装 7.2.1 直接安装 7.2.2 conda虚拟环境安装 7.3 模型转换 7.3.1 CNN模型转换 7.3.2 YOLOv5模型转换 7.3.3 LLM模型转换 7.4 连板推理   |
| 第8章 rknn3-toolkit-lite环境搭建和使用 |
  8.1 安装rknn3-toolkit-lite 8.1.1直接安装 8.1.2 conda 虚拟环境安装 8.2 mobilenet分类示例 8.3 Qwen2.5对话示例 8.4 Qwen3对话示例 8.5 Qwen2.5VL多模态示例 8.6 Qwen3VL多模态示例 8.7 Gemma4多模态示例   |
| 第9章 rknn3-model-zoo例程演示 |
  9.1目录结构与构建脚本 9.2 安装编译工具 9.2 模型下载和模型转换 9.3 安装板端RKNPU3环境 9.4 Python API推理 9.5 CAPI推理 9.6 自动化编译   |
从硬件安装到模型部署、从 Python 原型验证到 C API 生产集成、从单卡调试到多设备管理,手册覆盖了完整的开发流程。开发者拿到板卡后,按照手册章节顺序操作即可完成全流程验证。
为什么选择迅为方案
① 即插即用
M.2 标准接口直插,预编译安装包一键部署,1~2 分钟环境就绪。
② 资料全跑通
RKNN3 SDK V1.0.4 全流程验证,手册从硬件到高级应用全覆盖。
③ 预转换模型库
40+ 主流模型预转换文件,到手即可推理。
④ 持续更新
后续深度测试系列,每期附带完整教程与数据。
系列预告:后续测试内容
本次适配公告为系列内容的首篇。接下来,迅为将发布 RK182X 系列算力卡的深度测试文章,涵盖大模型对话、视觉识别、OCR 文字识别、多路并发、功耗散热等方向。