最新动态

  • Home
  • 端侧AI撞上「内存墙」,瑞芯微提前做对了什么?

端侧AI撞上「内存墙」,瑞芯微提前做对了什么?

2026-09-09 8580

芯片只是入口,生态和交付, 才是那道更深的护城河。 2026年夏天,一组来自AI产业链不同玩家的信号,把“内存墙”推向AI芯片讨论的中心。 6月,应用材料在讨论AI内存时判断,随着AI从一次性问答走向多步骤Agent工作流,数据搬运正在成为与计算能力同样重要的系统瓶颈。在同月举行的VLSI 2026上,英伟达杰出研究科学家Mahmut Ersin Sinangil对此作了更直观的解释:“计算极其重要,但我们需要用数据来‘喂饱’它。” 很快,这一判断开始进入架构和产品层面。6月24日,高通公布面向数据中心AI推理的HBC近存计算路线,计划将部分计算放到更靠近内存的位置。8月底,苹果发布拥有1.2TB/s统一内存带宽的M5 Ultra;英伟达公布Jetson Orin Nano 2时,也将更高内存带宽列为其推理性能提升的来源之一。 从数据中心的加速卡,到桌面计算和机器人,这些产品切入的市场不同,形态也差异明显,但却释放出相近的信号:大模型进入持续推理阶段后,实际性能越来越取决于数据能否及时、低成本地送到计算单元。只增加TOPS,很难自动换来更快、更稳定的模型体验。 当近存计算在2026年夏天逐渐形成产业共识时,瑞芯微已经先行一年。 2025年7月,瑞芯微发布面向端侧大模型推理的AI协处理器RK182X,并随后进入量产。这颗芯片围绕AI推理重新设计了内部数据通路和存储系统,使计算更靠近数据,同时以独立协处理器承载AI推理所需的主要算力和内存资源,形成“SoC+AI协处理器”的双轨架构。 一年后,围绕存储与计算紧密结合的端侧方案陆续出现,而RK182X已进入电视、机器人和边缘设备。这块比拇指还小的芯片,回答的是一个更大的产业命题:当AI成为终端里变化最快的一层能力,计算、存储与主控之间的关系该如何重新设计? 大模型走进终端, 芯片为何先撞上了“内存墙”? 把时间拨回2025年,瑞芯微的提前落子,恰好对应着端侧AI的一场变化。 一个最直接的体感是,可在本地部署的模型变得更强了。过去两年,参数规模从数十亿到数百亿不等的开源模型在能力和部署效率上同时提升,让更多任务可以在本地完成。对话、视觉问答、本地知识库和工具调用也陆续跨过了“能用”门槛,开始被纳入终端厂商的设计环节。 进入到实际应用,模型需要处理的任务也逐渐超出一次问答。多模态让一台设备可以同时听、看、说,Agent还需要根据用户目标调用工具、执行任务。端侧AI由此从一个偶尔被唤醒的功能,慢慢变成一种需要长期在线的系统能力。 与之对应的,是AIoT客户衡量一套方案的标准也在变化。正如瑞芯微AI生态负责人观察到的,客户关注的重点正从模型能否运行,转向它能否稳定地成为终端产品的一项日常功能。 做电视、机器人、座舱和NAS的厂商,过去问的是“板子上能不能跑起一个模型”,现在追问的是——交互能否达到自然对话般的流畅度、断网或弱网时还能不能工作、隐私数据能不能留在本地,以及加了AI之后会不会拖慢原本的显示、视频和控制。 AI能力要成为能写进说明书的正式功能——这是端侧AI最直接的产品拐点。用瑞芯微AI生态负责人的话说,跨过某个速度阈值之后,本地AI才算真正从“能演示”变成了“愿意天天用”。 但当大模型开始常驻本地,原有SoC开始面临新的资源压力。 在许多传统SoC中,操作系统、显示、视频和AI计算共享外部内存资源。但是当大模型进入终端后,逐Token解码需要反复读取模型权重,长上下文还会让KV Cache的访问量水涨船高。Agent带来的连续调用,又把推理任务的活跃时间进一步拉长。 这意味着,TOPS只能反映芯片的峰值算力,无法单独代表大模型的实际表现。带宽不足时,计算单元难以充分发挥性能,继续提高TOPS也未必能直接换来生成速度的提升;如果资源调度不当,还可能影响显示、视频等原有功能。 在瑞芯微AI生态负责人看来,“端侧大模型的第一道坎,往往在于数据能否及时送到计算单元。只有算力与数据访问能力相匹配,峰值算力才能转化为实际推理速度。” 云端已经用HBM和高速互联证明,算力提升必须同步解决数据供给。到了终端,解决同样的问题还要面对更严格的功耗、成本和空间限制。如何在这些限制下让大模型稳定运行,成为端侧AI芯片必须回答的架构问题。 近存计算渐成共识, 瑞芯微提前一年推出RK182X 进入2026年,通过拉近存储与计算的距离来缓解“内存墙”,正成为端侧AI芯片的一条越来越明确的技术方向。 4月,SK海力士在台积电北美技术研讨会上提出将内存垂直堆叠在SoC等逻辑芯片之上,并将端侧AI列为适用场景之一;进入下半年,国内多家芯片厂商也开始沿着堆叠近存方向布局,面向端侧大模型推理。这些方案所处的产品阶段和具体实现各有侧重,但核心目标都是缩短数据搬运路径、降低搬运开销。 在这条技术方向受到更多厂商关注之前,瑞

about image

发表评论