从单芯片到十万卡集群:奕行智能业界首个RISC-V AI算力超节点的破局和野望

科创之家 2026-07-27 19人围观
电子发烧友网报道(文/吴子鹏)2026世界 人工智能大会(W AIC)上,行业竞争已从单纯比拼芯片峰值算力参数,转向侧重大并行能力、能效表现与Token生成质量的算力集群综合较量。在此行业背景下,奕行智能推出具备重磅产业意义的成果——业界首个 RISC-V AI算力超节点正式对外发布。

奕行智能高级副总裁吕剑飞表示:“AI产业发展曲线正迎来关键转折点。行业从早期基础大模型预训练,到后训练微调技术广泛普及,再到2026年智能体(Agent)应用集中爆发,整体已全面进入以推理为核心的新阶段。这一阶段的算力需求不再一味追求训练场景的超大规模,而是对算力密度、互联时延、部署成本与综合能效提出了更为严苛的要求。奕行智能以 RISC-V为底层技术根基,依靠架构创新释放集群完整算力潜力,正在重构国产高端AI算力的产业演进范式。”

推理时代算力发展困局RISC-V集群的核心产业价值

传统服务器依靠“堆叠芯片、外接线缆”的横向扩展模式,弊端日益凸显:单颗芯片制程工艺逐步逼近物理极限,多卡互联带宽不足、数据传输时延居高不下,导致超大规模集群实际算力释放效率远低于纸面标称参数,规模化扩容的边际成本持续走高。行业已形成清晰共识:面向推理场景的最优算力方案,是通过系统级架构创新打造超节点体系,在同等单芯片硬件能力下,实现集群综合效能量级式提升。依据《超节点技术体系白皮书》测算,搭载相同芯片时,超节点架构的综合性能较传统服务器集群最高可提升12倍,这也是全行业布局Token工厂场景的核心技术路线。

与此同时,传统封闭指令集架构存在底层技术“卡脖子”隐患,无法满足算力基础设施自主可控的长期需求。开源开放、自主可控正是RISC-V最核心的特质,也是奕行智能坚定布局RISC-V高端算力赛道的底层逻辑。

不同于x86、 ARM等需获取商业授权才能使用的闭源指令集,RISC-V允许企业无限制自由使用、自主扩展指令,从根源规避底层指令授权受限风险。奕行智能在此基础上创新叠加VISA虚拟指令集,在开源硬件指令集上层搭建屏蔽底层芯片硬件差异的抽象适配层,真正实现软硬件解耦,达成“一次 编程、多芯片通用”的开发目标。

过往RISC-V技术已在中低端嵌入式设备验证了成熟生态,但云端高端AI算力领域长期缺少大规模集群落地案例。奕行智能本次发布的全栈式RISC-V AI算力超节点,首次打通AI加速芯片、RISC-V主控 CPU、高速交换网络全链路全国产化,填补高端AI智算集群的RISC-V产业化空白,既契合全球开源协同的产业趋势,也为国产自主算力搭建安全可控的底层技术底座。

超节点:绝非芯片简单堆砌,而是完整计算系统重构

奕行智能RISC-V AI算力超节点并非单一技术单点突破,而是算力芯片、高速互联架构、配套软件栈三方深度协同的系统性创新,硬件层至软件层形成完整闭环技术体系。

该超节点的核心算力底座为奕行智能自研Epoch云端AI芯片。芯片原生基于RISC-V开放指令集打造,业内率先原生支持分块量化FP8精度。核心创新点在于内置VISA虚拟指令集,完成软硬件解耦,可全面适配通用大模型、垂直行业模型的训练与推理全场景需求。下一代迭代芯片将完成核心架构升级,新增EXFP4、MXFP4等低位宽精度格式支持,同步大幅提升单芯片算力、片上存储容量与存储带宽,实现算力利用率、集群横向扩展能力双重跃升。

架构层面,传统超节点方案依赖大量外部线缆完成设备互联,带来硬件采购成本高、高速 信号衰减严重、现场部署运维复杂等痛点。奕行智能率先采用正交无背板架构,整套计算系统内部无任何外接线缆;计算托盘与交换托盘通过正交直连方式对接,互联硬件综合成本降低80%,信号完整性提升30%,芯片间数据传输时延稳定控制在百纳秒区间。单机柜可集成16层计算托盘,支持64至128张Epoch算力卡全对等Scale-Up直连互联,单位机柜计算密度较传统机架服务器提升4倍以上。单块计算托盘可搭载1-2颗国产CPU(含RISC-V主控CPU),是当前业内唯一全栈RISC-V超节点商用方案。

自研ELink高速互联是这套业界首个RISC-V AI算力超节点实现超大规模扩展的核心支撑。吕剑飞介绍,ELink单芯片互联带宽可达3.2T,一张CX7网卡是400G,一颗Epoch芯片就具备接入8张CX7网卡的 通信带宽,相当于一台普通 GPU服务器全部的计算网卡容量。依托该互联技术,单台RISC-V算力机柜聚合总带宽可达102.4TB/s,相较传统服务器提升百倍以上;单个PoD算力单元可容纳上万张算力卡,整体集群能够平滑扩容至十万卡规模,兼顾单机柜高密度本地算力、跨PoD横向无限扩展双重需求,支撑超大型智算集群灵活迭代、按需扩容。

整套超节点配套高密度液冷散热方案,机房整体PUE优化幅度达20%。方案整体具备高稳定、易部署、低运维成本等优势;依托标准化正交开放架构,超节点整机研发周期缩短75%,线上运行可靠性大幅提升。

EVACA软件栈:三层AI执行范式,大幅降低大模型落地门槛

硬件算力价值能否充分释放,高度依赖配套软件生态承接适配。奕行智能同步推出自研EVACA Tile原生软件栈,依托VISA虚拟指令集完成软硬件解耦,实现“一次编程、多芯通用”,显著提升模型迁移开发效率。

EVACA软件栈向上原生兼容PyTorch、vLLM、SGLang等主流AI开发框架,搭建由高性能算子库、Tile AI编译器、KernelFab算子智造中枢构成的三层递进式AI执行体系,打造兼顾当下业务落地与长期技术演进的完整布局。

高性能算子库覆盖上百种基础算子、融合算子、数据处理算子,充分保障主流大模型训练与推理的极致性能;依托专用Tile AI编译器,高效完成上层模型语义向硬件指令的转换,实现模型低成本快速迁移。

独创KernelFab算子智造中枢则基于Agent智能驱动, 工程师只需负责最终的需求Review(评审)与Sign-off(签发)。从需求下达开始,由Agent自动完成代码生成、自动上板运行、自动测量诊断,并基于真实硬件反馈进行闭环迭代优化。依托高度自动化的“算力智造流水线”,将传统耗时数周的算子定制开发周期压缩至单日级别,大幅降低大模型迁移适配的人力与时间成本,引领行业算子开发全新演进方向。

三年性能提升400倍:清晰的产品迭代路线与产业野望

奕行智能制定了行业内节奏激进、目标清晰的全栈迭代路线:芯片与超节点整机保持一年一代更新节奏,核心目标为三年内实现整套系统综合性能提升400倍。

具体产品迭代规划如下:

第一代超节点(现已量产):基于Epoch初代AI芯片、正交无背板整机架构、ELink高速互联、EVACA完整软件栈全栈方案,单柜支持64-128卡部署,完成系统级协同创新商用验证。

第二代超节点:升级单柜128卡超高密度架构,单个PoD算力单元最大支持16384卡部署,集群可扩展至十万卡规模,整套系统综合性能实现20倍提升。

第三代超节点:持续迭代芯片性能与集成度,完成全栈架构跨越式升级,系统综合性能再获大幅突破,达成三年400倍整体提升目标。

这条路线并非单纯依靠单芯片代际堆叠实现性能增长,核心逻辑是系统协同创新带来的乘数效应——整机架构革新、高速互联升级、软件栈深度优化、AI芯片迭代同步推进,每一代产品性能提升均是全链路各环节协同增益叠加的结果。吕剑飞表示:“我们每年都会推出综合性能提升20倍以上的新一代整机产品,三年累计实现400倍系统性能跃升。”

落地层面,全球首套全栈RISC-V万卡超节点AI Token工厂项目已进入落地实施阶段,一期工程计划2026年8月建成投用,建成后对外开放超节点整机测试、专业性能测评环境。整套方案面向互联网、运营商、金融、能源等重点行业客户,提供覆盖RISC-V AI大算力加速芯片、RISC-V主控CPU、高速交换网络、异构超节点整机的全链路全国产AI算力基础设施,推动RISC-V高端算力从实验室原型走向大规模产业商用。

生态共建也是奕行智能长期核心布局方向。RISC-V技术的长期生命力根植于开源社区生态,奕行智能将持续依托全球RISC-V开源社区资源迭代芯片与超节点核心产品,联合产业链上下游合作伙伴完善全栈算力软硬件生态,推动RISC-V架构在云端高端AI算力领域建立统一行业标准、实现规模化普及。

结语

奕行智能在2026世界人工智能大会发布的不只是一款硬件产品,而是一套全新国产AI算力基础设施发展范式。从底层RISC-V开放指令集到上层VISA虚拟指令适配层,从Epoch自研AI芯片到正交无背板整机架构,从ELink超高速互联到EVACA三层软件执行范式,从单机柜128卡高密度部署到十万卡超大型集群扩展——全链条各环节并非对现有海外算力方案的简单替代,而是对下一代AI算力基础设施标准的重新定义。

当行业多数企业仍聚焦“国产替代”时,奕行智能已转向探索“国产定义”:什么样的指令集架构能够兼顾底层开放与产业安全?何种整机架构能让百纳秒级低时延互联成为行业标配?什么样的原生软件栈可依靠AI智能体自动完成算子开发?怎样的全栈迭代节奏,能够在三年内实现整套算力系统400倍性能跨越?

正如吕剑飞所言:“关注奕行智能,就是关注中国RISC-V发展的答案。”

  • 随机文章
  • 热门文章
  • 热评文章
不容错过
Powered By Z-BlogPHP