9月11-13日,2026中国算力大会于河北廊坊举办。由中移(苏州)软件技术有限公司联合中国电子科技南湖研究院、北京灵汐科技有限公司、上海天数智芯半导体股份有限公司、中国移动通信集团江苏有限公司、清华大学、北京大学共同研发的基于国产GPU 类脑芯片的大模型异构混合推理系统,在本届大会“算力首创首发发布会”完成全球首次公开亮相。该成果是清华大学孵化的灵汐科技在云侧大模型极致推理方向的重要落地实践,利用我国在类脑芯片方面的优势为智能体时代大模型推理提供国产化异构全新解决方案。

当前,AI智能体、长上下文大模型、文生视频等业务快速普及,Token生成规模持续暴涨。传统纯GPU推理集群长期受“内存墙”“调度抖动”约束,在长上下文推理场景下,面临首Token延迟高、算力利用率不足、功耗与部署成本居高不下等现实痛点,难以满足智能体时代高并发、低时延推理的规模化落地需求。面向国产算力自主可控的时代要求,项目团队探索架构创新,融合国产通用GPU与灵汐科技类脑芯片各自技术优势,利用我国在类脑计算芯片的优势在相对落后工艺基础上打造国内对标国外主流GPU下一代国际先进的Vera Rubin with Groq异构推理方案的国产化系统。
该异构混合推理系统将基于Transformer结构的大模型进行PD A拆分,创新性的将不同模块有序的部署在GPU 类脑异构算力系统。其中,Prefill阶段及Attention计算模块交由国产GPU承载,FFN(MOE专家)延时敏感模块交由类脑芯片处理

Token工厂、AI代码生成、多智能体协同、智能制造金融、安防、通信等安全敏感行业,提供全栈国产化推理底座

不依赖海外高端芯片与先进制程,依靠系统架构创新实现与国际顶尖异构推理架构对标的能力
免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有疑问请发送邮件至:bangqikeconnect@gmail.com